Interpretable-by-Design Text Understanding with Iteratively Generated Concept Bottleneck

📄 arXiv: 2310.19660v2 📥 PDF

作者: Josh Magnus Ludan, Qing Lyu, Yue Yang, Liam Dugan, Mark Yatskar, Chris Callison-Burch

分类: cs.CL

发布日期: 2023-10-30 (更新: 2024-04-03)


💡 一句话要点

提出可解释的文本理解框架以解决黑箱模型问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 文本分类 可解释性 深度学习 大型语言模型 概念瓶颈 高风险领域 模型透明性

📋 核心要点

  1. 现有的黑箱深度学习模型在文本分类任务中缺乏可解释性,限制了其在高风险领域的应用。
  2. 本文提出了文本瓶颈模型(TBM),通过预测显著概念的类别值来实现内在可解释的文本分类。
  3. 实验结果显示,TBM在多个数据集上表现出色,能够与先进的黑箱模型相媲美,同时提供高质量的可解释性。

📝 摘要(中文)

黑箱深度神经网络在文本分类中表现出色,但由于缺乏可解释性,其在高风险领域的应用受到限制。为此,本文提出了文本瓶颈模型(TBM),这是一个内在可解释的文本分类框架,能够提供全局和局部解释。TBM通过预测一组稀疏的显著概念的类别值,而不是直接预测输出标签,并在这些概念值上使用线性层生成最终预测。这些概念可以通过大型语言模型(LLM)自动发现和测量,无需人工策划。在12个多样的文本理解数据集上的实验表明,TBM的性能可以与黑箱基线(如少量样本的GPT-4和微调的DeBERTa)相媲美,但在与微调的GPT-3.5的比较中表现稍逊。全面的人类评估验证了TBM能够生成与任务相关的高质量概念,并且概念测量与人类判断高度一致,表明TBM的预测是可解释的。总体而言,研究结果表明TBM是一个有前景的新框架,能够在保持性能的同时增强可解释性。

🔬 方法详解

问题定义:本文旨在解决黑箱深度学习模型在文本分类中的可解释性不足问题。现有方法往往无法提供透明的决策过程,限制了其在高风险领域的应用。

核心思路:TBM通过预测一组稀疏的显著概念的类别值,而不是直接输出标签,从而实现可解释性。该方法利用大型语言模型自动发现和测量概念,避免了人工干预。

技术框架:TBM的整体架构包括概念生成模块和线性预测层。首先,利用LLM生成显著概念,然后通过线性层将这些概念值映射到最终的分类标签。

关键创新:TBM的主要创新在于其内在的可解释性设计,通过概念瓶颈的方式使得模型的决策过程透明,显著区别于传统的黑箱模型。

关键设计:TBM的设计包括概念的自动生成和测量,使用的损失函数能够有效优化概念的选择与分类精度,同时保持模型的可解释性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,TBM在12个文本理解数据集上的表现与少量样本的GPT-4和微调的DeBERTa相当,尽管在与微调的GPT-3.5的比较中略显不足。人类评估结果显示,TBM生成的概念与任务高度相关,且概念测量与人类判断一致性良好,表明其可解释性强。

🎯 应用场景

该研究的潜在应用领域包括医疗文本分析、法律文书处理和金融风险评估等高风险场景。在这些领域,模型的可解释性至关重要,TBM能够提供透明的决策依据,帮助专业人员理解模型的判断,从而提升信任度和安全性。

📄 摘要(原文)

Black-box deep neural networks excel in text classification, yet their application in high-stakes domains is hindered by their lack of interpretability. To address this, we propose Text Bottleneck Models (TBM), an intrinsically interpretable text classification framework that offers both global and local explanations. Rather than directly predicting the output label, TBM predicts categorical values for a sparse set of salient concepts and uses a linear layer over those concept values to produce the final prediction. These concepts can be automatically discovered and measured by a Large Language Model (LLM) without the need for human curation. Experiments on 12 diverse text understanding datasets demonstrate that TBM can rival the performance of black-box baselines such as few-shot GPT-4 and finetuned DeBERTa while falling short against finetuned GPT-3.5. Comprehensive human evaluation validates that TBM can generate high-quality concepts relevant to the task, and the concept measurement aligns well with human judgments, suggesting that the predictions made by TBMs are interpretable. Overall, our findings suggest that TBM is a promising new framework that enhances interpretability with minimal performance tradeoffs.