Ecologically Valid Explanations for Label Variation in NLI

📄 arXiv: 2310.13850v1 📥 PDF

作者: Nan-Jiang Jiang, Chenhao Tan, Marie-Catherine de Marneffe

分类: cs.CL

发布日期: 2023-10-20

备注: Findings at EMNLP 2023. Overlap with previous version arXiv:2304.12443


💡 一句话要点

构建LiveNLI数据集以揭示NLI标签变异的生态有效解释

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自然语言推理 标签变异 注释不一致 生态有效解释 大型语言模型

📋 核心要点

  1. 核心问题:现有自然语言推理任务中,标签变异和注释不一致现象普遍存在,导致理解困难。
  2. 方法要点:本文提出LiveNLI数据集,通过生态有效的解释揭示NLI标签变异的来源,强调解释在标签理解中的重要性。
  3. 实验或效果:实验表明,注释者在选择标签时存在系统性差异,且大型语言模型生成的解释效果不一,需进一步改进。

📝 摘要(中文)

人类标签变异或注释不一致在许多自然语言处理任务中普遍存在,包括自然语言推理(NLI)。为直接证实NLI标签变异的来源,本文构建了LiveNLI,一个包含1,415个生态有效解释的英语数据集(注释者解释他们选择的NLI标签),涵盖122个MNLI项目(每个项目至少10个解释)。LiveNLI的解释确认了人们在理解上的系统性差异,并突出了标签内变异:注释者有时因不同原因选择相同标签。这表明解释在导航标签解释中至关重要。我们对大型语言模型进行少量提示以生成解释,但结果不一致:有时生成有效且信息丰富的解释,但也生成不合理的解释,未能支持标签,突显了改进方向。

🔬 方法详解

问题定义:本文旨在解决自然语言推理(NLI)任务中标签变异和注释不一致的问题。现有方法未能充分揭示人类在标签选择过程中的多样性和复杂性。

核心思路:通过构建LiveNLI数据集,收集注释者对NLI标签的生态有效解释,旨在揭示标签变异的根本原因,并强调解释在理解标签时的重要性。

技术框架:整体架构包括数据收集、注释者解释生成和分析三个主要模块。首先,收集122个MNLI项目的注释者解释;其次,分析这些解释以识别标签选择的多样性;最后,利用大型语言模型生成解释并进行评估。

关键创新:最重要的技术创新在于通过生态有效的解释揭示了NLI标签的内在变异性,强调了注释者在标签选择过程中的系统性差异,这在现有研究中尚属首次。

关键设计:在数据收集过程中,确保每个MNLI项目至少有10个解释,以保证数据的多样性和代表性。同时,针对大型语言模型的提示设计需考虑生成解释的有效性和合理性,以提高生成结果的质量。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,LiveNLI数据集提供了1,415个生态有效的解释,揭示了注释者在标签选择上的系统性差异。尽管大型语言模型在生成解释时表现出一定的有效性,但也存在生成不合理解释的情况,提示未来改进的方向。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理中的标签理解、注释系统的设计以及人机交互中的解释生成。通过深入理解标签变异,研究者可以改进NLI模型的训练和评估方法,提升模型的可解释性和可靠性,未来可能对智能助手和对话系统的设计产生积极影响。

📄 摘要(原文)

Human label variation, or annotation disagreement, exists in many natural language processing (NLP) tasks, including natural language inference (NLI). To gain direct evidence of how NLI label variation arises, we build LiveNLI, an English dataset of 1,415 ecologically valid explanations (annotators explain the NLI labels they chose) for 122 MNLI items (at least 10 explanations per item). The LiveNLI explanations confirm that people can systematically vary on their interpretation and highlight within-label variation: annotators sometimes choose the same label for different reasons. This suggests that explanations are crucial for navigating label interpretations in general. We few-shot prompt large language models to generate explanations but the results are inconsistent: they sometimes produces valid and informative explanations, but it also generates implausible ones that do not support the label, highlighting directions for improvement.