CoAnnotating: Uncertainty-Guided Work Allocation between Human and Large Language Models for Data Annotation

📄 arXiv: 2310.15638v1 📥 PDF

作者: Minzhi Li, Taiwei Shi, Caleb Ziems, Min-Yen Kan, Nancy F. Chen, Zhengyuan Liu, Diyi Yang

分类: cs.CL

发布日期: 2023-10-24

DOI: 10.18653/v1/2023.emnlp-main.92

🔗 代码/项目: GITHUB


💡 一句话要点

提出CoAnnotating以解决人类与大语言模型协同标注问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 数据标注 人机协作 不确定性评估 自然语言处理

📋 核心要点

  1. 现有方法未充分利用大语言模型(LLMs)作为补充标注者,导致标注效率和质量不足。
  2. 论文提出CoAnnotating框架,通过不确定性评估LLMs的标注能力,实现人类与LLMs的协同标注。
  3. 实证研究表明,CoAnnotating在不同数据集上工作分配效果显著,性能提升可达21%。

📝 摘要(中文)

标注数据在自然语言处理(NLP)中至关重要,用于训练模型和评估其性能。随着大语言模型(LLMs)的发展,如ChatGPT在许多文本标注任务中展现出零-shot能力,甚至超越人类标注者。这些LLMs可以作为手动标注的替代方案,因其成本低且可扩展性高。然而,现有研究未充分利用LLMs作为补充标注者,也未探讨如何在确保质量和成本目标的前提下,合理分配人类与LLMs的标注工作。我们提出了CoAnnotating,一个用于大规模非结构化文本的人类-LLM协同标注的新范式。通过该框架,我们利用不确定性来评估LLMs的标注能力。实证研究表明,CoAnnotating在不同数据集上的工作分配效果显著,性能提升可达21%。

🔬 方法详解

问题定义:本论文旨在解决如何有效分配人类与大语言模型(LLMs)之间的标注工作,以提高标注质量和降低成本。现有方法未能充分利用LLMs的潜力,导致标注效率低下。

核心思路:论文的核心思路是利用不确定性来评估LLMs的标注能力,从而合理分配标注任务。通过这种方式,可以在保证标注质量的同时,降低人工成本。

技术框架:CoAnnotating框架包括多个模块:首先,通过不确定性评估LLMs的标注能力;其次,根据评估结果分配任务给人类或LLMs;最后,整合两者的标注结果以提高整体标注质量。

关键创新:本研究的关键创新在于引入不确定性作为评估LLMs标注能力的标准,这一方法与传统的标注方式有本质区别,能够更有效地利用LLMs的优势。

关键设计:在设计中,论文考虑了不确定性阈值的设定,以决定何时将任务分配给人类或LLMs。此外,损失函数的选择也经过精心设计,以优化标注质量和成本之间的平衡。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,CoAnnotating在不同数据集上的性能提升可达21%,相较于随机基线表现出显著优势。这一结果表明,合理的工作分配策略能够有效提高标注质量,充分发挥人类与LLMs的协同作用。

🎯 应用场景

该研究的潜在应用领域包括大规模文本数据的自动标注、社交媒体内容分析、客户反馈处理等。通过提高标注效率和质量,CoAnnotating可以显著降低人工成本,推动NLP领域的进一步发展,具有重要的实际价值和未来影响。

📄 摘要(原文)

Annotated data plays a critical role in Natural Language Processing (NLP) in training models and evaluating their performance. Given recent developments in Large Language Models (LLMs), models such as ChatGPT demonstrate zero-shot capability on many text-annotation tasks, comparable with or even exceeding human annotators. Such LLMs can serve as alternatives for manual annotation, due to lower costs and higher scalability. However, limited work has leveraged LLMs as complementary annotators, nor explored how annotation work is best allocated among humans and LLMs to achieve both quality and cost objectives. We propose CoAnnotating, a novel paradigm for Human-LLM co-annotation of unstructured texts at scale. Under this framework, we utilize uncertainty to estimate LLMs' annotation capability. Our empirical study shows CoAnnotating to be an effective means to allocate work from results on different datasets, with up to 21% performance improvement over random baseline. For code implementation, see https://github.com/SALT-NLP/CoAnnotating.