Which Examples to Annotate for In-Context Learning? Towards Effective and Efficient Selection
作者: Costas Mavromatis, Balasubramaniam Srinivasan, Zhengyuan Shen, Jiani Zhang, Huzefa Rangwala, Christos Faloutsos, George Karypis
分类: cs.CL
发布日期: 2023-10-30
💡 一句话要点
提出AdaICL以解决有限预算下的示例选择问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 主动学习 上下文学习 示例选择 语言模型 预算效率 不确定性采样 多样性采样
📋 核心要点
- 现有方法在有限预算下进行示例标注时,难以平衡标注效率与模型学习效果。
- 论文提出的AdaICL算法通过不确定性和多样性采样,优化示例选择过程,提高了学习效率。
- 实验结果显示,AdaICL在多个数据集上表现优异,准确率提升4.4%,且预算效率显著提高。
📝 摘要(中文)
大型语言模型(LLMs)可以通过上下文学习(ICL)适应新任务。ICL的高效性在于它不需要对训练好的LLM进行参数更新,仅需少量标注示例作为输入。本文研究了一种主动学习方法,提出了一种名为AdaICL的模型自适应优化无关算法,旨在识别模型不确定的示例,并基于语义多样性进行示例选择。多样性采样提高了整体有效性,而不确定性采样则提高了预算效率并帮助LLM学习新信息。此外,AdaICL将其采样策略视为最大覆盖问题,能够根据模型反馈动态调整,并可通过贪心算法近似求解。大量实验表明,AdaICL在九个数据集和七个LLM上相较于最先进技术提高了4.4%的准确率,预算效率是随机标注的三倍,同时在ICL示例数量上减少了两倍。
🔬 方法详解
问题定义:本文旨在解决在有限预算下如何有效选择标注示例的问题。现有方法往往无法有效利用有限的标注资源,导致模型性能提升有限。
核心思路:论文提出的AdaICL算法通过结合不确定性采样和语义多样性采样,优化了示例选择过程。通过识别模型的不确定性,AdaICL能够选择出对模型学习最有帮助的示例。
技术框架:AdaICL的整体架构包括示例选择模块和反馈调整模块。示例选择模块基于模型的不确定性和多样性进行示例筛选,而反馈调整模块则根据模型的学习效果动态调整选择策略。
关键创新:AdaICL的最大创新在于将示例选择问题建模为最大覆盖问题,并通过贪心算法进行近似求解。这一方法与传统的随机选择或固定策略有本质区别,能够更有效地利用有限的标注预算。
关键设计:在实现中,AdaICL采用了特定的损失函数来衡量模型的不确定性,并设计了多样性度量标准,以确保所选示例的语义覆盖面广泛。
🖼️ 关键图片
📊 实验亮点
实验结果表明,AdaICL在九个数据集上相较于最先进技术提高了4.4%的准确率,达到了7.7%的相对提升。同时,AdaICL在预算效率上是随机标注的三倍,并且在ICL示例数量上减少了两倍,显示出其显著的优势。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、机器翻译和对话系统等。通过优化示例选择,AdaICL能够在资源有限的情况下提高模型的学习效率,具有重要的实际价值和广泛的应用前景。未来,该方法可能在更多领域中推广,进一步推动智能系统的进步。
📄 摘要(原文)
Large Language Models (LLMs) can adapt to new tasks via in-context learning (ICL). ICL is efficient as it does not require any parameter updates to the trained LLM, but only few annotated examples as input for the LLM. In this work, we investigate an active learning approach for ICL, where there is a limited budget for annotating examples. We propose a model-adaptive optimization-free algorithm, termed AdaICL, which identifies examples that the model is uncertain about, and performs semantic diversity-based example selection. Diversity-based sampling improves overall effectiveness, while uncertainty sampling improves budget efficiency and helps the LLM learn new information. Moreover, AdaICL poses its sampling strategy as a Maximum Coverage problem, that dynamically adapts based on the model's feedback and can be approximately solved via greedy algorithms. Extensive experiments on nine datasets and seven LLMs show that AdaICL improves performance by 4.4% accuracy points over SOTA (7.7% relative improvement), is up to 3x more budget-efficient than performing annotations uniformly at random, while it outperforms SOTA with 2x fewer ICL examples.