The Eval4NLP 2023 Shared Task on Prompting Large Language Models as Explainable Metrics
作者: Christoph Leiter, Juri Opitz, Daniel Deutsch, Yang Gao, Rotem Dror, Steffen Eger
分类: cs.CL
发布日期: 2023-10-30
💡 一句话要点
提出Eval4NLP 2023共享任务以评估大语言模型的可解释性指标
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大语言模型 文本生成 机器翻译 摘要生成 可解释性评估 无参考指标 提示学习
📋 核心要点
- 现有的文本生成任务评估方法依赖于参考标准,缺乏灵活性和可解释性。
- 本文提出Eval4NLP 2023共享任务,聚焦于通过提示来评估机器翻译和摘要生成的质量。
- 实验结果显示,最佳系统的表现与最新的参考无关指标相当,甚至有所超越,验证了新方法的有效性。
📝 摘要(中文)
随着参数和预训练数据的增加,生成性大语言模型(LLMs)在解决任务时展现出卓越的能力,尤其是在文本生成任务中作为评估指标的应用。本文介绍了Eval4NLP 2023共享任务,旨在探索机器翻译(MT)和摘要评估中的提示和评分提取。我们提出了一种新颖的竞赛设置,限制参与者使用特定的LLMs并禁止微调,以确保聚焦于提示的研究。尽管存在这些限制,表现最佳的系统在性能上与最近开发的参考无关指标相当,甚至超越了它们。此外,我们还进行了小规模的人类评估,以验证LLMs所给解释的合理性。
🔬 方法详解
问题定义:本文旨在解决现有文本生成任务评估方法的局限性,尤其是对参考标准的依赖性和缺乏可解释性的问题。现有方法往往无法灵活适应不同任务,且难以提供清晰的评估依据。
核心思路:我们提出了一种新的竞赛设置,要求参与者使用特定的LLMs进行提示,而不允许微调,从而确保研究的重点在于提示的有效性和可解释性。
技术框架:整体架构包括任务定义、参与者提交的模型评估和结果分析。任务分为机器翻译和摘要生成两个部分,使用新的无参考测试集进行评估。
关键创新:最重要的创新在于通过限制微调,促使参与者探索提示的潜力,进而提高评估的可解释性和灵活性。这种方法与传统依赖于微调的评估方法本质上不同。
关键设计:在设计中,我们选择了一系列允许的LLMs,并制定了明确的评估标准。实验中使用的损失函数和评价指标经过精心设计,以确保结果的可靠性和有效性。我们还进行了小规模的人类评估,以验证LLMs的输出解释的合理性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,最佳系统的表现与最新的参考无关指标(如GEMBA和Comet-Kiwi-XXL)相当,甚至在某些情况下超越了这些指标。这一发现验证了通过提示进行评估的有效性,展示了新方法在实际应用中的潜力。
🎯 应用场景
该研究的潜在应用领域包括机器翻译、文本摘要和其他自然语言处理任务的评估。通过提供一种新的评估框架,研究可以帮助开发更灵活和可解释的评估指标,推动相关领域的进步。未来,该方法可能会影响如何设计和评估语言模型的性能,促进更广泛的应用。
📄 摘要(原文)
With an increasing number of parameters and pre-training data, generative large language models (LLMs) have shown remarkable capabilities to solve tasks with minimal or no task-related examples. Notably, LLMs have been successfully employed as evaluation metrics in text generation tasks. Within this context, we introduce the Eval4NLP 2023 shared task that asks participants to explore prompting and score extraction for machine translation (MT) and summarization evaluation. Specifically, we propose a novel competition setting in which we select a list of allowed LLMs and disallow fine-tuning to ensure a focus on prompting. We present an overview of participants' approaches and evaluate them on a new reference-free test set spanning three language pairs for MT and a summarization dataset. Notably, despite the task's restrictions, the best-performing systems achieve results on par with or even surpassing recent reference-free metrics developed using larger models, including GEMBA and Comet-Kiwi-XXL. Finally, as a separate track, we perform a small-scale human evaluation of the plausibility of explanations given by the LLMs.