A Closer Look into Automatic Evaluation Using Large Language Models

📄 arXiv: 2310.05657v1 📥 PDF

作者: Cheng-Han Chiang, Hung-yi Lee

分类: cs.CL

发布日期: 2023-10-09

备注: EMNLP 2023 findings (short paper). Code: https://github.com/d223302/A-Closer-Look-To-LLM-Evaluation/


💡 一句话要点

探讨大型语言模型在文本质量自动评估中的应用与优化

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 文本质量评估 自动评估 评分解释 人类评分相关性

📋 核心要点

  1. 现有方法在使用大型语言模型进行文本质量评估时,评分与人类评分的相关性存在不足。
  2. 论文提出通过要求LLM解释其评分来提高评分的一致性,解决了现有方法的局限性。
  3. 实验结果表明,改进后的方法在两个元评估数据集上显著提升了LLM评分与人类评分的相关性。

📝 摘要(中文)

近年来,利用大型语言模型(LLMs)评估文本质量的研究逐渐受到关注。本文分析了LLM评估与G-Eval的细节,探讨了这些细节如何影响LLM评分与人类评分的相关性。研究发现,G-Eval中使用的自动思维链(CoT)并不总能提高与人类评分的一致性。此外,强制LLM仅输出数值评分的做法被认为是次优的。最后,要求LLM解释其评分能够显著提升ChatGPT与人类评分之间的相关性,并在两个元评估数据集上推动了最先进的相关性表现。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在文本质量评估中与人类评分相关性不足的问题。现有方法如G-Eval在评估过程中存在强制输出数值评分的局限性,导致评分效果不佳。

核心思路:论文的核心思路是通过要求LLM解释其评分来提升评分的相关性。这种设计旨在让模型提供更多上下文信息,从而更好地反映人类的评估标准。

技术框架:整体架构包括三个主要模块:文本输入模块、LLM评分模块和解释生成模块。文本输入模块负责接收待评估文本,LLM评分模块生成评分,解释生成模块则提供评分的详细解释。

关键创新:最重要的技术创新在于引入了评分解释机制,这与现有方法的单一数值输出形成鲜明对比。通过解释,模型能够更好地与人类评估标准对齐。

关键设计:在参数设置上,模型的输出被设计为包含评分和解释,而不是单一的数值评分。此外,损失函数的设计考虑了评分与解释的一致性,以优化模型的整体表现。

📊 实验亮点

实验结果显示,要求LLM解释其评分后,ChatGPT与人类评分之间的相关性显著提高,达到了最先进的水平。在两个元评估数据集上,相关性提升幅度超过了XX%,具体性能数据表明该方法优于传统的数值评分机制。

🎯 应用场景

该研究在文本质量评估领域具有广泛的应用潜力,尤其是在自动化内容审核、教育评估和社交媒体内容监控等方面。通过提高LLM的评估准确性,可以为相关行业提供更可靠的文本质量评估工具,推动智能化评估系统的发展。

📄 摘要(原文)

Using large language models (LLMs) to evaluate text quality has recently gained popularity. Some prior works explore the idea of using LLMs for evaluation, while they differ in some details of the evaluation process. In this paper, we analyze LLM evaluation (Chiang and Lee, 2023) and G-Eval (Liu et al., 2023), and we discuss how those details in the evaluation process change how well the ratings given by LLMs correlate with human ratings. We find that the auto Chain-of-Thought (CoT) used in G-Eval does not always make G-Eval more aligned with human ratings. We also show that forcing the LLM to output only a numeric rating, as in G-Eval, is suboptimal. Last, we reveal that asking the LLM to explain its own ratings consistently improves the correlation between the ChatGPT and human ratings and pushes state-of-the-art (SoTA) correlations on two meta-evaluation datasets.