GPT-4 as an Effective Zero-Shot Evaluator for Scientific Figure Captions

📄 arXiv: 2310.15405v1 📥 PDF

作者: Ting-Yao Hsu, Chieh-Yang Huang, Ryan Rossi, Sungchul Kim, C. Lee Giles, Ting-Hao K. Huang

分类: cs.CL

发布日期: 2023-10-23

备注: To Appear in EMNLP 2023 Findings


💡 一句话要点

利用GPT-4作为有效的零-shot评估器评估科学图形标题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 科学图形评估 大型语言模型 零-shot学习 自动评估 机器学习

📋 核心要点

  1. 现有的科学图形标题评估方法面临高成本和低质量的问题,人工评估需要专业知识,自动评估依赖于不可靠的作者标题。
  2. 本文提出利用大型语言模型(如GPT-4)作为零-shot评估器,提供一种无参考的经济高效评估方法。
  3. 实验结果表明,GPT-4在评估科学图形标题的能力上优于其他模型,并且其表现超过了本科生的评估结果。

📝 摘要(中文)

随着对科学图形标题生成系统的关注增加,评估这些系统输出的质量成为一大挑战。人工评估需要专业知识且成本高昂,而自动评估往往依赖于质量较低的作者撰写标题。本文探讨了使用大型语言模型(LLMs)作为一种经济高效、无参考的方法来评估图形标题。我们首先构建了SCICAP-EVAL数据集,包含3600个科学图形标题的人类评判,涵盖600个arXiv图形。随后,我们使用GPT-4和GPT-3等LLMs对每个标题进行评分(1-6),评估其在相关上下文下帮助读者理解的潜力。结果显示,作为零-shot评估器的GPT-4超越了所有其他模型,甚至超过了计算机科学和信息学本科生的评估,与博士生排名的Kendall相关性得分达到0.401。

🔬 方法详解

问题定义:本文旨在解决科学图形标题评估的挑战,现有方法依赖于高成本的人工评估或低质量的自动评估,导致评估结果的不可靠性。

核心思路:论文提出使用大型语言模型(LLMs)作为零-shot评估器,利用其强大的语言理解能力来评估图形标题的质量,而无需参考标准。

技术框架:整体流程包括构建SCICAP-EVAL数据集、使用GPT-4和GPT-3对标题进行评分,并结合相关上下文信息(如图形提及段落)进行评估。

关键创新:最重要的创新在于将大型语言模型应用于科学图形标题的评估,提供了一种新的、无参考的评估方式,与传统方法相比,显著提高了评估的准确性和效率。

关键设计:在模型评分过程中,设置了评分范围(1-6),并考虑了上下文信息的影响,以确保评估结果的可靠性和有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,GPT-4作为零-shot评估器的表现超越了所有其他模型,Kendall相关性得分达到0.401,明显高于本科生的评估结果,展示了其在科学图形标题评估中的有效性和优势。

🎯 应用场景

该研究的潜在应用领域包括科学出版、学术研究和教育等,能够为科学图形标题的自动生成和评估提供有效支持,降低评估成本,提高评估效率,促进科学传播和理解。

📄 摘要(原文)

There is growing interest in systems that generate captions for scientific figures. However, assessing these systems output poses a significant challenge. Human evaluation requires academic expertise and is costly, while automatic evaluation depends on often low-quality author-written captions. This paper investigates using large language models (LLMs) as a cost-effective, reference-free method for evaluating figure captions. We first constructed SCICAP-EVAL, a human evaluation dataset that contains human judgments for 3,600 scientific figure captions, both original and machine-made, for 600 arXiv figures. We then prompted LLMs like GPT-4 and GPT-3 to score (1-6) each caption based on its potential to aid reader understanding, given relevant context such as figure-mentioning paragraphs. Results show that GPT-4, used as a zero-shot evaluator, outperformed all other models and even surpassed assessments made by Computer Science and Informatics undergraduates, achieving a Kendall correlation score of 0.401 with Ph.D. students rankings