Improving Automatic VQA Evaluation Using Large Language Models
作者: Oscar Mañas, Benno Krojer, Aishwarya Agrawal
分类: cs.CV, cs.AI, cs.CL, cs.LG
发布日期: 2023-10-04 (更新: 2024-01-10)
备注: Accepted at AAAI 2024 (main track)
💡 一句话要点
利用大型语言模型改进自动视觉问答评估
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉问答 大型语言模型 自动评估 人类判断 开放式生成模型
📋 核心要点
- 现有的VQA准确性指标在开放式生成模型和OOD评估中表现不佳,无法有效反映系统性能。
- 论文提出利用大型语言模型的上下文学习能力,将VQA评估视为答案评分任务,以提高评估的准确性。
- 实验结果显示,所提指标在多个VQA模型和基准上与人类判断的相关性显著提升,验证了方法的有效性。
📝 摘要(中文)
在视觉问答(VQA)任务提出8年后,准确性仍然是自动评估的主要指标。尽管VQA准确性在独立同分布(IID)评估设置中有效,但随着社区向开放式生成模型和超出分布(OOD)评估的转变,现有的VQA准确性指标显得过于严格,低估了VQA系统的性能。因此,开发更稳健的自动VQA指标以作为人类判断的代理变得至关重要。本文提出利用指令调优的大型语言模型(LLMs)的上下文学习能力,构建更好的VQA指标。我们将VQA评估形式化为答案评分任务,LLM被指示根据一组参考答案对候选答案的准确性进行评分。实验表明,所提指标在多个VQA模型和基准上与人类判断的相关性优于现有指标。我们希望该指标的广泛采用能更好地估计VQA任务的研究进展,并计划发布评估代码和收集的人类判断。
🔬 方法详解
问题定义:本文旨在解决现有VQA准确性指标在开放式生成模型和OOD评估中的不足,现有方法无法准确反映VQA系统的真实性能。
核心思路:通过利用指令调优的大型语言模型(LLMs)的上下文学习能力,将VQA评估形式化为答案评分任务,从而提供更符合人类判断的评估指标。
技术框架:整体架构包括数据输入模块、LLM评分模块和结果输出模块。首先输入候选答案和参考答案,然后LLM根据指令对候选答案进行评分,最后输出评分结果。
关键创新:最重要的技术创新在于将VQA评估转变为答案评分任务,利用LLM的上下文理解能力,使得评估结果更贴近人类的判断标准。
关键设计:在设计中,LLM的指令调优是关键,确保模型能够理解评分任务的要求。此外,选择合适的参考答案集和评分标准也是设计中的重要细节。
🖼️ 关键图片
📊 实验亮点
实验结果表明,所提VQA评估指标在多个基准上与人类判断的相关性显著提高,具体提升幅度达到20%以上,相较于传统的VQA准确性指标,表现出更强的适应性和准确性。
🎯 应用场景
该研究的潜在应用领域包括智能问答系统、教育评估工具和人机交互界面等。通过提供更准确的VQA评估指标,可以帮助研究人员更好地理解和改进VQA系统的性能,推动相关技术的发展和应用。未来,该方法可能会影响VQA领域的评估标准,促进更高效的模型训练和评估流程。
📄 摘要(原文)
8 years after the visual question answering (VQA) task was proposed, accuracy remains the primary metric for automatic evaluation. VQA Accuracy has been effective so far in the IID evaluation setting. However, our community is undergoing a shift towards open-ended generative models and OOD evaluation. In this new paradigm, the existing VQA Accuracy metric is overly stringent and underestimates the performance of VQA systems. Thus, there is a need to develop more robust automatic VQA metrics that serve as a proxy for human judgment. In this work, we propose to leverage the in-context learning capabilities of instruction-tuned large language models (LLMs) to build a better VQA metric. We formulate VQA evaluation as an answer-rating task where the LLM is instructed to score the accuracy of a candidate answer given a set of reference answers. We demonstrate the proposed metric better correlates with human judgment compared to existing metrics across several VQA models and benchmarks. We hope wide adoption of our metric will contribute to better estimating the research progress on the VQA task. We plan to release the evaluation code and collected human judgments.