Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness
作者: Xilun Chen, Zhaleh Feizollahi, Ross Goodwin, Seungwhan Moon, Scott Yih, Pinar Donmez, Babak Damavandi, Luna Dong
分类: cs.CL
发布日期: 2026-07-21
💡 一句话要点
提出双层元评分标准以评估开放式生成的事实完整性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 事实完整性 开放式生成 评估标准 多模态评估 机器学习 长文本生成 人工智能
📋 核心要点
- 现有的评估方法主要关注生成内容的精确性,忽视了内容的完整性,导致无法全面评估模型的表现。
- 本文提出了一种双层元评分标准框架,旨在通过结构化的评分标准来评估开放式生成的事实完整性。
- 在对14个前沿和开放权重模型进行评估时,发现该基准具有挑战性和高度区分性,最佳得分为58.7%。
📝 摘要(中文)
评估长文本生成的事实性主要集中在精确度上,即模型所做的声明是否正确。然而,现有的分解-搜索-验证流程虽然能够有效捕捉错误声明,却无法评估回应是否包含所有必要信息。测量事实完整性,即事实性的缺失部分,更为复杂,因为它需要列举完整答案应包含的所有事实。本文提出了一种双层元评分标准框架,并将其具体化为GAMUT(多模态事实性基础评估),这是一个用于长文本生成事实完整性的基准。该框架基于双层评分标准表示,结构化的元评分标准捕捉所需内容的组织和重要性,随后机械编译成平坦的二元、机器可评分的评分标准,供大型语言模型进行可靠评分。我们构建了1,813个基于真实可穿戴图像的问题,涵盖10个不同领域,并为每个问题配备了经过专家验证的证据支持评分标准。
🔬 方法详解
问题定义:本文旨在解决长文本生成中事实完整性的评估问题。现有方法在捕捉错误声明方面表现良好,但无法有效评估生成内容是否包含所有必要信息。
核心思路:论文提出的双层元评分标准框架通过结构化的评分标准来捕捉内容的组织和重要性,进而生成可供机器评分的检查表,从而提高评估的全面性和准确性。
技术框架:该框架包括两个主要模块:首先是结构化的元评分标准,用于定义所需内容的组织和重要性;其次是将这些标准机械编译成二元评分标准,供大型语言模型进行评分。
关键创新:最重要的创新在于引入双层评分标准的概念,使得评估不仅关注生成内容的正确性,还关注内容的完整性和相关性。这与传统的独立布尔检查方法有本质区别。
关键设计:在设计中,构建了1,813个问题,并为每个问题配备了经过专家验证的评分标准,确保评分的可靠性和有效性。此外,框架是模态无关的,提供了文本-only的变体以适应不同的应用场景。
🖼️ 关键图片
📊 实验亮点
在对14个前沿和开放权重模型的评估中,GAMUT基准展现出高度的挑战性和区分性,最佳得分为58.7%(来自Gemini 3.1 Pro),显示出该框架在评估生成内容的事实完整性方面的有效性和可靠性。
🎯 应用场景
该研究的潜在应用领域包括教育、内容生成、自动问答系统等。通过提供更全面的评估标准,能够提升模型在生成长文本时的准确性和完整性,进而提高用户体验和信息获取的效率。未来,该框架可能推动更多领域的开放式生成技术的发展。
📄 摘要(原文)
Evaluating the factuality of long-form generations has focused predominantly on precision, measuring whether the claims a model makes are correct. The dominant decompose-search-verify pipeline catches incorrect claims well but says little about whether a response contains all the information it should. Measuring factual completeness, the missing half of factuality, is harder: it requires enumerating the full set of facts a complete answer should contain, and these facts rarely form a flat list. They often involve open-ended sets where coverage is what matters, ordered processes, and relationships among facts that a list of independent boolean checks fails to capture. We introduce a two-level meta-rubric framework for evaluating open-ended generation, and instantiate it as Gamut (Grounded Assessment of Multimodal Factuality), a benchmark for factual completeness in long-form generation. The framework rests on a two-level rubric representation: a structured meta-rubric captures the organization and importance of the required content, which is then mechanically compiled into a flat checklist of binary, machine-gradable rubrics that an LLM judge scores reliably. We construct 1,813 questions grounded in real wearable imagery across 10 diverse domains, each paired with an evidence-backed rubric verified by expert human annotators. Because the framework is modality-agnostic, we also release a text-only variant. Evaluating 14 frontier and open-weight models, we find the benchmark genuinely challenging (best score 58.7% from Gemini 3.1 Pro), highly discriminative, and robust to the choice of judge.