Can LLMs Write Reliable Rubrics? A Meta-Evaluation for Experiment Reproduction

📄 arXiv: 2607.12835v1 📥 PDF

作者: Hanhua Hong, Yizhi Li, Jiaoyan Chen, Luu Gia Huy, Sophia Ananiadou, Jung-jae Kim, Chenghua Lin

分类: cs.CL

发布日期: 2026-07-14


💡 一句话要点

提出系统性元评估以优化LLM生成的评估标准

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 评估标准 元评估 LLM 论文复现 自动化评分 语义相似性 生成模型

📋 核心要点

  1. 现有的评估方法在论文复现中面临着构建特定评估标准的高成本和可扩展性不足的问题。
  2. 论文通过将评估标准重新构建为检查表格式,提出了一种系统性元评估的方法,评估LLM生成的评估标准的有效性。
  3. 实验结果显示,增强的生成设置显著提高了评估一致性,最强设置接近人类评估基线,内在增益相对较小。

📝 摘要(中文)

基于评估标准的评价是一种有前景的方法,用于评估LLM研究代理生成的开放式输出,尤其是在论文复现中。然而,构建特定论文的评估标准需要大量专家努力,限制了诸如PaperBench等基准的可扩展性。本文首次系统性地对LLM生成的评估标准进行元评估,采用检查表格式重新构建评估标准,并在两个基础模型上评估四种生成设置。结果表明,增强设置显著改善了下游评估的一致性,最强设置接近人类基线,而内在增益则较为温和。进一步分析显示,LLM生成的评估标准往往过于细化,偏向高分,并且对论文领域的适应性较差,突显了其优势与局限性。

🔬 方法详解

问题定义:论文旨在解决在论文复现中,LLM生成的评估标准的可靠性和有效性问题。现有方法在构建特定评估标准时,面临专家投入高、可扩展性差的挑战。

核心思路:本文提出将评估标准转化为检查表格式,以便于系统性评估LLM生成的评估标准的质量和一致性。通过对不同生成设置的比较,探索其在实际应用中的有效性。

技术框架:研究采用了两个基础模型,评估四种不同的生成设置。评估过程包括内在的语义相似性评估和外在的分数与真实评估标准的一致性评估。

关键创新:本文的创新在于首次系统性地对LLM生成的评估标准进行元评估,提出了检查表格式的构建方法,并通过多种生成设置进行比较,揭示了其优势与局限性。

关键设计:在实验中,采用了语义相似性作为内在评估指标,并通过与真实评估标准的分数对齐进行外在评估。设置了多个生成参数,以探索不同生成策略对评估标准质量的影响。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,增强的生成设置显著提高了下游评估的一致性,最强设置的评估一致性接近人类基线,内在增益相对较小,显示出LLM生成评估标准的潜力和局限性。

🎯 应用场景

该研究的潜在应用领域包括学术论文复现、教育评估和自动化评分系统等。通过优化LLM生成的评估标准,可以提高开放式输出的评估质量,促进研究的透明性和可重复性,未来可能对学术界和教育领域产生深远影响。

📄 摘要(原文)

Rubric-based evaluation is a promising approach for assessing open-ended outputs from LLM-based research agents, particularly in paper reproduction, where direct paper-to-repository comparison is prone to hallucination. However, constructing paper-specific rubrics requires substantial expert effort, limiting the scalability of benchmarks such as PaperBench. In this work, we present, to our knowledge, the first systematic meta-evaluation of LLM-generated rubrics for paper reproduction. We reformulate rubrics into a checklist-style format and evaluate four generation settings across two backbone models. We meta-evaluate generated rubrics intrinsically by semantic similarity and extrinsically by score alignment with ground-truth rubrics. Our results show that the augmented settings substantially improves downstream evaluation alignment, with the strongest setting approaching the human baseline, while intrinsic gains are more modest. Further analyses reveal that LLM-generated rubrics are often overly fine-grained, biased toward high scores, and less adaptive to paper domains, highlighting both the affordances and limitations.