Overview of the NLPCC 2026 Shared Task 11: Agent-Based Experiment Reproduction from Scientific Papers
作者: Hanhua Hong, Yizhi Li, Luu Gia Huy, Jian Yang, Ming Zhou, Chenghua Lin
分类: cs.CL
发布日期: 2026-09-10
备注: NLPCC Shared Task
💡 一句话要点
提出AgentActionBench以解决科学论文实验重现性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 实验重现 科学论文 自动化评估 机器学习 人工智能
📋 核心要点
- 现有方法在科学实验重现性方面存在显著不足,尤其是在处理复杂的科学论文时,人工验证效率低下。
- 论文提出了AgentActionBench,一个过程导向的基准框架,旨在评估跨多个领域的代理实验重现能力。
- 实验结果显示,当前系统在执行方面存在瓶颈,但模型生成的评分与人工评分之间存在强相关性,验证了评分生成方法的有效性。
📝 摘要(中文)
重现性是科学进步的关键,但日益增长的科学出版物数量和复杂性使得全面的人工验证变得不切实际。尽管大型语言模型(LLM)代理的进步使得自动化实验重现成为可能,现有评估主要集中在最终结果上,并且通常限于机器学习(ML)领域。本文介绍了AgentActionBench,这是一个面向过程的基准,用于评估跨ML和AI4Science领域的代理实验重现。该框架使用基于MCP的动作记录器捕捉代理在重现过程中的行为,并根据论文特定的评分标准评估结果。AgentActionBench包含150篇论文,其中120篇为ML论文,30篇为AI4Science论文。人工标注的子集覆盖基准的10%,提供验证数据,而模型辅助扩展将完整基准扩展到超过10,000个评分项。实验结果表明,当前系统仍然有限,执行是主要瓶颈。同时,模型生成的评分与人工标注评分之间的强相关性验证了我们可扩展评分生成方法的可靠性。
🔬 方法详解
问题定义:本研究旨在解决科学论文中实验重现性不足的问题。现有方法主要依赖人工验证,面对大量复杂文献时效率低下,难以实现全面的验证。
核心思路:论文提出的AgentActionBench框架,通过引入基于MCP的动作记录器,自动捕捉代理在实验重现过程中的行为,从而实现高效的评估。
技术框架:整体架构包括数据收集、动作记录、行为分析和评分评估四个主要模块。数据收集阶段从150篇论文中提取信息,动作记录模块实时捕捉代理行为,行为分析模块对记录进行处理,最后评分评估模块依据特定标准进行结果评估。
关键创新:最重要的创新在于引入了过程导向的评估方法,强调了实验重现过程中的行为记录,而不仅仅是最终结果的评估。这一方法与传统的静态评估方式有本质区别。
关键设计:在设计中,采用了基于MCP的动作记录器,确保能够细致捕捉代理的每一步行为。此外,评分标准经过精心设计,以适应不同领域的需求,确保评估的全面性和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,当前系统在执行方面存在显著瓶颈,然而模型生成的评分与人工评分之间的Pearson和Spearman相关性强,验证了评分生成方法的可靠性。这一发现为未来的研究提供了重要的参考,表明在自动化实验重现领域仍有提升空间。
🎯 应用场景
该研究的潜在应用领域包括科学研究、机器学习和人工智能等多个领域。通过提高实验重现性的效率,AgentActionBench可以帮助研究人员更快地验证实验结果,推动科学进步。此外,该框架的设计理念也可为其他领域的自动化评估提供借鉴,具有广泛的实际价值和未来影响。
📄 摘要(原文)
Reproducibility is essential to scientific progress, yet the growing volume and complexity of scientific publications make exhaustive manual verification increasingly impractical. Although recent advances in large language model (LLM) agents enable automated experiment reproduction, existing evaluations largely focus on final repositories and are typically limited to machine learning (ML). We introduce AgentActionBench, a process-oriented benchmark for evaluating agent-based experiment reproduction across ML and AI4Science domains. Our framework uses an MCP-based Action Recorder to capture agents' behaviour throughout the reproduction process and evaluates the resulting traces with paper-specific rubrics. AgentActionBench contains 150 papers, including 120 ML papers and 30 AI4Science papers. A human-annotated subset covering 10% of the benchmark provides validation data, while model-assisted augmentation expands the full benchmark to more than 10,000 rubric items. Experimental results show that current systems remain limited, with execution as the primary bottleneck. Meanwhile, the strong Pearson and Spearman correlations between model-generated and human-annotated rubrics validate the reliability of our scalable rubric-generation approach.