ReGround: Grounding Reviewer Comments in Multimodal Evidence
作者: Serwar Basch, Lizhen Qu, Iryna Gurevych
分类: cs.CL, cs.IR
发布日期: 2026-09-10
备注: Accepted at EMNLP 2026
💡 一句话要点
提出ReGround以解决评论与证据关联问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 审稿评论 多模态证据 文档理解 信息检索 数据集构建
📋 核心要点
- 现有方法在将审稿评论与多模态证据关联时面临挑战,尤其是在长文档中难以准确定位。
- 提出ReGround数据集,通过链接审稿评论与原始论文证据,利用作者反驳中的明确引用来提高注释精度。
- 实验结果显示,整篇论文内容的检索效果较差,证据类型推断是瓶颈,多模态证据提供了文本所缺失的关键信息。
📝 摘要(中文)
审稿人的评论通常与被审稿论文的特定部分相关,但由于文档的多模态特性,准确地将这些评论与基础证据关联起来非常困难。现有的基准测试未能捕捉到这一设置,主要集中在明确的信息检索查询上。本文引入了ReGround,一个大规模的数据集,将10,267条审稿评论与3,656篇论文的16,274条证据链接。我们基于一个简单的观察:作者的反驳通常包含对提交内容的明确引用,以高精度的注释源来解决审稿评论。我们将关联视为检索任务,并评估了多种检索方法。结果表明,针对整篇论文内容的检索效果不佳,证据类型推断是主要瓶颈,而多模态证据提供了文本所缺失的互补信号。我们的数据集揭示了审稿评论的关联作为科学文档理解中的一个困难且重要的问题。
🔬 方法详解
问题定义:本文旨在解决审稿人评论与多模态证据之间的关联问题。现有方法在长文档中难以准确定位相关证据,导致检索效果不佳。
核心思路:我们提出ReGround数据集,通过链接审稿评论与原始论文中的证据,利用作者反驳中的明确引用来提高注释的精度,从而将关联任务视为检索问题。
技术框架:整体架构包括数据集构建、评论与证据的链接、检索方法的评估等多个模块。首先,构建包含审稿评论和证据的数据集;其次,设计多种检索方法进行评估。
关键创新:最重要的创新点在于利用作者反驳中的引用作为高精度的注释源,这一方法与现有的基于显式查询的检索方法本质上不同。
关键设计:在参数设置上,采用了多种检索算法,并通过对比实验评估其性能,特别关注证据类型推断和多模态证据的融合。实验中使用了精确度、召回率等指标进行评估。
🖼️ 关键图片
📊 实验亮点
实验结果表明,整篇论文内容的检索效果较差,且证据类型推断是主要瓶颈。通过引入多模态证据,模型在检索任务中的性能显著提升,具体提升幅度未知,表明多模态信息在科学文档理解中的重要性。
🎯 应用场景
该研究在科学文档理解领域具有广泛的应用潜力,尤其是在学术审稿、文献检索和自动化评审系统中。通过提高审稿评论与证据的关联性,可以提升审稿效率和质量,促进学术交流与合作。未来,该方法还可以扩展到其他多模态文档的理解任务中。
📄 摘要(原文)
Reviewer comments naturally relate to specific parts of the reviewed paper, yet grounding these comments to the underlying evidence is difficult due to long multimodal documents. Existing benchmarks do not capture this setting and largely focus on explicit, information-seeking queries. We introduce ReGround, a large-scale dataset for reviewer comment grounding that links 10,267 reviewer comments to 16,274 evidence in the original anonymous submission of 3,656 papers. We build on a simple observation: author rebuttals often include explicit references to content of the submission used to address reviewer comments, providing a high-precision annotation source. We cast grounding as a retrieval task and evaluate a wide range of retrieval methods. Results show that retrieval over the entire paper content performs poorly, evidence-type inference is a major bottleneck, and multimodal evidence provides complementary signals that text alone misses. Our dataset exposes grounding reviewer comments as a difficult and practically important problem for scientific document understanding.