Multi-Agent Debate and Visual Information Extraction for SeePhys Pro: A 1st-Place Technical Report from ICML 2026 AI4Math Track 3 Challenge
作者: Jiseok Kwak, Suhyeon Jo, Taewoo Kim, Yeongmin Kim, Byeonghu Na, Il-chul Moon
分类: cs.LG
发布日期: 2026-07-24
💡 一句话要点
提出多代理辩论与视觉信息提取以解决物理问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多代理辩论 视觉信息提取 物理问题解答 模态差距 智能教育
📋 核心要点
- 现有方法在处理视觉物理问题时,尤其是当关键信息在图像中时,表现不佳,导致模态差距加大。
- 论文提出的解决方案是一个两阶段框架,首先提取视觉信息并将其转化为文本,然后通过多代理辩论进行推理。
- 实验结果显示,该方法在公共数据集上的准确率从0.643提升至0.802,显著优于单一代理基线,获得了比赛第一名。
📝 摘要(中文)
本技术报告介绍了我们在第三届AI for Math Workshop的挑战Track 3: SeePhys Pro中的方法,任务是回答大学水平的物理问题,这些问题的陈述和图形可能部分或完全以图像形式给出。对于大型语言模型而言,当决定性信息位于图形中而非文本中时,视觉物理问题变得更加困难。我们提出了一个两阶段框架:第一阶段是视觉信息提取,将图形内容重新表达为可供求解器读取的文本,以缩小模态差距;第二阶段通过多代理辩论协调三个异构求解器。我们的分析得出两个发现:协调带来的收益来自于可靠的答案选择,而非额外的辩论;图形辅助的价值与问题中锁定在图像中的信息量成正比。最终的管道在公共数据集上将整体准确率从0.643提升至0.802,并在公共和私有排行榜上均获得第一名(私有整体0.743)。
🔬 方法详解
问题定义:本论文旨在解决在图像中包含关键信息的大学物理问题的回答难题。现有方法在处理此类问题时,往往无法有效提取图像中的信息,导致准确率低下。
核心思路:论文的核心思路是通过两阶段框架来缩小模态差距,第一阶段提取图像中的信息并转化为文本,第二阶段通过多代理辩论来整合不同求解器的答案,提升回答的准确性。
技术框架:整体架构分为两个主要模块:视觉信息提取模块和推理模块。视觉信息提取模块负责将图形内容转换为文本,而推理模块则协调多个求解器进行辩论,最终选择最可靠的答案。
关键创新:最重要的技术创新在于引入多代理辩论机制,通过不同求解器之间的协作来提高答案选择的可靠性,而不仅仅依赖单一求解器的输出。
关键设计:在设计中,采用了特定的损失函数来优化答案选择的准确性,并通过调节不同求解器的权重来实现更好的协作效果。
🖼️ 关键图片
📊 实验亮点
实验结果显示,该方法在公共数据集上的准确率从0.643提升至0.802,较单一代理基线有显著提升,且在公共和私有排行榜上均获得第一名,私有排行榜整体准确率为0.743。
🎯 应用场景
该研究的潜在应用领域包括教育技术、智能辅导系统和自动化评估工具,能够帮助学生更好地理解和解决复杂的物理问题。未来,该方法可能扩展到其他学科的视觉问题解答,提升教育领域的智能化水平。
📄 摘要(原文)
This technical report presents our approach to Challenge Track~3: SeePhys Pro at the 3rd AI for Math Workshop, where the task is to answer college-level physics questions whose statement and figure may be given partly or entirely as an image. Visual physics problems become substantially harder for large language models when the decisive information resides in a figure rather than in the text, and this modality gap widens as more of the problem migrates into the image. We address the task with a two-stage framework: a visual information extraction stage that re-expresses figure content as solver-readable text to close the modality gap, and a reasoning stage that orchestrates three heterogeneous solvers through multi-agent debate. Our analysis yields two findings: the gain from orchestration comes from reliable answer selection rather than from additional debate, and the value of a figure aid scales with how much of the problem is locked inside the image. The resulting pipeline improves overall accuracy over a single-agent baseline from 0.643 to 0.802 on the public split, and won 1st place on both the public and the private leaderboard (private overall 0.743).