SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning

📄 arXiv: 2607.10966v1 📥 PDF

作者: Mingyuan Wu, Jingcheng Yang, Shengyi Qian, Xudong Wang, Jize Jiang, Qifan Wang, Aashu Singh, Khoi Pham, Fei Liu, Zhaolun Su, Zhuokai Zhao, Klara Nahrstedt, Jianyu Wang, Hanchao Yu

分类: cs.AI

发布日期: 2026-07-13

备注: Under submission


💡 一句话要点

提出SVR-R1以解决多模态推理中的自我验证问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态推理 自我验证 强化学习 视觉-语言模型 自我纠正 GRPO 异步回合

📋 核心要点

  1. 现有的多模态推理方法在自我验证方面存在不足,难以有效利用模型自身的反馈进行学习。
  2. 论文提出的SVR-R1框架通过自我验证机制,将模型的验证结果转化为学习信号,增强多模态推理能力。
  3. 实验结果表明,SVR-R1在视觉-语言推理基准上显著提高了准确性,相较于标准GRPO基线有明显提升。

📝 摘要(中文)

我们介绍了自我验证推理器(SVR-R1),这是一个多轮强化学习框架,利用模型自身的验证作为多模态推理的学习信号。对于每个查询,模型使用相同的权重提出答案,并给出二元自我裁决(是/否)。'否'触发第二次思考;'是'或达到回合上限则最终确定输出以计算基于结果的奖励。SVR-R1在视觉-语言推理基准上进行评估,显示出相较于强大的标准GRPO基线显著提高了准确性。训练动态表明对验证的依赖性降低,验证回合减少,但测试准确性提高,表明随着策略内化自我修正,验证与生成之间的差距缩小。SVR-R1填补了推理时自我精炼与强化学习训练之间较少探索的交集,为多模态推理提供了一种简单而有效的引导方法。我们将开源SVR-R1以促进未来在视觉-语言模型中的研究。

🔬 方法详解

问题定义:本论文旨在解决多模态推理中自我验证的不足,现有方法往往缺乏有效的自我反馈机制,导致推理准确性低下。

核心思路:SVR-R1通过引入自我验证机制,使模型在每次推理时都能对自己的答案进行评估,从而利用这一反馈进行学习和改进。这样的设计使得模型能够在没有外部监督的情况下,自我纠正并优化推理过程。

技术框架:SVR-R1采用了GRPO(Generalized Reinforcement Policy Optimization)和异步多轮回合框架。模型在每个查询中生成答案,并根据自我裁决进行调整,最终输出用于计算奖励。

关键创新:SVR-R1的主要创新在于将自我验证与强化学习结合,形成了一种新的多模态推理训练方法。这一方法与传统的依赖外部监督的方式有本质区别,能够更好地适应复杂的推理任务。

关键设计:SVR-R1的设计中,模型在每个回合中使用相同的权重生成答案,并通过二元自我裁决机制(是/否)来决定是否需要重新思考。训练过程中,随着模型对自我验证的依赖性降低,验证回合数减少,而测试准确性却提高,表明模型在学习过程中逐渐内化了自我修正能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

SVR-R1在视觉-语言推理基准上表现出色,相较于强大的标准GRPO基线,准确性显著提高。实验表明,模型在训练过程中逐渐减少对验证的依赖,验证回合数减少,测试准确性却提升,显示出自我修正能力的增强。

🎯 应用场景

该研究的潜在应用领域包括智能问答系统、视觉-语言理解任务以及人机交互等场景。通过增强模型的自我验证能力,SVR-R1能够提高多模态推理的准确性和效率,具有重要的实际价值和广泛的应用前景。未来,SVR-R1的开源将促进相关领域的进一步研究与发展。

📄 摘要(原文)

We introduce Self-Verified Reasoner (SVR-R1), a multi-turn RL framework that turns a model's own verification into a learning signal for multimodal reasoning. For each query, the model proposes an answer using the same weights, and issues a binary self-verdict (Yes/No). A 'No' triggers a second-chance rethink; a 'Yes,' or a turn cap, finalizes the output for computing the outcome-based reward. SVR-R1 is implemented with GRPO and an asynchronous multi-turn rollout framework and needs no external supervision or auxiliary critics. We evaluate SVR-R1 on vision-language reasoning benchmarks and show that it improves accuracy by a large margin over strong standard GRPO baselines. Training dynamics show decreasing reliance on verification-fewer verification turns, yet higher test accuracy-indicating that the gap between verification and generation narrows as the policy internalizes self-correction and chooses the most confident answer via our framework. SVR-R1 bridges the less explored intersection of inference-time self-refinement and RL training for VLMs, offering a simple yet effective recipe for bootstrapping multimodal reasoning. We will open-source \textbf{SVR-R1} to facilitate future research in VLMs.