SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning
作者: Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu
分类: cs.CV
发布日期: 2026-07-15
备注: 27 pages, 11 figures
💡 一句话要点
提出SIVA-RL以解决多模态强化学习中的视觉对齐问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态推理 强化学习 视觉对齐 干预方法 样本级监督 奖励机制 模型优化
📋 核心要点
- 现有的视觉干预方法未能有效考虑干预的实际效果,导致策略行为的监督不够准确。
- 本文提出SIVA-RL框架,通过样本级、结果导向的监督替代传统的操作符条件正则化,提升了视觉对齐的准确性。
- 在九个多模态推理基准测试中,SIVA-RL在每个设置中均优于匹配的RL基线,整体提升幅度可达14.9%。
📝 摘要(中文)
强化学习中的可验证奖励(RLVR)推动了多模态推理的发展,但答案级别的正确性并不能保证视觉语言模型的预测基于视觉证据。现有的视觉干预方法通过对比原始图像和修改图像的策略行为进行监督,但这种监督方式未能考虑干预的实际效果。为此,本文提出了SIVA-RL框架,通过样本级、结果导向的监督替代了基于操作符的正则化。SIVA-RL通过令牌对齐和距离约束的图像内PatchSwap构建局部干预,利用冻结的审计策略对每对干预进行评分,观察到的奖励下降成为软路由权重。该设计将干预构建与监督分离,兼容GRPO和DAPO骨干网络。在九个多模态推理基准测试中,SIVA-RL在每个设置中均优于匹配的RL基线,尤其在视觉依赖推理上提升了8.79个百分点,整体提升幅度可达14.9%。
🔬 方法详解
问题定义:本文要解决的问题是现有视觉干预方法在多模态强化学习中的不足,特别是监督方式未能考虑干预的实际效果,导致策略行为的准确性不足。
核心思路:SIVA-RL框架的核心思路是通过样本级、结果导向的监督来替代传统的操作符条件正则化,从而更准确地反映干预的效果。这样的设计使得干预构建与监督分离,提升了模型的灵活性和准确性。
技术框架:SIVA-RL的整体架构包括局部干预构建、审计策略评分和软路由权重生成三个主要模块。局部干预通过令牌对齐和距离约束的PatchSwap实现,审计策略用于评分干预效果,最终生成的软路由权重用于指导模型学习。
关键创新:SIVA-RL的关键创新在于将干预构建与监督分离,采用样本级、结果导向的监督方式,解决了传统方法中干预效果不一致的问题。这一创新使得模型在多模态推理任务中表现更为优越。
关键设计:在设计中,SIVA-RL采用了冻结的审计策略来评分干预效果,并根据观察到的奖励下降生成软路由权重。模型在处理大幅度奖励下降的干预时,强调敏感性对齐,而在小幅度下降的干预中则强调干净锚定的不变性对齐。
🖼️ 关键图片
📊 实验亮点
在九个多模态推理基准测试中,SIVA-RL在每个设置中均优于匹配的RL基线,尤其在视觉依赖推理上提升了8.79个百分点,整体提升幅度可达14.9%。这一结果表明,SIVA-RL在多模态推理任务中具有显著的性能优势。
🎯 应用场景
SIVA-RL框架在多模态推理任务中具有广泛的应用潜力,尤其在需要视觉证据支持的场景中,如自动驾驶、智能监控和人机交互等领域。其创新的监督方式和干预构建方法将推动相关领域的研究与应用发展,提升模型的实际表现和可靠性。
📄 摘要(原文)
Reinforcement learning with verifiable rewards (RLVR) drives multimodal reasoning, but answer-level correctness does not guarantee that a vision-language model grounds its predictions in visual evidence. Existing visual-intervention methods contrast policy behavior on original and modified images, yet assign supervision by the type of intervention rather than its observed effect. This assumption fails: identical operators produce heterogeneous outcomes across samples. We propose SIVA-RL, a Sensitivity-Invariance Visual Alignment framework that replaces operator-conditioned regularization with sample-wise, outcome-conditioned supervision. SIVA-RL constructs localized interventions through token-aligned, distance-constrained within-image PatchSwap. A frozen audit policy then scores each clean-intervention pair, and the observed reward drop becomes soft routing weights. Large-drop pairs drive sensitivity alignment, low-drop pairs drive clean-anchored invariance alignment, and ambiguous pairs are down-weighted. This design decouples intervention construction from supervision assignment and is compatible with both GRPO and DAPO backbones. Across nine multimodal reasoning benchmarks spanning mathematical, logical, and vision-dependent tasks, SIVA-RL improves 3B and 7B models over matched RL baselines in every setting. It yields an 8.79 percentage-point gain on vision-dependent reasoning and up to 14.9% relative overall improvement across all four GRPO- and DAPO-based configurations.