Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO
作者: Xin Zhang, Haochen Wang, Yikang Zhou, Jason Li, Robby T. Tan
分类: cs.CV
发布日期: 2026-07-13
备注: Accepted to ECCV 2026
🔗 代码/项目: GITHUB
💡 一句话要点
提出CycleGRPO以统一区域理解与定位问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态大语言模型 区域理解 强化学习 自我评估 循环一致性奖励
📋 核心要点
- 现有方法通常将区域理解与定位分开处理,导致效率低下和信息丢失。
- 提出的CycleGRPO框架通过自我评估机制,将区域理解与文本生成紧密结合,优化了两者的协同作用。
- 实验结果显示,CycleGRPO在区域描述、区域VQA、基础对话和指称分割等任务上均取得了显著的性能提升。
📝 摘要(中文)
本文介绍了一种统一的强化学习框架Cycle Group Relative Policy Optimization (CycleGRPO),旨在同时优化多模态大语言模型(MLLMs)的区域理解和定位。与现有的分离管道不同,我们利用这两项任务之间的内在对偶性,构建了一种自我评估的强化学习范式:'区域 $ o$ 文本 $ o$ 区域'。具体而言,单个MLLM首先作为行动者生成区域描述,然后立即转变为评论者,将生成的文本重新定位到空间域。因此,CycleGRPO仅需区域输入,如掩码或边界框,完全绕过文本真实值的需求。通过质量感知的令牌级循环一致性奖励来评估文本描述的语义可区分性及其物理定位的准确性。实验证明,基于SAMTok构建的CycleGRPO框架成功地同时引导了这两种能力的提升,且无需任何特定任务的微调,在多个基准测试中均表现出一致的性能提升。
🔬 方法详解
问题定义:本文旨在解决多模态大语言模型在区域理解与定位任务中的分离处理问题,现有方法往往导致信息的低效利用和性能瓶颈。
核心思路:CycleGRPO通过构建自我评估的强化学习框架,利用区域到文本再到区域的循环过程,优化区域理解和文本生成的协同作用,从而提升模型的整体性能。
技术框架:该框架包括两个主要模块:首先,MLLM作为行动者生成区域描述;其次,作为评论者将生成的文本与空间域进行对接。整个过程仅依赖区域输入,避免了对文本真实值的依赖。
关键创新:CycleGRPO的最大创新在于其自我评估机制,通过质量感知的循环一致性奖励,评估文本描述的语义可区分性及其物理定位的准确性。这一设计使得模型能够在没有额外微调的情况下,直接从区域输入中学习。
关键设计:在损失函数设计上,采用了质量感知的令牌级循环一致性奖励,确保生成文本的语义与物理位置的一致性。此外,网络结构基于SAMTok构建,增强了模型的灵活性和适应性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,CycleGRPO在多个基准测试中均实现了显著的性能提升。例如,在区域描述任务中,相较于基线模型,性能提升幅度达到XX%。此外,CycleGRPO在无需特定任务微调的情况下,展现出一致的性能优势,验证了其方法的有效性与通用性。
🎯 应用场景
该研究的潜在应用领域包括智能视觉系统、自动驾驶、机器人导航以及人机交互等。通过提升多模态大语言模型在区域理解与定位的能力,CycleGRPO能够为这些领域提供更为精准和高效的解决方案,推动相关技术的发展与应用。
📄 摘要(原文)
This paper introduces Actor as Its Own Critic, a unified reinforcement learning framework, Cycle Group Relative Policy Optimization (CycleGRPO), that jointly optimizes region understanding and localization for Multimodal Large Language Models (MLLMs). Unlike existing separate pipelines, we leverage the inherent duality between the two tasks to construct a self-evaluating reinforcement learning paradigm: "region $\to$ text $\to$ region''. Specifically, a single MLLM first acts as the actor to generate region captions, then immediately transitions to a critic to ground its generated text back in the spatial domain. Therefore, CycleGRPO requires only region inputs, e.g., masks or bounding boxes, entirely bypassing the need for textual ground truths. A quality-aware token-level cycle-consistency reward is employed to assess the semantic discriminability of text captions via their physical localization accuracy. Empirically, built upon SAMTok, our CycleGRPO framework successfully bootstraps both capabilities simultaneously. Without any task-specific fine-tuning, the framework yields consistent performance gains across a wide range of benchmarks, including region captioning, region VQA, grounded dialogue, and referring segmentation. Overall, CycleGRPO offers a straightforward and scalable way to advance pixel-level capabilities in MLLMs. Code and models are released at https://github.com/devinxzhang/CycleGRPO.