Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning

📄 arXiv: 2607.15374 📥 PDF

作者: Kazi Sajeed Mehrab, Hani Alomari, Najibul Haque Sarker, Chia-Wei Tang, Zaber Ibn Abdul Hakim, Anuj Karpatne, Chris Thomas

分类: cs.CV

发布日期: 2026-07-20


💡 一句话要点

提出OP-HRG以解决多模态语言模型对部分物体定位的挑战

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态学习 物体定位 部分感知 反射机制 层次结构 强化学习 计算机视觉

📋 核心要点

  1. 现有的多模态大型语言模型在处理部分物体的查询时表现不佳,主要由于缺乏物体与部分之间的层次结构。
  2. 论文提出了物体-部分层次反射定位(OP-HRG),通过先定位整体物体再定位其部分,采用自检机制提升定位精度。
  3. 实验结果表明,基于该方法训练的4B模型在多个数据集上超越了7B的基线模型,显示出显著的性能提升。

📝 摘要(中文)

多模态大型语言模型(MLLMs)在从自由形式语言查询中定位整体物体方面表现良好,但在查询指定部分而非整体物体时却存在困难。我们将这一问题归因于缺乏物体-部分层次结构,因为部分在与物体相同的单一步骤中被定位。为此,我们提出了物体-部分层次反射定位(OP-HRG),这是一种自粗到细的推理引导定位策略,首先定位父物体,然后在其中定位部分。接着进行自检,反思结果,并扩展到重新编码预测的裁剪区域以检查其修正效果。我们引入了一种部分感知的GRPO框架,通过阶段性奖励训练我们的管道。经过这种训练的4B模型在PascalPart、PartImageNet和InstructPart上超越了7B的定位LLMs和SAM3,并成功迁移到推理分割任务。

🔬 方法详解

问题定义:本论文旨在解决多模态大型语言模型在处理部分物体查询时的定位困难。现有方法在物体与部分的层次结构缺失导致定位精度不足。

核心思路:提出物体-部分层次反射定位(OP-HRG),通过先定位父物体,再在其内部定位部分,结合自检机制以提升定位的准确性和可靠性。

技术框架:整体流程包括三个主要阶段:首先是父物体的粗略定位,其次是对物体内部部分的细致定位,最后是自检环节,通过反思结果进行修正。

关键创新:最重要的创新在于引入了物体-部分层次结构的反射机制,使得模型能够在同一框架内处理物体和部分的定位问题,显著提升了定位精度。

关键设计:在训练过程中,采用了部分感知的GRPO框架,设计了阶段性奖励机制,以引导模型在不同阶段的学习,确保每个阶段的目标明确且可达成。

📊 实验亮点

实验结果显示,采用OP-HRG训练的4B模型在PascalPart、PartImageNet和InstructPart数据集上均超越了7B的基线模型和SAM3,具体提升幅度达到了显著的性能提升,证明了该方法的有效性和优越性。

🎯 应用场景

该研究的潜在应用领域包括智能监控、机器人视觉和增强现实等场景,能够有效提升系统对复杂场景中部分物体的理解与定位能力。未来,该方法有望在多模态交互和人机协作中发挥更大作用,推动相关技术的发展。

📄 摘要(原文)

Multimodal large language models (MLLMs) ground whole objects well from free-form language queries, but they struggle when the query names a part rather than the object. We trace this to a missing object-part hierarchy, since parts are localized in the same single step used for objects. We propose Object-Part Hierarchical Reflective Grounding (OP-HRG), a coarse-to-fine reasoning-guided grounding strategy that first localizes the parent object and then the part within it. A self-check then reflects on the result, with an extension to re-encode the predicted crop to inspect the region it is correcting. We introduce a part-aware GRPO framework to train our pipeline with stage-wise rewards. A 4B model trained this way outperforms 7B grounding LLMs and SAM3 across PascalPart, PartImageNet, and InstructPart, and transfers to reasoning segmentation.