GeoProp: Grounding Robot State in Vision for Generalist Manipulation

📄 arXiv: 2607.07101v1 📥 PDF

作者: Guoyang Zhao, Quanhao Qian, Gongjie Zhang, Wenhao Li, Jiuniu Wang, Xiaowei Lu, Deli Zhao, Ran Xu

分类: cs.RO, cs.AI

发布日期: 2026-07-08

备注: 21 pages, 8 figures, 11 tables. Project page: https://alibaba-damo-academy.github.io/GeoProp/

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出GeoProp以解决机器人状态与视觉对齐问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 机器人状态对齐 视觉特征采样 几何对齐 FiLM调制 通用操作策略

📋 核心要点

  1. 现有的融合方法通常将本体感知视为一个孤立的向量,缺乏与视觉特征的明确对齐,导致机器人状态难以在场景中定位。
  2. GeoProp通过将机器人状态投影到图像平面,采样局部视觉特征,并通过FiLM调制将状态信息注入视觉特征,解决了这一问题。
  3. 在67个任务中,GeoProp在模拟任务中提升了Diffusion Policy 8.7%,在真实环境中实现了10.6%的平均增益,展示了其有效性。

📝 摘要(中文)

本研究提出GeoProp,一个轻量级的适配器,通过显式的几何对齐和空间特征采样,将机器人的本体感知与视觉信息对齐。GeoProp将机器人状态投影到图像平面,以采样局部视觉特征,构建一个有根状态标记。然后,通过FiLM调制将状态派生的空间先验注入相应的视觉特征中。GeoProp还通过最近的运动学预测短期坐标来捕捉运动意图,提供前瞻性的视觉上下文。在67个任务中,GeoProp在63个模拟任务中提高了Diffusion Policy的表现8.7%,在RoboTwin子集上提高了pi_0的表现4.0%,在真实世界中实现了两个策略家族平均10.6%的增益,同时仅增加了2-3%的参数量。这些结果表明GeoProp是一个简单但高影响力的归纳偏置,适用于通用的具身策略。

🔬 方法详解

问题定义:本研究旨在解决机器人状态与视觉信息之间缺乏直接对应关系的问题。现有方法未能有效对齐3D运动学与2D特征图,导致机器人在操作任务中的表现不佳。

核心思路:GeoProp的核心思路是通过几何对齐和空间特征采样,将本体感知与视觉信息结合。通过将机器人状态投影到图像平面,GeoProp能够采样与机器人状态相关的视觉特征,从而构建一个有根状态标记。

技术框架:GeoProp的整体架构包括状态投影模块、特征采样模块和FiLM调制模块。首先,机器人状态被投影到图像平面,接着从图像中采样局部特征,最后通过FiLM调制将状态信息注入这些特征中。

关键创新:GeoProp的主要创新在于其轻量级的设计和有效的几何对齐方法,使得机器人状态与视觉信息之间的关系更加紧密。这种设计与传统方法的根本区别在于其强调了状态信息在视觉特征中的重要性。

关键设计:在技术细节上,GeoProp仅增加了2-3%的参数量,采用了FiLM调制来实现状态信息的注入,确保了模型的高效性与实用性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

GeoProp在63个模拟任务中提升了Diffusion Policy的表现8.7%,在RoboTwin子集上提高了pi_0的表现4.0%,在真实世界中实现了两个策略家族平均10.6%的增益。这些结果表明GeoProp在多种任务中的有效性和实用性。

🎯 应用场景

GeoProp的研究成果在多种机器人操作任务中具有广泛的应用潜力,尤其是在需要精确视觉反馈的复杂环境中。其高效的状态与视觉对齐方法可以提升机器人在动态场景中的操作能力,未来可能在服务机器人、工业自动化等领域发挥重要作用。

📄 摘要(原文)

Proprioception is fundamental to robotic manipulation, yet standard fusion methods often treat it as an isolated vector lacking explicit alignment with visual tokens. Without a direct correspondence between 3D kinematics and 2D feature maps, manipulation policies struggle to ground the robot's state within the scene, frequently underperforming even vision-only baselines. To address this, we introduce GeoProp, a lightweight, plug-and-play adapter that aligns proprioception with vision through explicit geometric grounding and spatial feature sampling. GeoProp projects the robot state onto the image plane to sample localized visual features, constructing a grounded state token. It then injects state-derived spatial priors into the corresponding visual features via FiLM modulation. To capture motion intent, GeoProp further samples features at a short-horizon predicted coordinate derived from recent kinematics, providing look-ahead visual context. Across 67 tasks, GeoProp improves Diffusion Policy by 8.7% on 63 simulation tasks and pi_0 by 4.0% on the RoboTwin subset, and yields a 10.6% average gain across both policy families in the real world, while adding only 2-3% to the parameter count. These results demonstrate that GeoProp is a simple yet high-impact inductive bias for generalist embodied policies. Project page: https://alibaba-damo-academy.github.io/GeoProp/.