See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models
作者: Byungkun Lee, Dongyoon Hwang, Dongjin Kim, Hojoon Lee, Minho Park, Jaegul Choo
分类: cs.RO, cs.AI
发布日期: 2026-07-13
备注: Project page: https://davian-robotics.github.io/pointmap/
💡 一句话要点
提出机器人中心点图以解决视觉-语言-动作模型的帧不匹配问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉-语言-动作 机器人中心点图 三维几何 模型泛化 自主机器人
📋 核心要点
- 现有的视觉-语言-动作模型在相机坐标系中观察场景,导致与机器人坐标系之间的帧不匹配,影响泛化能力。
- 本文提出机器人中心点图,通过在机器人坐标系中存储场景点的三维坐标,解决了观察与动作定义之间的匹配问题。
- 在RoboCasa实验中,点图显著提升了模型性能,并在真实机器人实验中显示出在未见视点下的优势。
📝 摘要(中文)
视觉-语言-动作(VLA)模型通过视觉观察和语言指令预测机器人动作。这些动作在机器人的三维坐标系中定义,而大多数VLA模型则在相机坐标系中观察场景,导致观察和动作定义之间的帧不匹配。虽然在固定视点下这种不匹配影响较小,但在大规模数据集中,随着不同相机设置的演示聚合,政策必须在不同视点间进行泛化。为了解决这一问题,本文提出了机器人中心点图,这些图像的像素存储了场景点在机器人坐标系中的三维坐标。点图提供了机器人框架的三维几何信息,同时保留了预训练的二维VLA所期望的密集H x W网格,从而能够最小化架构变更地集成到现有VLA中。在RoboCasa上,点图提升了pi0.5和SmolVLA的性能,并超越了代表性的相机视点和三维感知基线。在真实机器人实验中,当相机移动到训练期间未见的放置位置时,点图相较于仅使用RGB的策略表现出更大的优势。
🔬 方法详解
问题定义:本文旨在解决视觉-语言-动作模型中观察和动作定义之间的帧不匹配问题。现有方法在不同相机视点下的泛化能力不足,导致性能下降。
核心思路:论文提出的机器人中心点图通过在机器人坐标系中表示场景点的三维坐标,解决了这一帧不匹配问题,从而提高了模型的泛化能力。
技术框架:整体架构包括输入的视觉数据转换为机器人中心点图,随后与语言指令结合,最终生成机器人动作。该框架在保持原有VLA结构的基础上,最小化了架构变更。
关键创新:最重要的创新点在于引入了机器人中心点图,这一方法与传统的相机视点方法本质上不同,能够有效提供机器人所需的三维几何信息。
关键设计:关键设计包括点图的生成方式、与现有VLA模型的集成策略,以及在训练过程中使用的损失函数和参数设置,以确保模型在不同视点下的鲁棒性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,使用点图的模型在RoboCasa数据集上显著提升了pi0.5和SmolVLA的性能,超越了传统相机视点和三维感知基线。在真实机器人实验中,当相机位置变化时,点图模型的优势更加明显,表明其在动态环境中的有效性。
🎯 应用场景
该研究的潜在应用领域包括自主机器人、智能家居和工业自动化等场景。通过提高机器人在复杂环境中的理解和操作能力,能够显著提升其在实际应用中的表现和效率,具有重要的实际价值和未来影响。
📄 摘要(原文)
Vision-language-action (VLA) models predict robot actions from visual observations and language instructions. These actions are defined in the robot's own 3D coordinate frame, yet most VLAs observe the scene in the camera frame, creating a frame mismatch between where the scene is observed and where actions are defined. The mismatch is benign under a fixed viewpoint, where the policy can memorize a single observation-to-action mapping, but grows harder as large-scale datasets aggregate demonstrations across diverse camera setups and the policy must generalize this mapping across viewpoints. We address this mismatch with robot-centric pointmaps, images whose pixels store the 3D coordinates of scene points in the robot frame. Pointmaps provide robot-frame 3D geometry while preserving the dense H x W grid expected by pretrained 2D VLAs, so they integrate into existing VLAs with minimal architectural change. On RoboCasa, pointmaps improve both pi0.5 and SmolVLA and outperform representative camera-viewpoint and 3D-aware baselines. In real-robot experiments, their advantage over an RGB-only policy widens when the camera is moved to a placement unseen during training.