Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation

📄 arXiv: 2607.18016v1 📥 PDF

作者: Peng Ren, Haoyang Ge, Jiang Zhao, Cong Huang, Yukun Shi, Pei Chi, Kai Chen

分类: cs.RO

发布日期: 2026-07-20


💡 一句话要点

提出持久对象标记化方法以解决人形机器人长时间操控问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 人形机器人 视觉-语言-行动 持久对象标记化 闭环控制 3D对象记录

📋 核心要点

  1. 现有方法在长时间的人形机器人操控中,无法有效处理对象状态的偏差,导致任务执行不稳定。
  2. 论文提出的持久对象标记化(POT)方法,通过维护3D对象记录,实现了对象状态的可操作性和可验证性。
  3. 实验结果显示,POT-VLA在多个任务中成功率显著提升,尤其是在需要维持3D关系的任务中表现最佳。

📝 摘要(中文)

视觉-语言-行动策略为通用机器人控制提供了良好的基础,但在长时间的人形机器人行走操控中,机器人需要将任务对象视为持续的物理实体,跨越运动、接触、遮挡和恢复等过程。本文研究了对象状态偏差的问题,提出了持久对象标记化(POT)方法,通过从RGB-D观测中维护角色索引的3D对象记录,并将其转换为对象标记,以支持全身动作生成和几何谓词检查,形成一个闭环执行系统。在Unitree G1上,POT-VLA在八个真实任务家庭中将成功率从39/80提升至71/80,并在对齐服务任务中取得44/50的成功率,相较于已有方法表现出显著的提升。

🔬 方法详解

问题定义:本文解决的问题是长时间人形机器人操控中的对象状态偏差,现有方法在处理运动、接触和遮挡等情况下,无法保持对象状态的一致性,导致任务执行失败。

核心思路:论文提出的持久对象标记化(POT)方法,通过维护角色索引的3D对象记录,确保对象状态在动作生成和验证中的一致性,从而实现闭环控制。

技术框架:整体架构包括三个主要模块:RGB-D观测模块用于获取环境信息,持久对象记录模块用于维护对象状态,动作生成模块则基于对象标记生成全身动作。

关键创新:最重要的创新在于将对象状态的可操作性与可验证性结合,通过POT实现了对象状态在动作生成和验证中的双重作用,显著提升了机器人操控的可靠性。

关键设计:在设计中,采用了角色索引的3D对象记录结构,结合几何谓词检查机制,确保对象状态在不同阶段的一致性,此外,损失函数的设计也考虑了对象状态的持续性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,POT-VLA在Unitree G1上的成功率从39/80提升至71/80,且在对齐服务任务中取得44/50的成功率,显著优于已有的37/50成功率,尤其在需要维持3D关系的任务中表现出最大的提升。

🎯 应用场景

该研究的潜在应用场景包括服务机器人、工业自动化和人机协作等领域。通过提升机器人对对象状态的理解和操控能力,可以在复杂环境中实现更高效的任务执行,未来可能推动机器人在日常生活和工作中的广泛应用。

📄 摘要(原文)

Vision-language-action policies are a promising foundation for general robot control, but long-horizon humanoid loco-manipulation requires the robot to treat task objects as persistent physical entities across movement, contact, occlusion, and recovery. We study this problem as object-state divergence: the object state used to condition a whole-body action can differ from the state used to decide whether the action achieved the intended physical relation. We propose \emph{Persistent Object Tokenization} (POT), which maintains role-indexed 3D object records from RGB-D observations and converts them into object tokens for a whole-body action expert. Instantiated as \emph{POT-VLA}, the same object records condition action generation and support geometric predicate checks, yielding a closed-loop execution system in which object state is both actionable and verifiable. On a Unitree G1, POT-VLA improves a matched direct GR00T-N1.7 baseline from 39/80 to 71/80 successes over eight real-world task families. In an external Being-0-aligned reference, POT-VLA achieves 44/50 successes on aligned service tasks, compared with the 37/50 success reported by the Being-0 paper. The largest gains occur on tasks requiring maintained 3D relations, suggesting that persistent object-centered state is a useful abstraction for verifiable humanoid VLA execution.