Grounding Generated Video Plans in Simulation Towards Versatile Dexterous Controllers

📄 arXiv: 2609.10050v1 📥 PDF

作者: Tianyue Wu, Boyuan An, Shuqi Zhao, Heyu Guo, Wanli Xing, Yi Ma, Kaifeng Zhang, Ruihai Wu, Masayoshi Tomizuka

分类: cs.RO

发布日期: 2026-09-09

备注: Project website: https://boyuan-an.github.io/GALATEA/

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出基于生成视频的手-物体交互跟踪方法以解决控制器灵活性问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱五:交互与反应 (Interaction & Reaction)

关键词: 手-物体交互 生成视频 仿真跟踪 多物体跟踪 运动计划 机器人控制 闭环实验

📋 核心要点

  1. 现有的基于仿真的手-物体交互跟踪方法缺乏可靠的参考动作,限制了其可扩展性。
  2. 本文提出了一种结合生成视频与仿真基础的HOI跟踪方法,通过生成视频提供多样的运动参考来训练跟踪器。
  3. 实验结果表明,该方法在仿真中成功率提高超过25个百分点,并在真实环境中实现了多样化的抓取动作。

📝 摘要(中文)

生成的手-物体交互(HOI)视频为操控动作的提出提供了一种可控方式。然而,基于仿真的HOI跟踪由于缺乏可靠的参考动作而限制了其可扩展性。为此,本文结合生成视频与基于仿真的HOI基础,提出了一种方法,在训练过程中利用生成视频提供多样的运动参考,学习多物体、多轨迹的HOI跟踪器,并在部署时由学习到的跟踪器执行视频模型生成的运动计划。该方法成功在仿真中实现了超过1500个生成视频的基础,成功率比基线提高了25个百分点以上,并在真实世界的闭环实验中实现了多样的抓取方式。

🔬 方法详解

问题定义:本文旨在解决生成的手-物体交互视频在仿真中缺乏可靠参考动作的问题,现有方法在可扩展性上存在不足。

核心思路:通过结合生成视频与仿真基础,利用生成视频提供多样的运动参考来训练多物体、多轨迹的HOI跟踪器,从而实现高效的运动计划执行。

技术框架:整体架构包括生成视频的创建、HOI跟踪器的训练和运动计划的执行三个主要模块。在训练阶段,生成视频用于学习跟踪器;在部署阶段,跟踪器执行生成的视频模型的运动计划。

关键创新:该方法的创新在于实现了可扩展的参考生成,通过HOI重建实现了最小的人工干预,成功在仿真中处理超过1500个生成视频,显著提高了成功率。

关键设计:在技术细节上,本文设置了特定的损失函数以优化跟踪器性能,并设计了适应多物体交互的网络结构,以确保在复杂场景下的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,该方法在仿真中的成功率比基线提高了超过25个百分点,且在真实世界的闭环实验中实现了多样的抓取方式,包括功能性抓取和非抓取操作,展示了其在实际应用中的有效性。

🎯 应用场景

该研究的潜在应用领域包括机器人抓取、智能制造和人机交互等。通过提升机器人在复杂环境中的操作能力,能够实现更高效的自动化生产和更灵活的服务机器人应用,未来可能对智能机器人领域产生深远影响。

📄 摘要(原文)

Generated hand-object interaction (HOI) videos provide a controllable way to propose manipulation motions. Simulation-based HOI tracking can translate such kinematic references into feasible low-level control, but its scalability is limited by the lack of reliable reference motions. We therefore combine generated videos with simulation-based HOI grounding: during training, generated videos provide diverse motion references for learning a multi-object, multi-trajectory HOI tracker, and at deployment, the video model produces motion plans that are executed by the learned tracker. In particular, we propose a method that enables scalable reference generation by HOI reconstruction with minimal manual intervention and successfully grounds more than 1,500 generated videos in simulation, achieving success rates over 25 percentage points higher than those of baselines during simulation-based training. In real-world closed-loop experiments, it achieves diverse grasps, including functional grasps, non-prehensile manipulation, and post-grasp object-pose tracking. Videos and code are available at https://boyuan-an.github.io/GALATEA/.