DUET-DINO: Simultaneous Cross-View World Modeling for Latent Planning in Robot Manipulation

📄 arXiv: 2609.10506v1 📥 PDF

作者: Nisarga Nilavadi, Ralf Römer, Moritz Reuss, Michael Krawez, Tobias Jülg, Angela P. Schoellig, Rudolf Lioutikov, Wolfram Burgard

分类: cs.RO, cs.CV

发布日期: 2026-09-09

备注: Preprint, Project Page: https://utn-air.github.io/DUET-DINO

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出DUET-DINO以解决机器人操作中的跨视图世界建模问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 机器人操作 潜在世界建模 跨视图学习 动作条件预测 自动化技术

📋 核心要点

  1. 现有的动作条件潜在世界模型在细粒度空间和旋转动作的预测上存在不可靠性,影响全7自由度末端执行器的控制能力。
  2. DUET-DINO通过跨视图条件学习,结合静态侧视和手腕摄像头的观察,提升了动作条件预测的准确性。
  3. 在多种任务中,DUET-DINO的成功率显著高于传统单视图和独立双视图模型,展示了其在复杂操作中的有效性。

📝 摘要(中文)

本文提出了一种名为DUET-DINO的同时跨视图潜在世界模型,旨在通过静态侧视和手腕摄像头观察联合学习动作条件预测,从而解决现有方法在全7自由度末端执行器控制中的不可靠性。DUET-DINO利用互补的全局场景和夹持器中心信息,实现了对完整7自由度动作空间的潜在规划。在多样化的空间到达、方向密集的角度到达和多目标抓取提升任务中,DUET-DINO的表现显著优于单视图和独立双视图基线,成功率分别达到92%、72.5%和60.0%。该模型在DROID和RoboArena数据集上从零开始训练,并在视觉分布变化下表现出良好的泛化能力。

🔬 方法详解

问题定义:本文旨在解决现有动作条件潜在世界模型在细粒度空间和旋转动作预测中的不可靠性,特别是在全7自由度末端执行器控制中的应用痛点。

核心思路:DUET-DINO通过同时学习来自静态侧视和手腕摄像头的观察,利用跨视图条件来增强动作条件预测的准确性,从而实现更可靠的潜在规划。

技术框架:DUET-DINO的整体架构包括两个主要模块:静态侧视观察模块和手腕摄像头观察模块。通过交互式学习,这两个模块共同优化动作条件预测,形成一个统一的潜在世界模型。

关键创新:DUET-DINO的核心创新在于其跨视图条件学习机制,能够有效整合来自不同视角的信息,显著提升了对复杂动作的预测能力,与传统的单视图模型相比,具有本质的改进。

关键设计:在模型设计中,DUET-DINO采用了特定的损失函数来平衡不同视角的贡献,并通过精细的网络结构设计来捕捉动作条件下的场景变化,确保了模型在多种任务中的高效性和稳定性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

DUET-DINO在多样化的任务中表现出色,成功率分别达到92%(到达任务)、72.5%(角度到达任务)和60%(提升任务),显著优于单视图和独立双视图基线,展示了其在复杂操作中的优势。

🎯 应用场景

DUET-DINO的研究成果在机器人操作、自动化制造和人机交互等领域具有广泛的应用潜力。通过提高机器人在复杂环境中的操作能力,该模型能够支持更高效的自动化任务执行,推动智能机器人技术的发展。

📄 摘要(原文)

Action-conditioned latent world models predict future visual representations, enabling zero-shot goal-conditioned robot planning and control. However, their predictions for fine-grained spatial and rotational actions are unreliable for full 7-DoF end-effector control. To address this gap, we introduce DUET-DINO, a simultaneous cross-view latent world model that jointly learns action-conditioned predictions from static side- and wrist-camera observations through cross-view conditioning. By exploiting complementary global scene and gripper-centric information, DUET-DINO enables latent planning over the full 7-DoF action space. Across spatially diverse reach, orientation-intensive angled-reach, and multi-goal grasp-and-lift tasks, DUET-DINO consistently outperforms single-view and independent dual-view baselines, achieving 92% success on reach, 72.5% on angled-reach, and 60.0% on lift tasks. DUET-DINO is trained from scratch on DROID and RoboArena datasets and generalizes robustly under visual distribution shifts. We further show that while V-JEPA 2 wrist-view predictions underestimate visual dynamics induced by fine-grained actions, DINOv3 predictions better capture action-conditioned scene changes, leading to stronger downstream planning. The code and model checkpoints will be open-sourced. Project page: https://utn-air.github.io/DUET-DINO