LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments

📄 arXiv: 2607.23969v1 📥 PDF

作者: Pei Liu, Nan Zheng, Lang Zhang, Daojie Peng, Yanan Zhang, Feilong Kong, Mingyue Feng, Jiachao Liu, Yaonong Wang, Qifeng Chen, Jun Ma

分类: cs.RO

发布日期: 2026-07-27

🔗 代码/项目: GITHUB


💡 一句话要点

提出LeapBot-WA以解决WAMs在视觉生成中的瓶颈问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 世界动作模型 预测潜在范式 机器人控制 语义对齐 不对称混合变换器 零-shot鲁棒性 动态环境 潜在空间重塑

📋 核心要点

  1. 现有的世界动作模型依赖于像素级视频生成,导致模型在重建任务无关的视觉细节时,表示能力受到限制,策略易受视觉干扰。
  2. LeapBot-WA通过引入预测潜在范式,转向预测语义对齐,直接在潜在空间中提取物理动态,减少了对视觉合成的依赖。
  3. 在LIBERO数据集上,LeapBot-WA实现了预测模型的最先进性能,并在RoboTwin 2.0上与顶级生成WAMs相当,展现出优越的零-shot鲁棒性。

📝 摘要(中文)

世界动作模型(WAMs)作为一种强大的具身智能范式,面临着依赖像素级视频生成的瓶颈。现有方法强迫模型重建与任务无关的视觉细节,导致表示能力的浪费,并使策略易受视觉干扰。本文提出LeapBot-WA,通过将联合嵌入预测架构(JEPA)作为世界锚,建立了一种新颖的预测潜在范式。LeapBot-WA将世界建模的核心转向预测语义对齐,直接在潜在基础空间中提取抽象物理动态。为弥合非高斯预测特征与扩散先验之间的模态差距,提出了各向同性语义自编码器(ISAE),将锚的潜在空间重塑为适合扩散的流形。此外,设计了不对称混合变换器(MoT)架构,训练期间,锚扩散变换器作为动态专家指导动作扩散变换器;推理时,修剪重动态分支,实现零开销执行。LeapBot-WA在LIBERO上实现了预测模型的最先进性能,并在RoboTwin 2.0上与顶级生成WAMs相匹配,无需大规模轨迹预训练,展现出对未见环境的优越零-shot鲁棒性和成功的现实世界迁移,建立了一种高效且稳健的潜在中心范式以实现可扩展的机器人控制。

🔬 方法详解

问题定义:本文旨在解决现有世界动作模型在依赖像素级视频生成时所面临的瓶颈,尤其是模型在重建与任务无关的视觉细节时,导致表示能力的浪费和策略的脆弱性。

核心思路:LeapBot-WA的核心思想是通过预测潜在范式,转变世界建模的核心,从传统的视觉合成转向预测语义对齐,直接在潜在空间中提取物理动态,从而提高模型的效率和鲁棒性。

技术框架:LeapBot-WA的整体架构包括联合嵌入预测架构(JEPA)作为世界锚,和各向同性语义自编码器(ISAE)用于重塑潜在空间。此外,采用不对称混合变换器(MoT)架构,训练时通过锚扩散变换器指导动作扩散变换器,推理时修剪重动态分支以实现零开销执行。

关键创新:本研究的主要创新在于引入了预测潜在范式和ISAE,成功地将锚的潜在空间转变为适合扩散的流形,解决了非高斯预测特征与扩散先验之间的模态差距。

关键设计:在设计中,ISAE用于防止潜在空间的偏移,确保模型在训练和推理阶段的稳定性;不对称混合变换器的设计使得模型在推理时能够高效执行,避免了不必要的计算开销。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在LIBERO数据集上,LeapBot-WA实现了预测模型的最先进性能,表现优于现有方法,并在RoboTwin 2.0上与顶级生成WAMs相匹配。该模型在未见环境中的零-shot鲁棒性显著提升,展示了其在实际应用中的强大能力。

🎯 应用场景

LeapBot-WA的研究成果在机器人控制、自动驾驶、虚拟现实等领域具有广泛的应用潜力。通过提高模型的鲁棒性和效率,该方法能够在复杂和动态的环境中实现更为精准的决策与控制,推动智能体在真实世界中的应用。未来,LeapBot-WA可能会促进更高效的智能系统的开发,提升人机交互的智能化水平。

📄 摘要(原文)

World Action Models (WAMs) have emerged as a powerful paradigm for embodied intelligence, yet the prevailing reliance on pixel-level video generation creates a fundamental bottleneck. Forcing models to reconstruct task-irrelevant visual details dissipates representational capacity and renders policies vulnerable to visual distractors. In this paper, we propose LeapBot-WA, which establishes a novel Predictive-Latent paradigm for WAMs by operationalizing the Joint-Embedding Predictive Architecture (JEPA) as a World-Anchor. Departing from the traditional reliance on visual synthesis, LeapBot-WA shifts the core of world modeling to Predictive Semantic Alignment, extracting abstract physical dynamics directly within a latent foundation space. To bridge the modality gap between non-Gaussian predictive features and diffusion priors, we introduce the Isotropic Semantic Autoencoder (ISAE), which reshapes the anchor's latent space into a diffusion-friendly manifold to prevent off-manifold drift. Furthermore, we design an Asymmetric Mixture-of-Transformers (MoT) architecture. During training, an Anchor Diffusion Transformer acts as a privileged dynamics expert to guide the Action Diffusion Transformer; at inference, this heavy dynamics branch is pruned, enabling zero-overhead execution. LeapBot-WA achieves state-of-the-art performance among predictive models on LIBERO and matches top-tier generative WAMs on RoboTwin 2.0 without requiring large-scale trajectory pre-training. It further demonstrates superior zero-shot robustness to unseen environments and successful real-world transfer, establishing a highly efficient and robust latent-centric paradigm for scalable robotic control. Code: https://github.com/LeapWM/leapbot-wa.