Causally Debiased Latent Action Model for Embodied Action Conditioned World Models

📄 arXiv: 2607.09185v1 📥 PDF

作者: Yufan Wei, Kun Zhou, Lingjun Mao, Zijun Zhang, Ziming Xu, Ziqiao Xi, Shuang Liang, Ruobing Han, Yuchen Yan, Xinyue Wang, Fan Feng, Biwei Huang

分类: cs.CV, cs.RO

发布日期: 2026-07-10


💡 一句话要点

提出CD-LAM以解决可控动作模型中的偏差问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 动作条件世界模型 潜在动作模型 因果去偏 机器人规划 对比学习 视觉保真度 动态建模

📋 核心要点

  1. 现有的动作条件世界模型在学习可控性方面面临挑战,尤其是依赖大量标记数据的高成本。
  2. 本文提出CD-LAM框架,通过因果去偏的方法,结合三种微调目标来优化潜在动作模型的表现。
  3. 实验结果表明,CD-LAM在潜在动作可控性、机器人动作跟随和视觉保真度方面显著优于基线,且微调效率更高。

📝 摘要(中文)

动作条件世界模型(ACWMs)旨在模拟基于具身动作的未来观察,为机器人规划、策略评估和数据增强提供了良好的基础。然而,学习可控的ACWMs需要大量标记的动作数据,这在现实中收集成本高昂。潜在动作模型(LAMs)通过从未标记视频中推断潜在动作来缓解这一瓶颈,但现有的LAMs通常仅通过重建目标进行训练,因此将与动作相关的动态与背景等与动作无关的视觉因素混淆。本文识别出这种与动作无关的偏差是可控ACWMs的主要障碍,并提出评估指标来衡量潜在动作偏差、动作跟随和鲁棒性。我们提出了CD-LAM,一个用于基于LAM的ACWMs的因果去偏框架,结合了三种高效的微调目标,显著提高了潜在动作的可控性和视觉保真度。

🔬 方法详解

问题定义:本文旨在解决现有潜在动作模型在训练过程中由于仅依赖重建目标而导致的与动作无关的偏差问题。这种偏差妨碍了可控动作条件世界模型的有效学习。

核心思路:CD-LAM框架通过引入因果去偏的策略,结合三种微调目标,旨在提高潜在动作的可控性和与动作相关的动态表现。

技术框架:CD-LAM的整体架构包括三个主要模块:具身中心重建、动作中心对比学习和潜在空间校准。这些模块共同作用,优化潜在动作的表示。

关键创新:CD-LAM的创新点在于其因果去偏的设计,通过明确区分与动作相关和无关的动态,提升了模型的可控性和鲁棒性。

关键设计:在微调过程中,CD-LAM采用了特定的损失函数来平衡重建和对比学习目标,同时在潜在空间中进行校准,以确保动作表示的准确性和一致性。具体参数设置和网络结构设计在实验中经过精心调整,以实现最佳性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,CD-LAM在潜在动作可控性方面提高了显著的性能,机器人动作跟随的视觉保真度提升超过12倍,且仅需6k微调步骤,相较于基线方法显著减少了机器人动作适应更新的次数。

🎯 应用场景

该研究的潜在应用领域包括机器人规划、自动化控制和虚拟环境中的智能体行为模拟。通过提高动作模型的可控性,CD-LAM能够在复杂环境中实现更高效的决策和适应能力,具有广泛的实际价值和未来影响。

📄 摘要(原文)

Action-conditioned world models (ACWMs) aim to simulate future observations conditioned on embodied actions, offering a promising foundation for robot planning, policy evaluation, and data augmentation. However, learning controllable ACWMs requires large-scale action-labeled data, which remains costly to collect in the real world. Latent action models (LAMs) mitigate this bottleneck by inferring latent actions from unlabeled videos, but existing LAMs are typically trained with reconstruction-only objectives and therefore entangle action-relevant dynamics with action-irrelevant visual factors such as backgrounds and untouched objects. In this work, we identify this action-irrelevant bias as a key obstacle to controllable ACWMs and introduce evaluation metrics to measure latent-action bias, action following, and robustness. We propose CD-LAM, a causally debiased framework for LAM-based ACWMs. CD-LAM introduces three efficient fine-tuning objectives: embodiment-centric reconstruction, action-centric contrastive learning, and latent space calibration, which together encourage embodiment-focused, action-aware, and calibrated non-collapsed latent action representations. Experiments on 2B and 14B ACWM backbones show that CD-LAM substantially improves latent-action controllability, downstream robot-action following, visual fidelity, and adaptation efficiency, requiring only 6k fine-tuning steps and more than 12$\times$ fewer robot-action adaptation updates than the baseline.