GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch
作者: GigaWorld Team, Angen Ye, Angyuan Ma, Boyuan Wang, Chaojun Ni, Fangzheng Ye, Guan Huang, Guo Li, Guosheng Zhao, Haodong Yan, Hengtao Li, Jiwen Lu, Kai Wang, Mingming Yu, Qitang Hu, Qiuping Deng, Songling Liu, Xiaoyu Tian, Xiaofeng Wang, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Yang Wang, Yejun Zeng, Yifan Chang, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu
分类: cs.RO
发布日期: 2026-07-20
💡 一句话要点
提出GigaWorld-Policy-0.5以提高机器人控制的推理效率
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 世界行动模型 机器人控制 推理效率 混合训练 视觉动态建模 Mixture-of-Transformers 自动化研究 动作中心化
📋 核心要点
- 现有的世界行动模型在推理时需要显式生成未来视频,导致计算开销大,影响实时应用。
- GigaWorld-Policy-0.5提出了一种动作中心化的框架,在训练时使用未来视觉动态,在推理时仅解码动作,显著提高了推理效率。
- 实验结果表明,GigaWorld-Policy-0.5在保持未来视觉动态训练优势的同时,推理延迟降低至85毫秒,提升了机器人控制的效率。
📝 摘要(中文)
世界行动模型(WAMs)通过联合建模动作和未来视觉观察,利用未来场景演变作为物理基础的动作生成的密集监督,改善机器人策略学习。然而,现有WAMs在推理时显式生成未来视频,导致计算开销大,影响实时闭环部署。GigaWorld-Policy-0.5通过动作中心化的框架解决了这一问题,在训练时使用未来视觉动态,而在推理时采用仅动作解码。该方法引入混合的动作条件世界建模(AC-WM)和WAM训练策略,增强视觉动态与机器人动作之间的耦合,提高动作表示的可迁移性。GigaWorld-Policy-0.5还采用Mixture-of-Transformers架构,专门化视觉动态建模和动作生成,推理延迟达到85毫秒,同时通过代理基础的AutoResearch管道系统搜索训练配置,优化实验设置。
🔬 方法详解
问题定义:本论文旨在解决现有世界行动模型在推理时显式生成未来视频所带来的高计算开销问题。这种设计限制了实时闭环部署的能力。
核心思路:GigaWorld-Policy-0.5采用动作中心化的框架,训练时利用未来视觉动态,而在推理时仅解码动作。这种设计旨在减少推理时的计算负担,提高效率。
技术框架:整体架构包括预训练阶段和推理阶段。在预训练阶段,结合了动作条件世界建模(AC-WM)和WAM训练策略;在推理阶段,采用Mixture-of-Transformers架构,将视觉动态建模和动作生成分离为专门的专家模块。
关键创新:GigaWorld-Policy-0.5的主要创新在于其混合训练策略和Mixture-of-Transformers架构,这与现有方法的显式视频生成方式形成了本质区别,显著降低了推理时的计算需求。
关键设计:在训练过程中,采用了混合的损失函数以增强视觉动态与动作之间的耦合,同时在网络结构上引入了Mixture-of-Transformers,以实现高效的动作生成和视觉动态建模。
🖼️ 关键图片
📊 实验亮点
实验结果显示,GigaWorld-Policy-0.5在推理效率上取得了显著提升,推理延迟降低至85毫秒,相较于传统方法有明显的性能改进。这一成果为实时机器人控制提供了更为高效的解决方案。
🎯 应用场景
GigaWorld-Policy-0.5的研究成果在机器人控制、自动驾驶、智能制造等领域具有广泛的应用潜力。通过提高推理效率,该方法能够支持更复杂的实时决策系统,推动智能机器人在动态环境中的应用发展。
📄 摘要(原文)
World Action Models (WAMs) improve robot policy learning by jointly modeling actions and future visual observations, using future scene evolution as dense supervision for physically grounded action generation. However, a common design in existing WAMs is to explicitly generate future videos at inference time, incurring substantial computational overhead and hindering real-time closed-loop deployment. GigaWorld-Policy addresses this issue with an action-centered formulation, where future visual dynamics are used during training while action-only decoding is used at inference time. Building upon this framework, we present GigaWorld-Policy-0.5, an enhanced action-centered WAM designed for more efficient robot control. During pretraining, GigaWorld-Policy-0.5 adopts a mixed Action-Conditioned World Modeling (AC-WM) and WAM training strategy. This strengthens the coupling between visual dynamics and robot actions and improves the transferability of action representations for downstream policy learning. For efficient inference, GigaWorld-Policy-0.5 introduces a Mixture-of-Transformers architecture that separates visual dynamics modeling and action generation into specialized experts, reducing active computation during action-only inference and achieving 85 ms inference latency on a local RTX 4090 setup. In addition, we employ an agent-based AutoResearch pipeline to systematically search training configurations, enabling more efficient identification of optimal experimental setups while reducing the time and manual intervention required for hyperparameter tuning. Experiments and ablations show that GigaWorld-Policy-0.5 preserves the training benefits of future visual dynamics while improving inference efficiency for robot control.