DriftWorld: Fast World Modeling through Drifting
作者: Susie Lu, Haonan Chen, Weirui Ye, Yilun Du
分类: cs.RO, cs.CV, cs.LG
发布日期: 2026-07-16
备注: Website at https://susie-lu.github.io/driftworld/
💡 一句话要点
提出DriftWorld以解决扩散模型推理速度慢的问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 世界建模 机器人控制 生成模型 快速推理 动作条件模型
📋 核心要点
- 现有的扩散模型在推理时由于多步采样导致速度缓慢,限制了机器人在控制任务中的应用。
- DriftWorld通过在训练阶段学习动作条件漂移,能够在推理时快速生成未来帧,从而提高了模拟速度。
- 实验结果表明,DriftWorld在多个基准测试中实现了更高的决策性能,且推理时间显著低于传统扩散模型。
📝 摘要(中文)
预测世界模型使机器人能够通过想象其行为的结果进行规划,但其控制价值依赖于快速生成大量的模拟结果。扩散模型的多步采样使得每次模拟变得昂贵,从而限制了推理时的大规模动作搜索。本文提出了DriftWorld,这是一种基于漂移生成模型的动作条件世界模型。DriftWorld在训练期间学习动作条件漂移,而不是在推理时进行迭代去噪,从而能够在单次前向传递中以30帧每秒的速度生成未来帧,平均速度比基于扩散的基线快17倍。我们在多个标准视觉基础的机器人操作基准上评估了DriftWorld,结果显示其在决策性能上达到了最先进水平,且推理时间远低于扩散模型基线。
🔬 方法详解
问题定义:本文旨在解决现有扩散模型在推理时速度慢的问题,尤其是在多步采样导致的高计算成本上。现有方法在大规模动作搜索时面临瓶颈,限制了其在机器人控制中的应用。
核心思路:DriftWorld的核心思路是通过在训练阶段学习一个动作条件漂移模型,使得在推理时能够快速生成未来的状态,而无需进行多次迭代去噪。这种设计使得模型在推理时能够以更高的速度生成结果。
技术框架:DriftWorld的整体架构包括两个主要模块:动作条件漂移模型和快速推理机制。训练阶段通过输入当前观察和候选动作序列来学习漂移,而推理阶段则通过单次前向传递生成未来帧。
关键创新:DriftWorld的主要创新在于其通过学习动作条件漂移来替代传统的迭代去噪过程,从而实现了在推理时的显著加速。这一方法与现有的扩散模型本质上不同,后者依赖于多步采样。
关键设计:在设计上,DriftWorld采用了特定的损失函数来优化漂移模型的学习,并在网络结构上进行了调整,以确保在快速推理时保持生成结果的准确性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,DriftWorld在多个标准基准测试中实现了最先进的决策性能,推理速度平均比扩散模型快17倍。此外,DriftWorld的模拟结果与真实世界的策略评分相关性高达0.99,表明其在离线模拟中的有效性。
🎯 应用场景
DriftWorld的研究成果具有广泛的应用潜力,尤其是在机器人操作、自动化控制和智能系统中。通过快速生成高质量的模拟结果,DriftWorld能够支持实时决策和策略评估,提升机器人在复杂环境中的适应能力和效率。未来,该模型可能在更多实际场景中得到应用,如自主驾驶、工业机器人和服务机器人等领域。
📄 摘要(原文)
Predictive world models enable robots to plan by imagining the outcomes of their actions, but their value for control hinges on generating many rollouts quickly. This creates a bottleneck for diffusion-based world models: multistep sampling makes each rollout expensive, limiting large-scale action search at inference time. We introduce DriftWorld, an action-conditioned world model based on drifting generative models. Rather than denoising iteratively at inference, DriftWorld learns an action-conditioned drift during training, allowing it to generate future frames from the current observation and a candidate action sequence in a single forward pass at 30+ fps, which is 17x faster on average than diffusion based baselines. We evaluate DriftWorld on standard vision-based robotic manipulation benchmarks, including Bridge-V2, RT-1, Language Table, Push-T, and Robomimic. By producing rollouts that are both accurate and fast, DriftWorld achieves state-of-the-art decision-making performance with far less inference time than diffusion-based world model baselines. Beyond online control, DriftWorld can also serve as an offline simulator for ranking real-world robot policies, with rollout-based scores correlating with ground truth at up to 0.99. These results show that drifting models are a strong fit for robot world modeling, where fast, high-quality imagination directly supports planning and policy evaluation.