WorldDiT: A Unified Diffusion Architecture for World and Action Modeling
作者: Sen Wang, R. Gnana Praveen, Bidhan Roy, Marcos Villagra
分类: cs.LG, cs.RO
发布日期: 2026-07-27
备注: 9 pages, 4 figures
💡 一句话要点
提出WorldDiT以解决机器人控制中的视觉与动作建模问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 扩散变换器 视觉建模 动作生成 机器人控制 多模态学习
📋 核心要点
- 现有方法依赖大型预训练的视觉-语言模型,导致模型复杂性和计算成本高。
- WorldDiT通过统一的扩散变换器架构,直接生成动作和视觉模型,简化了训练过程。
- 在四个LIBERO仿真套件中,WorldDiT在模型参数和成功率上均表现优异,提供了新的基线。
📝 摘要(中文)
许多近期的机器人策略通过使用大型预训练的视觉-语言模型(VLMs)作为动作基础来追求更强的控制能力。我们提出了WorldDiT,这是一种统一的扩散变换器架构,将动作生成与视觉世界建模结合在一起,且无需大型预训练的VLM动作基础。在训练过程中,单个扩散变换器生成连续的动作块,并预测来自未来相机帧的标准化RGB补丁目标。在四个LIBERO仿真套件中,WorldDiT在报告的Pareto前沿上,模型参数总数和平均成功率均表现出色。这些结果为未来的扩展研究提供了一个强大的不足十亿参数的基线。
🔬 方法详解
问题定义:本论文旨在解决机器人控制中视觉与动作建模的耦合问题,现有方法通常依赖于大型预训练的视觉-语言模型,导致模型复杂且难以扩展。
核心思路:提出WorldDiT架构,通过单个扩散变换器同时生成动作和预测视觉信息,避免了对大型VLM的依赖,从而简化了模型结构和训练过程。
技术框架:WorldDiT的整体架构包括两个主要模块:动作生成模块和视觉建模模块。动作生成模块负责生成连续的动作块,而视觉建模模块则预测未来相机帧的RGB补丁目标。
关键创新:WorldDiT的核心创新在于将动作生成与视觉建模统一在一个扩散变换器中,这与传统方法的分离架构形成鲜明对比,显著提高了模型的效率和性能。
关键设计:在设计中,采用了特定的损失函数来优化动作生成和视觉预测的准确性,并通过调整网络结构来平衡模型的复杂性与性能。
🖼️ 关键图片
📊 实验亮点
在四个LIBERO仿真套件中,WorldDiT在模型参数和成功率上均处于报告的Pareto前沿,展示了其在不足十亿参数下的强大性能。这为未来的扩展研究提供了有力的基线。
🎯 应用场景
该研究的潜在应用领域包括自主机器人、智能监控和人机交互等。通过简化模型结构,WorldDiT能够在资源受限的环境中实现高效的视觉与动作协同,具有重要的实际价值和广泛的应用前景。
📄 摘要(原文)
Many recent robot policies pursue stronger control by using large pretrained vision-language models (VLMs) as the action backbone. We introduce WorldDiT, a unified diffusion transformer architecture that couples action generation with visual world modeling and achieves strong performance without a large pretrained VLM action backbone. During training, a single diffusion transformer generates continuous action chunks and predicts normalized RGB patch targets from future camera frames. Across four LIBERO simulation suites, WorldDiT lies on the reported Pareto frontier for total model parameters and mean success among methods reporting all four suites. These results provide a strong sub-billion-parameter baseline for future scaling studies.