Orca: The World is in Your Mind
作者: Yihao Wang, Yuheng Ji, Mingyu Cao, Yanqing Shen, Runze Xiao, Huaihai Lyu, Senwei Xie, Euan Liu, Klara Tian, Tianfeng Long, Yichi Zhang, Zhengliang Cai, Ruike Chen, Jifan Zhao, Ruochuan Shi, Zihan Tang, Jing Lyu, Wenxing Tan, Ningbo Zhang, Yangtao Hu, Yuming Gao, Xiansheng Chen, Junkai Zhao, Congsheng Xu, Boan Zhu, Ziqi Wang, Yupu Feng, Qiongqiong Zhang, Yingli Zhao, Yulong Ao, Shaoxuan Xie, You Liu, Guocai Yao, Leiduo Zhang, Xiaodan Liu, Yunyan Zhang, Yance Jiao, Xinyan Yang, Jiaxing Wei, Xu Liu, Tengfei Pan, Shaokai Nie, Chunlei Men, Sen Cui, Xiaojie Jin, Hongyang Li, Jianlan Luo, Yao Mu, Yunchao Wei, Jun Yan, Hang Zhao, Xiaolong Zheng, Jiaming Li, Yonghua Lin, Tiejun Huang, Zhongyuan Wang, Pengwei Wang
分类: cs.CV
发布日期: 2026-07-20
💡 一句话要点
提出Orca模型以实现多模态世界状态预测
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态学习 状态预测 视频理解 语言描述 视觉问答 世界基础模型 深度学习
📋 核心要点
- 现有方法往往专注于孤立的下一个标记或动作预测,缺乏对状态转移的全面理解。
- Orca通过下一状态预测建模,结合无意识和意识学习,提供了一种统一的世界理解方式。
- 实验结果显示,Orca在文本生成、图像预测和体态动作生成等下游任务中表现优异,超越了同类基线。
📝 摘要(中文)
我们介绍了Orca,一个通用世界基础模型的初步实现。Orca从多模态世界信号中学习统一的世界潜在空间,并通过多模态读取接口进行展示。我们关注于下一状态预测建模,提供了一条统一的状态转移建模路径,以理解、预测和对世界采取行动。Orca通过无意识学习和意识学习两种互补范式进行学习,前者捕捉连续视频中的密集自然状态转移,后者通过语言描述事件和视觉问答监督建模稀疏有意义的状态转移。我们构建了一个大规模的世界学习数据集,包括125K小时的视频数据和160M事件注释。实验表明,Orca在下游任务中表现优越,超越了类似规模的专门基线,展示了作为通用世界基础模型的潜力。
🔬 方法详解
问题定义:本论文旨在解决现有多模态学习方法在状态转移理解上的不足,现有方法通常只关注单一的下一个标记或动作预测,缺乏对世界状态的全面建模。
核心思路:Orca的核心思路是通过下一状态预测建模,整合多模态信号,学习统一的世界潜在空间。通过无意识学习和意识学习的结合,Orca能够捕捉到丰富的状态转移信息。
技术框架:Orca的整体架构包括两个主要阶段:无意识学习阶段从连续视频中提取自然状态转移,意识学习阶段则通过语言描述和视觉问答监督来建模有意义的状态转移。最终,模型通过轻量级的模态特定解码器进行下游任务的训练。
关键创新:Orca的主要创新在于提出了一种统一的状态转移建模方法,区别于传统的单一预测任务,能够更全面地理解和预测世界状态。
关键设计:在训练过程中,Orca使用了大规模的世界学习数据集,包含125K小时的视频和160M事件注释。模型的主干网络被冻结,仅训练轻量级的解码器,以提高训练效率和效果。实验验证了更强的世界潜在空间能够提升下游任务的性能。
🖼️ 关键图片
📊 实验亮点
实验结果表明,Orca在文本生成、图像预测和体态动作生成等下游任务中表现优于同类专门基线,展示了其强大的可扩展性和有效性。具体而言,Orca在这些任务中实现了显著的性能提升,验证了其作为通用世界基础模型的潜力。
🎯 应用场景
Orca模型在多模态学习和人工智能领域具有广泛的应用潜力。它可以用于视频理解、智能助手、自动驾驶等场景,通过对世界状态的深刻理解,提升机器的决策能力和交互体验。未来,Orca有望推动更智能的机器人和自动化系统的发展。
📄 摘要(原文)
We introduce Orca, an initial instantiation of a general world foundation model. Orca learns a unified world latent space from multimodal world signals and exposes it through multimodal readout interfaces. Rather than optimizing isolated next-token, next-frame, or next-action prediction, we are centered on Next-State-Prediction modeling, offering a unified state-transition modeling route toward understanding, predicting, and acting upon the world. Orca learns through two complementary paradigms: unconscious learning captures dense natural state transitions from continuous videos, and conscious learning models sparse meaningful state transitions by language-described events and VQA supervision. For pre-training, we construct a large-scale world-learning inventory data, including 125K hours of video data and 160M event annotations. After pre-training, Orca learns a unified world latent space. To examine whether the learned latent supports downstream, we evaluate it by three representative downstream readouts: text generation, image prediction, and embodied action generation. Orca's backbone is frozen, and only the lightweight modality-specific decoders are trainable. Experiments show the scalability of the proposed paradigm and verify that stronger world latent enables stronger downstream readouts. Orca outperforms similar-sized specialized baselines. These results show that Orca, as a general world foundation model, presents a promising approach to understanding, predicting, and acting upon the world. Finally, we discuss the current limitations, aiming to provide useful insights and inspiration for the community.