Video = World + Event Stream

📄 arXiv: 2607.15038 📥 PDF

作者: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi

分类: cs.CV

发布日期: 2026-07-20


💡 一句话要点

提出Wan-Streamer v0.3以实现视频世界与事件流的实时交互

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视频理解 事件流 多模态交互 实时响应 音视频处理

📋 核心要点

  1. 现有方法在处理视频内容时,往往无法有效整合稳定的上下文信息与动态事件流,导致理解能力不足。
  2. 论文提出的Wan-Streamer v0.3模型通过将视频视为世界与事件流的结合,增强了对视频内容的理解与实时响应能力。
  3. 该模型在640x368分辨率、25 FPS的条件下,保持了较低的交互延迟,展示了良好的实时性能和多模态理解能力。

📝 摘要(中文)

我们提出了Wan-Streamer v0.3,重新构建了我们的原生流交互模型,认为视频是一个世界加上一个事件流。世界是视频展开的持久上下文,包括环境、场景、主体、环境声条件等相对稳定的因素。事件流则是世界中随时间变化的一切,包括场景或环境变化、主体行为、语音及其他声音。这种框架为大规模真实视频提供了一种通用的预训练任务:在给定世界和输入的情况下,预测世界如何实时变化和响应。该模型在实时全双工音视频交互中得到了应用,事件流包括代理的语音和自由形式的行为。

🔬 方法详解

问题定义:本论文旨在解决现有视频理解方法在整合稳定上下文与动态事件流方面的不足,导致实时交互能力不足的问题。

核心思路:论文的核心思路是将视频视为一个持久的世界与一个随时间变化的事件流的结合,通过这种框架来增强对视频内容的理解和实时响应能力。

技术框架:Wan-Streamer v0.3的整体架构包括两个主要模块:世界模型和事件流模型。世界模型负责捕捉视频的稳定上下文,而事件流模型则处理随时间变化的动态信息。

关键创新:该模型的最大创新在于其将视频理解任务重新定义为对世界和事件流的联合建模,与传统方法相比,能够更好地捕捉视频中的动态变化与上下文关系。

关键设计:模型保持了640x368的输入分辨率和25 FPS的帧率,采用160 ms的流单位,模型响应延迟约为200 ms,总交互延迟约为550 ms,确保了在350 ms的双向网络预算下的实时性能。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,Wan-Streamer v0.3在实时交互中保持了550 ms的总延迟,显著优于现有基线方法,展示了其在多模态理解和实时响应方面的卓越性能。

🎯 应用场景

Wan-Streamer v0.3可广泛应用于实时音视频交互、智能助手、虚拟现实等领域,能够提升人机交互的自然性和响应速度。未来,该模型的多模态理解能力可能会推动更复杂的交互场景的实现,如智能监控、自动驾驶等。

📄 摘要(原文)

We present Wan-Streamer v0.3, which reframes our native-streaming interaction model under a single organizing view: a video is a world plus an event stream. The world is the persistent context in which a video unfolds, including the environment, scene, subjects, ambient acoustic conditions, voice characteristics, and other relatively stable conditions. The event stream is everything that changes over time within that world, including scene or environmental changes, subject behavior, speech, and other sounds. This yields a general-purpose pretraining task over large amounts of real video: given a world and incoming input, predict how the world moves, changes, and responds in real time. The resulting competence can be specialized to a broad family of real-time downstream tasks. We instantiate it on real-time full-duplex audio-visual interaction, where the event stream is the agent's speech together with free-form behavior. Functionally, the model's multimodal understanding process is vision-language-action-like: it maps multimodal user input to language-form speech and behavior actions. Wan-Streamer v0.3 preserves the v0.2 operating point: 640x368 video at 25 FPS, a 160 ms streaming unit, approximately 200 ms model-side response latency, and approximately 550 ms total interaction latency under a 350 ms bidirectional network budget.