MobileWan: Closing the Quality Gap for Mobile Video Diffusion

📄 arXiv: 2607.06173v1 📥 PDF

作者: Mohsen Ghafoorian, Denis Korzhenkov, Adil Karjauv, Ioannis Lelekas, Noor Fathima, Spyridon Stasis, Hanno Ackermann, Boris van Breugel, Markus Nagel, Fatih Porikli, Animesh Karnewar, Amirhossein Habibian

分类: cs.CV

发布日期: 2026-07-07

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出MobileWan以解决移动视频生成质量不足问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 视频扩散 移动设备 递归蒸馏 结构化压缩 高质量生成 变换器架构 内存优化 注意力机制

📋 核心要点

  1. 现有移动视频扩散模型参数预算有限,导致生成质量不足,无法满足高质量视频生成的需求。
  2. 本文提出了一种新的5B参数视频扩散变换器MobileWan,通过递归蒸馏框架将视频生成转化为块自回归过程,优化内存使用。
  3. 实验结果表明,MobileWan在480x832分辨率下以16 FPS生成视频,VBench得分达到83.79,显著提升了移动视频生成的性能。

📝 摘要(中文)

近年来,视频扩散技术的进步主要依赖于将基于变换器的架构扩展到数十亿参数,从而显著提高了视觉保真度和运动一致性。然而,现有的移动视频扩散模型通常限制在0.4-1.8B的参数预算,影响生成质量。本文展示了高质量的移动视频生成并不需要小模型,而是通过递归重构和结构化压缩,可以有效地在内存受限的移动硬件上部署一个5B参数的视频扩散变换器。我们提出的MobileWan模型在生成480x832分辨率的5秒视频时,达到了16 FPS的速度和20秒的端到端延迟,VBench得分为83.79,创造了移动视频生成的新标杆。

🔬 方法详解

问题定义:本文旨在解决现有移动视频扩散模型在参数预算限制下导致的生成质量不足的问题。现有模型通常在0.4-1.8B参数范围内,无法实现高质量视频生成。

核心思路:论文的核心思路是通过递归重构和结构化压缩技术,允许在内存受限的移动设备上高效部署一个5B参数的视频扩散变换器。通过将视频生成转化为块自回归过程,模型在推理时表现得像RNN,同时保持时间一致性。

技术框架:整体架构包括递归蒸馏框架、因果线性注意力机制和可学习的注意力头修剪方法。模型通过块处理和常量内存注意力计算来优化性能,结合噪声偏置稀疏目标进行端到端优化。

关键创新:最重要的技术创新在于将5B参数的视频扩散模型有效地部署到移动设备上,突破了以往小模型的限制,首次实现高质量视频生成。

关键设计:模型采用了基于二进制每头门控的可学习注意力头修剪方法,结合采样步骤蒸馏和内存优化的VAE解码,确保在生成过程中高效利用内存和计算资源。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,MobileWan在480x832分辨率下以16 FPS生成5秒视频,达到了20秒的端到端延迟,VBench得分为83.79,创造了移动视频生成的新标准,显著优于现有的移动视频生成模型。

🎯 应用场景

MobileWan的研究成果在多个领域具有广泛的应用潜力,包括移动设备上的视频生成、实时视频编辑、虚拟现实和增强现实等场景。随着移动硬件性能的提升,该模型能够为用户提供高质量的视频内容生成,推动相关应用的发展。

📄 摘要(原文)

Recent advances in video diffusion have been driven by scaling transformer-based architectures to billions of parameters, substantially improving visual fidelity and motion coherence. In contrast, existing mobile video diffusion models remain limited to relatively small parameter budgets, typically 0.4-1.8B, restricting generation quality. In this work, we show that high-quality mobile video generation does not require small models. Instead, we demonstrate that a server-scale 5B-parameter video diffusion transformer can be deployed efficiently on memory-constrained mobile hardware through recurrent reformulation and structured compression. Starting from Wan2.2-5B, we rely on a recurrence distillation framework that converts video generation into a chunk-wise autoregressive process with constant-memory attention computation. Combined with causal linear attention, the model operates as an RNN at inference time while preserving temporal coherence across chunks. We further propose a learnable attention head pruning method based on binary per-head gates optimized end-to-end using a noise-biased sparsity objective and distillation-based finetuning. Together with sampling-step distillation and memory-optimized VAE decoding, MobileWan becomes the first 5B-scale video diffusion model deployable on a commercial mobile device. Our system generates 5-second 480x832 videos at 16 FPS in 20 seconds end-to-end latency, achieving a VBench score of 83.79 and establishing a new state of the art in mobile video generation. Project page: https://qualcomm-ai-research.github.io/mobilewan