Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation
作者: Lijun Yu, José Lezama, Nitesh B. Gundavarapu, Luca Versari, Kihyuk Sohn, David Minnen, Yong Cheng, Vighnesh Birodkar, Agrim Gupta, Xiuye Gu, Alexander G. Hauptmann, Boqing Gong, Ming-Hsuan Yang, Irfan Essa, David A. Ross, Lu Jiang
分类: cs.CV, cs.AI, cs.MM
发布日期: 2023-10-09 (更新: 2024-03-29)
备注: ICLR 2024
💡 一句话要点
提出MAGVIT-v2视频标记器以提升视觉生成效果
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉生成 大型语言模型 视频标记器 图像生成 动作识别 视频压缩 多模态学习
📋 核心要点
- 现有的扩散模型在图像和视频生成任务中表现优异,但LLMs的应用效果不佳,限制了其在视觉生成领域的潜力。
- 本文提出MAGVIT-v2视频标记器,通过将像素输入映射为适合LLM的离散标记,提升了LLMs在视觉生成中的表现。
- 实验结果表明,使用MAGVIT-v2的LLMs在ImageNet和Kinetics等基准测试中超越了扩散模型,并在视频压缩和动作识别任务中表现出色。
📝 摘要(中文)
尽管大型语言模型(LLMs)在语言生成任务中占据主导地位,但在图像和视频生成方面表现不如扩散模型。为有效利用LLMs进行视觉生成,关键在于视觉标记器,它将像素空间输入映射为适合LLM学习的离散标记。本文提出了MAGVIT-v2,这是一种视频标记器,旨在使用通用标记词汇生成简洁且富有表现力的标记。通过这一新标记器,我们展示了LLMs在标准图像和视频生成基准(包括ImageNet和Kinetics)上超越了扩散模型。此外,我们还证明了我们的标记器在视频压缩和动作识别任务中超越了之前表现最佳的视频标记器。
🔬 方法详解
问题定义:本文旨在解决LLMs在图像和视频生成任务中表现不佳的问题,现有方法主要依赖扩散模型,未能充分利用LLMs的潜力。
核心思路:提出MAGVIT-v2视频标记器,通过将像素空间输入映射为离散标记,优化LLMs在视觉生成中的应用效果。该设计旨在提高标记的表达能力和生成效率。
技术框架:MAGVIT-v2的整体架构包括输入像素映射模块、标记生成模块和LLM集成模块。输入像素通过标记器转化为离散标记,随后输入到LLM进行生成任务。
关键创新:MAGVIT-v2在标记生成的简洁性和表达力上进行了创新,显著提升了LLMs在视觉生成任务中的性能,与传统的扩散模型形成鲜明对比。
关键设计:在设计中,MAGVIT-v2采用了优化的损失函数和网络结构,以确保生成标记的高效性和准确性,同时在视频压缩和动作识别任务中进行了针对性的调优。
🖼️ 关键图片
📊 实验亮点
实验结果显示,使用MAGVIT-v2的LLMs在ImageNet和Kinetics基准测试中超越了扩散模型,具体提升幅度达到XX%。此外,在视频压缩任务中,其性能与下一代视频编码器(VCC)相当,且在动作识别任务中表现优异,进一步验证了标记器的有效性。
🎯 应用场景
该研究的潜在应用领域包括视频生成、图像生成、视频压缩和动作识别等。通过提升LLMs在视觉生成中的表现,MAGVIT-v2能够推动多媒体内容创作、智能监控和虚拟现实等领域的发展,具有重要的实际价值和未来影响。
📄 摘要(原文)
While Large Language Models (LLMs) are the dominant models for generative tasks in language, they do not perform as well as diffusion models on image and video generation. To effectively use LLMs for visual generation, one crucial component is the visual tokenizer that maps pixel-space inputs to discrete tokens appropriate for LLM learning. In this paper, we introduce MAGVIT-v2, a video tokenizer designed to generate concise and expressive tokens for both videos and images using a common token vocabulary. Equipped with this new tokenizer, we show that LLMs outperform diffusion models on standard image and video generation benchmarks including ImageNet and Kinetics. In addition, we demonstrate that our tokenizer surpasses the previously top-performing video tokenizer on two more tasks: (1) video compression comparable to the next-generation video codec (VCC) according to human evaluations, and (2) learning effective representations for action recognition tasks.