Qwen-Image-2.0 Technical Report

📄 arXiv: 2605.10730v1 📥 PDF

作者: Bing Zhao, Chenfei Wu, Deqing Li, Hao Meng, Jiahao Li, Jie Zhang, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kuan Cao, Kun Yan, Liang Peng, Lihan Jiang, Niantong Li, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Xihua Wang, Yan Shu, Yanran Zhang, Yi Wang, Yilei Chen, Ying Ba, Yixian Xu, Yujia Wu, Yuxiang Chen, Zecheng Tang, Zekai Zhang, Zhendong Wang, Zihao Liu, Zikai Zhou, An Yang, Chen Cheng, Chenxu Lv, Dayiheng Liu, Fan Zhou, Hantian Xiong, Hongzhu Shi, Hu Wei, Huihong Zhao, Ivy Liu, Jianwei Zhang, Jiawei Zhang, Kai Chen, Kang He, Levon Xue, Lin Qu, Linhan Tang, Luwen Feng, Minggang Wu, Minmin Sun, Na Ni, Rui Men, Shuai Bai, Sishou Zheng, Tao Lan, Tianqi Zhang, Tingkun Wen, Wei Wang, Weixu Qiao, Weiyi Lu, Wenmeng Zhou, Xiaodong Deng, Xiaoxiao Xu, Xinlei Fang, Xionghui Chen, Yanan Wang, Yang Fan, Yichang Zhang, Yixuan Xu, Yu Wu, Zhiyuan Ma, Zhizhi Cai

分类: cs.CV

发布日期: 2026-05-11


💡 一句话要点

Qwen-Image-2.0:提出全能型图像生成基础模型,实现高保真生成与精准编辑的统一

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 图像生成 多模态大模型 扩散Transformer 文本渲染 图像编辑 指令遵循

📋 核心要点

  1. 现有模型在处理超长文本渲染、多语言排版及复杂构图场景时,往往表现出指令遵循能力弱、文本保真度低等局限性。
  2. 采用Qwen3-VL作为条件编码器,结合多模态扩散Transformer架构,通过大规模数据 curation 和多阶段训练实现联合建模。
  3. 实验表明该模型在文本密集型内容生成及写实图像质量上均有显著提升,在多项人类评估指标中大幅超越前代Qwen-Image系列。

📝 摘要(中文)

本文介绍了Qwen-Image-2.0,这是一个全能型图像生成基础模型,在单一框架内统一了高保真生成与精准图像编辑功能。尽管近期进展显著,现有模型在超长文本渲染、多语言排版、高分辨率写实感、指令遵循及高效部署方面仍面临挑战,特别是在文本密集和构图复杂的场景中。Qwen-Image-2.0通过将Qwen3-VL作为条件编码器,结合多模态扩散Transformer进行联合条件-目标建模,并辅以大规模数据清洗和定制化的多阶段训练流程,有效解决了上述问题。该模型支持长达1K token的指令输入,能够生成幻灯片、海报、信息图表及漫画等文本密集型内容,显著提升了多语言文本保真度与排版质量,同时增强了写实生成的细节、纹理与光影一致性。人类评估表明,Qwen-Image-2.0在生成与编辑任务上均大幅超越前代模型,向更通用、可靠且实用的图像生成基础模型迈进了一步。

🔬 方法详解

问题定义:论文旨在解决当前图像生成模型在处理复杂指令、长文本渲染、多语言排版以及高分辨率写实生成时的性能瓶颈,特别是在需要高度语义对齐和精细化编辑的复杂场景中,现有模型难以兼顾生成质量与指令遵循的鲁棒性。

核心思路:核心思想是构建一个统一的生成与编辑框架,通过引入强大的视觉语言模型(Qwen3-VL)作为条件编码器,将多模态理解能力深度融入扩散模型,实现对复杂提示词的精准解析与条件控制。

技术框架:整体架构基于多模态扩散Transformer(Diffusion Transformer),将Qwen3-VL提取的语义特征作为条件输入,通过联合建模方式指导图像生成过程。训练流程采用多阶段策略,涵盖了从大规模预训练到针对特定任务的精细化微调。

关键创新:最重要的创新在于将视觉语言大模型(VLM)的理解能力与扩散模型的生成能力深度耦合,使得模型能够理解长达1K token的复杂指令,并支持对文本密集型内容(如海报、漫画)的精准排版与渲染。

关键设计:模型采用了大规模高质量数据清洗策略,并针对多语言文本渲染进行了专项优化。通过多阶段训练 pipeline,在保持模型通用性的同时,显著增强了对复杂构图、光影一致性及纹理细节的控制能力。

📊 实验亮点

实验结果显示,Qwen-Image-2.0在文本渲染保真度、多语言排版准确性及复杂指令遵循能力上均有质的飞跃。在人类主观评估中,该模型在生成质量、编辑精准度及风格多样性方面均大幅领先于前代Qwen-Image模型,证明了其在处理复杂构图与文本密集型任务时的卓越性能。

🎯 应用场景

Qwen-Image-2.0在创意设计、办公自动化及多媒体内容创作领域具有广泛应用价值。其强大的长文本渲染与排版能力,可直接用于自动生成幻灯片、海报、信息图表及漫画,大幅提升内容生产效率。同时,其高保真的写实生成与精准编辑功能,为影视后期、广告设计及虚拟现实资产构建提供了可靠的工具支持。

📄 摘要(原文)

We present Qwen-Image-2.0, an omni-capable image generation foundation model that unifies high-fidelity generation and precise image editing within a single framework. Despite recent progress, existing models still struggle with ultra-long text rendering, multilingual typography, high-resolution photorealism, robust instruction following, and efficient deployment, especially in text-rich and compositionally complex scenarios. Qwen-Image-2.0 addresses these challenges by coupling Qwen3-VL as the condition encoder with a Multimodal Diffusion Transformer for joint condition-target modeling, supported by large-scale data curation and a customized multi-stage training pipeline. This enables strong multimodal understanding while preserving flexible generation and editing capabilities. The model supports instructions of up to 1K tokens for generating text-rich content such as slides, posters, infographics, and comics, while significantly improving multilingual text fidelity and typography. It also enhances photorealistic generation with richer details, more realistic textures, and coherent lighting, and follows complex prompts more reliably across diverse styles. Extensive human evaluations show that Qwen-Image-2.0 substantially outperforms previous Qwen-Image models in both generation and editing, marking a step toward more general, reliable, and practical image generation foundation models.