FourTune: Towards Fully 4-Bit Efficient Post-Training for Diffusion Models
作者: Bowen Xue, Zihan Min, Xingyang Li, Zhekai Zhang, Haocheng Xi, Lvmin Zhang, Maneesh Agrawala, Jun-Yan Zhu, Song Han, Yujun Lin, Muyang Li
分类: cs.LG, cs.CV
发布日期: 2026-07-07
💡 一句话要点
提出FourTune以解决扩散模型后训练效率低下问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 扩散模型 后训练 量化技术 高效微调 生成建模 深度学习
📋 核心要点
- 现有的扩散模型后训练方法面临内存占用高和训练速度慢的问题,限制了其在多样化应用中的适应性。
- FourTune通过引入三分支混合管道和冻结数值稳定器,实现在4位计算下的稳定训练,显著提高了后训练效率。
- 实验结果表明,FourTune在多个任务上与全精度微调的质量相当,同时在内存和训练吞吐量上有显著提升。
📝 摘要(中文)
扩散模型已成为高质量生成建模的主流范式,而后训练对于将其适应于多样化的下游应用至关重要。然而,由于巨大的内存占用和缓慢的训练速度,现有的参数高效微调方法仅部分解决了大规模扩散模型后训练的挑战。为此,本文提出了FourTune,一个基于端到端W4A4G4范式的高效后训练框架。FourTune引入了一个三分支混合管道,通过冻结数值稳定器来隔离量化敏感的异常值,从而在原生4位计算下实现稳定训练。此外,FourTune采用硬件高效的块级量化和定制融合内核,以支持高效的量化反向传播并减少内存带宽开销。在定制、强化学习和蒸馏任务中,FourTune的质量与全精度微调相当。在FLUX.1-dev(12B)上,FourTune将内存开销降低了2.25倍,并将端到端训练吞吐量提高了2.27倍,相较于BF16 LoRA。
🔬 方法详解
问题定义:本文旨在解决大规模扩散模型后训练中存在的内存占用过高和训练速度缓慢的问题。现有的参数高效微调方法未能有效应对这些挑战,导致扩散模型在多样化应用中的适应性受限。
核心思路:FourTune的核心思路是通过引入三分支混合管道和冻结数值稳定器,来隔离量化敏感的异常值,从而在4位计算下实现稳定的训练过程。这种设计旨在提高后训练的效率和稳定性。
技术框架:FourTune的整体架构包括三个主要模块:三分支混合管道、冻结数值稳定器和硬件高效的块级量化。三分支混合管道用于增强标准LoRA架构,冻结数值稳定器则用于处理量化敏感的异常值,块级量化和定制融合内核则支持高效的量化反向传播。
关键创新:FourTune的主要创新在于其三分支混合管道和冻结数值稳定器的结合,这一设计使得在4位计算下的训练更加稳定,显著提高了后训练的效率。与现有方法相比,FourTune在处理量化敏感性方面表现出色。
关键设计:FourTune采用了块级量化技术,结合定制的融合内核,以支持高效的量化反向传播。此外,设计中还考虑了内存带宽的优化,确保在低位宽计算下仍能保持高效的训练性能。
🖼️ 关键图片
📊 实验亮点
FourTune在FLUX.1-dev(12B)上实现了2.25倍的内存开销降低和2.27倍的端到端训练吞吐量提升,相较于BF16 LoRA,展现出显著的性能优势,证明了其在后训练效率上的突破。
🎯 应用场景
FourTune的研究成果具有广泛的应用潜力,尤其在需要高效生成模型的领域,如图像生成、视频生成和自然语言处理等。通过降低内存占用和提高训练速度,FourTune能够使得大规模扩散模型更易于部署和应用,推动相关技术的进一步发展。
📄 摘要(原文)
Diffusion models have become a dominant paradigm for high-quality generative modeling, while post-training is essential for adapting them to diverse downstream applications. However, post-training of large diffusion models is still challenging due to the prohibitive memory footprints and slow training speed, which existing parameter-efficient fine-tuning methods only partially address. To overcome these limitations, we propose FourTune, an efficient post-training framework for diffusion models based on an end-to-end W4A4G4 paradigm. FourTune introduces a triple-branch hybrid pipeline that augments the standard LoRA architecture with a frozen numerical stabilizer to isolate quantization-sensitive outliers, enabling stable training under native 4-bit computation. In addition, FourTune employs hardware-efficient block-wise quantization and customized fused kernels to support efficient quantized backpropagation and reduce memory bandwidth overhead. Across customization, reinforcement learning, and distillation tasks, FourTune matches the quality of full-precision fine-tuning. On FLUX.1-dev (12B), FourTune reduces memory overhead by 2.25$\times$ and increases end-to-end training throughput by 2.27$\times$ compared to BF16 LoRA.