QFT: Quantized Full-parameter Tuning of LLMs with Affordable Resources
作者: Zhikai Li, Xiaoxuan Liu, Banghua Zhu, Zhen Dong, Qingyi Gu, Kurt Keutzer
分类: cs.CL, cs.LG
发布日期: 2023-10-11 (更新: 2026-03-18)
备注: ICLR 2026 Workshop on Scaling Post-training for LLMs (SPOT)
💡 一句话要点
提出QFT框架以降低LLMs全参数调优的资源需求
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 全参数微调 量化训练 内存优化 自然语言处理 资源高效 Lion优化器 混合特征量化
📋 核心要点
- 现有的全参数微调方法通常需要大量高端GPU,资源消耗高,限制了其应用。
- QFT框架通过将训练状态量化为INT8格式,降低内存需求,使全参数微调在普通GPU上可行。
- 实验结果显示,QFT在内存使用上减少至21%,并在性能上与标准方法相当,显著提升了微调的可行性。
📝 摘要(中文)
大型语言模型(LLMs)在自然语言处理任务中表现出显著的影响力。对这些预训练模型进行下游数据集的微调可以进一步提升性能,但通常需要大量昂贵的高端GPU。尽管已有针对参数高效微调的研究,但未能充分释放全参数微调的潜力。本文提出了QFT框架,通过将所有训练状态(包括权重、梯度和优化器状态)量化为INT8格式,从而降低训练内存,使得在现有GPU上以可承受的成本进行全参数微调成为可能。为确保训练性能,本文提出了两项关键措施:一是理论证明Lion优化器对量化的鲁棒性;二是采用混合特征量化器,保护稀疏关键特征以确保权重更新的准确性。此外,开发了基于栈的梯度流方案,形成统一的整数训练管道。QFT将模型状态内存降低至标准解决方案的21%,并在单个A6000 GPU上实现了可比的性能。
🔬 方法详解
问题定义:本文旨在解决大型语言模型全参数微调过程中对高端GPU资源的高需求问题。现有方法在参数高效微调方面存在不足,无法充分利用全参数微调的潜力。
核心思路:QFT框架通过将所有训练状态量化为INT8格式,降低内存需求,同时保持训练性能。采用Lion优化器和混合特征量化器来确保量化过程中的鲁棒性和准确性。
技术框架:QFT的整体架构包括量化训练状态的模块、基于Lion优化器的梯度更新模块,以及支持整数上下文的梯度流方案。通过这些模块的协同工作,形成了一个统一的整数训练管道。
关键创新:最重要的创新在于提出了量化训练状态的方案,特别是对梯度和优化器状态的量化处理,确保了在量化后的环境中仍能保持良好的训练性能。这与现有方法的本质区别在于其对全参数微调的支持和资源消耗的显著降低。
关键设计:在设计中,采用了Lion优化器以确保对量化的鲁棒性,同时混合特征量化器用于保护稀疏特征。此外,开发的栈式梯度流方案具有O(1)的复杂度,优化了反向传播过程。整体设计确保了在低内存条件下的高效训练。
🖼️ 关键图片
📊 实验亮点
实验结果表明,QFT将模型状态内存需求降低至标准方案的21%,例如,微调LLaMA-7B模型只需<30GB内存,能够在单个A6000 GPU上实现与传统方法相当的性能,显著提升了微调的可行性和效率。
🎯 应用场景
QFT框架的提出为大型语言模型的微调提供了新的思路,尤其适用于资源有限的研究机构和企业。其在降低内存需求的同时保持性能的能力,使得更多的用户能够在普通硬件上进行高效的模型微调,推动了自然语言处理技术的普及与应用。
📄 摘要(原文)
Large Language Models (LLMs) have showcased remarkable impacts across a wide spectrum of natural language processing tasks. Fine-tuning these pretrained models on downstream datasets provides further significant performance gains; however, this process typically requires a large number of expensive, high-end GPUs. Although there have been efforts focused on parameter-efficient fine-tuning, they cannot fully unlock the powerful potential of full-parameter fine-tuning. In this paper, we propose QFT, a Quantized Full-parameter Tuning framework for LLMs that quantizes and stores all training states, including weights, gradients, and optimizer states, in INT8 format to reduce training memory, thereby enabling full-parameter fine-tuning on existing GPUs at an affordable cost. To ensure training performance, we make two key efforts: i) for quantized gradients and optimizer states, we theoretically prove that the Lion optimizer, with its property of consistent update magnitudes, is highly robust to quantization; ii) and for quantized weights, we employ the hybrid feature quantizer, which identifies and protects a small subset of sparse critical features while quantizing the remaining dense features, thus ensuring accurate weight updates without FP32 backups. Moreover, to support backpropagation in the integer context, we develop a stack-based gradient flow scheme with O(1) complexity, forming a unified integer training pipeline. As a result, QFT reduces the model state memory to 21% of the standard solution while achieving comparable performance, e.g., tuning a LLaMA-7B model requires only <30GB of memory, making it feasible on a single A6000 GPU.