TEQ: Trainable Equivalent Transformation for Quantization of LLMs

📄 arXiv: 2310.10944v1 📥 PDF

作者: Wenhua Cheng, Yiyang Cai, Kaokao Lv, Haihao Shen

分类: cs.CL

发布日期: 2023-10-17

备注: 10 pages, 3 figures

🔗 代码/项目: GITHUB


💡 一句话要点

提出TEQ以解决大语言模型量化精度问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 量化方法 大语言模型 可训练变换 低精度计算 模型优化

📋 核心要点

  1. 现有的量化方法在保持大语言模型的计算效率与输出精度之间存在矛盾,难以满足实际需求。
  2. TEQ通过可训练的等效变换,优化了低精度量化过程,确保在不增加推理开销的情况下保持模型精度。
  3. 实验结果表明,TEQ在典型大语言模型上与最先进的方法表现相当,并且可以与其他技术结合以进一步提升性能。

📝 摘要(中文)

随着大语言模型(LLMs)的广泛应用,对新型量化方法的需求日益增加,以满足现代架构的计算需求并保持准确性。本文提出了TEQ,一种可训练的等效变换,能够在利用低精度量化(特别是3和4位权重量化)的同时,保持模型输出的FP32精度。训练过程轻量,仅需1K步和不到0.1%的原始模型可训练参数。此外,该变换在推理过程中不会增加计算开销。我们的结果与当前最先进的方法相当,并且可以与其他方法结合以实现更好的性能。代码可在https://github.com/intel/neural-compressor获取。

🔬 方法详解

问题定义:当前大语言模型的量化方法在降低计算需求的同时,往往会导致输出精度下降,难以满足实际应用的需求。

核心思路:TEQ通过引入可训练的等效变换,旨在在低精度量化中保持FP32的输出精度,优化了量化过程。

技术框架:TEQ的整体架构包括训练阶段和推理阶段。在训练阶段,通过少量的步骤和参数调整实现模型的量化;在推理阶段,利用训练得到的变换进行高效推理。

关键创新:TEQ的主要创新在于其可训练性和轻量化设计,使得在量化过程中不增加额外的计算开销,与传统方法相比,显著提升了模型的实用性。

关键设计:TEQ的训练过程仅需1K步,且使用的可训练参数少于0.1%,通过合理的损失函数和网络结构设计,确保了在低精度量化下的高效性与准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,TEQ在多个典型大语言模型上与当前最先进的方法表现相当,且在推理过程中没有增加计算开销。这一方法的引入为低精度量化提供了新的思路,具有显著的实际应用价值。

🎯 应用场景

TEQ的研究成果在大语言模型的量化中具有广泛的应用潜力,尤其是在资源受限的环境中,如移动设备和边缘计算。其轻量化的特性使得在保持高精度的同时,能够有效降低计算资源的消耗,推动智能应用的普及与发展。

📄 摘要(原文)

As large language models (LLMs) become more prevalent, there is a growing need for new and improved quantization methods that can meet the computationalast layer demands of these modern architectures while maintaining the accuracy. In this paper, we present TEQ, a trainable equivalent transformation that preserves the FP32 precision of the model output while taking advantage of low-precision quantization, especially 3 and 4 bits weight-only quantization. The training process is lightweight, requiring only 1K steps and fewer than 0.1 percent of the original model's trainable parameters. Furthermore, the transformation does not add any computational overhead during inference. Our results are on-par with the state-of-the-art (SOTA) methods on typical LLMs. Our approach can be combined with other methods to achieve even better performance. The code is available at https://github.com/intel/neural-compressor.