The Illusion of Equivalency: Statistical Characterization of Quantization Effects in LLMs
作者: Baha Rababah, Cuneyt Gurcan Akcora, Carson K. Leung
分类: cs.AI
发布日期: 2026-07-09
💡 一句话要点
提出正确性一致性指标以评估LLM量化影响
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 量化评估 大型语言模型 正确性一致性 行为评估 注意力机制
📋 核心要点
- 现有的量化评估方法主要依赖准确率和困惑度,无法有效捕捉量化对模型行为的影响。
- 论文提出了正确性一致性指标,专注于衡量基础模型与量化模型之间的正确预测重叠,提供了更全面的评估视角。
- 实验结果表明,在适度量化情况下,模型行为出现显著偏差,且查询和键投影对量化更为敏感。
📝 摘要(中文)
后训练量化广泛应用于资源受限环境中的大型语言模型,但其评估几乎完全依赖于准确率和困惑度。我们展示了这些指标未能捕捉量化引起的行为变化。我们引入了正确性一致性这一决策级指标,衡量基础模型与其量化变体之间正确预测的重叠程度,而不依赖于绝对准确性。通过对多个模型和从8位到2位的量化方案进行分析,我们发现即使任务性能看似保持,适度量化下也会出现行为偏差。为了解释这一现象,我们将量化分析为对注意力权重的结构操作,并使用统计和分布度量量化层级失真。我们的结果揭示了低位宽下的非线性断点,并显示查询和键投影对比值和输出投影更为敏感。这些发现揭示了基础模型与量化模型之间的等价幻觉,并推动了超越传统性能指标的行为评估。
🔬 方法详解
问题定义:本论文旨在解决后训练量化对大型语言模型行为影响评估不足的问题。现有方法主要依赖准确率和困惑度,无法反映量化引起的潜在行为变化。
核心思路:论文提出了正确性一致性这一新指标,专注于比较基础模型与量化模型在正确预测上的一致性,从而提供更准确的行为评估。
技术框架:研究首先对多个模型和量化方案进行实验,分析量化对注意力权重的影响。然后,通过统计和分布度量对层级失真进行量化,最终揭示低位宽下的非线性断点。
关键创新:最重要的创新在于引入了正确性一致性指标,突破了传统评估方法的局限,强调了行为评估的重要性。
关键设计:在实验中,采用了不同位宽的量化方案(从8位到2位),并分析了各层的注意力权重失真,特别关注查询和键投影的敏感性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,在适度量化情况下,模型的行为偏差显著,尤其是在低位宽下,查询和键投影的敏感性高于其他投影。通过正确性一致性指标,模型的行为差异得到了量化,揭示了基础模型与量化模型之间的等价幻觉。
🎯 应用场景
该研究的潜在应用领域包括大型语言模型的优化与部署,尤其是在资源受限的环境中。通过提供更全面的行为评估方法,可以帮助开发者更好地理解和优化量化模型的性能,提升实际应用中的效果和可靠性。未来,该方法可能会影响量化技术的标准化和评估流程。
📄 摘要(原文)
Post-training quantization is widely used to deploy large language models in resource-constrained settings, yet its evaluation relies almost exclusively on accuracy and perplexity. We show that these metrics fail to capture behavioral changes induced by quantization. We introduce correctness agreement, a decision-level metric that measures overlap in correct predictions between a base model and its quantized variants, independent of absolute accuracy. Across multiple models and quantization schemes from 8-bit to 2-bit, we find that behavioral divergence emerges under moderate quantization even when task performance appears preserved. To explain this effect, we analyze quantization as a structural operator on attention weights and quantify layer-wise distortions using statistical and distributional measures. Our results reveal non-linear breakpoints at low bit-widths and show that query and key projections are consistently more sensitive than value and output projections. These findings expose an illusion of equivalence between base and quantized models and motivate behavioral evaluation beyond conventional performance metrics.