C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs
作者: Jiameng Li, Han Zhou, Matthew B. Blaschko
分类: cs.CV
发布日期: 2026-07-23
备注: 7 pages
💡 一句话要点
提出C-PTQ以解决多模态大语言模型量化性能下降问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 后训练量化 多模态大语言模型 通道敏感性 Fisher加权 模型压缩 推理加速 任务特定损失
📋 核心要点
- 现有的后训练量化方法未能有效捕捉通道对任务特定损失的影响,导致性能下降。
- C-PTQ通过设计Fisher加权目标,将任务敏感性融入通道缩放过程,提升量化效果。
- 在Qwen2.5VL、InternVL2和LLaVA-OV等多个基准测试中,C-PTQ在权重和激活设置下均表现出色。
📝 摘要(中文)
多模态大语言模型(MLLMs)在内存和计算成本上要求极高,限制了其实际应用。后训练量化(PTQ)技术为模型压缩和推理加速提供了有效解决方案。然而,量化模型在面对敏感通道时会出现性能下降,影响激活保真度和任务准确性。为保护这些重要通道,现有PTQ方法依赖模态或标记级别的度量来指导通道级缩放(CWS),但这些方法未能有效捕捉通道对任务特定损失的影响。为此,本文提出C-PTQ,一种统一的通道级PTQ方法,旨在协调任务特定损失扰动与量化误差。通过设计Fisher加权目标作为可处理的Hessian近似,任务敏感性被无缝注入到缩放过程中。实验结果表明,我们在多个基准测试中实现了最先进的性能。
🔬 方法详解
问题定义:本文旨在解决多模态大语言模型在后训练量化过程中,由于敏感通道导致的性能下降问题。现有方法依赖模态或标记级别的度量,未能有效捕捉通道对任务特定损失的影响,造成重要性与缩放因子之间的不一致,最终导致次优性能。
核心思路:C-PTQ的核心思路是通过设计Fisher加权目标,将任务特定损失扰动与量化误差协调起来。该方法利用二阶导数的特性,提供了一种可处理的Hessian近似,从而在缩放过程中无缝注入任务敏感性。
技术框架:C-PTQ的整体架构包括数据预处理、通道敏感性评估、Fisher加权目标计算和量化实施四个主要模块。首先,通过分析模型的任务特定损失,评估各通道的敏感性;然后,利用Fisher加权目标进行通道缩放;最后,实施量化以优化模型性能。
关键创新:C-PTQ的主要创新在于引入Fisher加权目标作为通道缩放的指导,显著提高了量化模型的性能。与现有方法相比,该方法更好地捕捉了通道对任务损失的影响,避免了性能下降。
关键设计:在C-PTQ中,关键设计包括Fisher加权目标的计算方式、通道敏感性评估的指标选择以及量化过程中对重要通道的保护策略。这些设计确保了在量化过程中,重要通道的激活保真度得以保持,从而提升了整体模型的任务准确性。
🖼️ 关键图片
📊 实验亮点
在Qwen2.5VL、InternVL2和LLaVA-OV等8个基准测试中,C-PTQ在权重和激活设置下均实现了最先进的性能,显著提升了模型的任务准确性,且无需额外模块如LoRA,保持了高效性。
🎯 应用场景
C-PTQ方法在多模态大语言模型的量化中具有广泛的应用潜力,能够有效降低模型的内存和计算成本,促进其在资源受限环境中的部署。该技术可广泛应用于自然语言处理、计算机视觉等领域,提升模型的推理效率和实际应用价值。
📄 摘要(原文)
Multimodal large language models (MLLMs) require huge memory and computational costs, which limits their practical deployment. Post-training quantization (PTQ) techniques offer an efficient solution for model compression and inference acceleration. Yet, the quantized model faces performance degradation due to outlier channels, which are highly sensitive to quantization and substantially impair activation fidelity and task accuracy. To protect these salient channels during quantization, existing PTQ methods leverage modality- or token-level metrics to guide channel-wise scaling (CWS) of LLM decoders. However, these orthogonal measurements fail to capture channel-wise impacts on task-specific loss, and the misalignment between importance and scaling factors ultimately leads to suboptimal performance. To address this issue, we propose C-PTQ, a unified channel-wise PTQ method that harmonizes task-specific loss perturbation and quantization error. Motivated by second-order derivatives, we design a Fisher-weighted objective as a tractable Hessian approximation, seamlessly injecting task sensitivity into the scaling process. Notably, we achieve state-of-the-art performance without auxiliary modules like LoRA, thereby maintaining high efficiency. Experiments on Qwen2.5VL, InternVL2 and LLaVA-OV across 8 benchmarks demonstrate our effectiveness in both weight-only and weight-activation settings.