Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment
作者: Hyeju Shin, Chorwon Kim, Ryangsoo Kim, Hark Yoo, Jaein Kim
分类: cs.LG
发布日期: 2026-07-09
备注: 14 pages. Accepted at the ICML 2026 Workshop on Hypothesis Testing
💡 一句话要点
提出小型视觉语言模型量化的新框架以优化边缘部署
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉语言模型 量化技术 边缘计算 多模态智能 模型优化 硬件适应性 性能评估
📋 核心要点
- 现有方法在小型视觉语言模型的量化方面缺乏深入的组件分析,影响了边缘设备的部署效果。
- 论文提出了一种系统评估框架,通过分离视觉编码器、投影器和大型语言模型骨干网络来优化量化配置。
- 实验结果显示,MoE骨干网络在INT4噪声下表现更佳,且不同平台的智能每焦耳性能差异显著。
📝 摘要(中文)
随着参数少于30亿的视觉语言模型的出现,设备端多模态智能的实现得到了加速。然而,组件级量化的详细理解仍然是优化部署的瓶颈。本文提出了一种系统评估框架,实证验证了在Jetson Orin NX和AGX上六种量化配置下的五个假设。研究结果表明,量化敏感性受结构范式(MoE与稠密)影响,而非仅仅是规模;SigLIP编码器在Jetson Ampere上表现出不成比例的INT8延迟;尽管LLM的INT4量化显著降低了VRAM消耗,但也导致了令牌生成速度的下降;复合量化误差大多是可加的,除了在模态对齐路径上;不同平台的智能每焦耳性能因内存带宽限制而显著不同。
🔬 方法详解
问题定义:本文旨在解决小型视觉语言模型在边缘设备上量化部署的瓶颈,现有方法对组件级量化的理解不足,导致性能未能最优化。
核心思路:通过系统评估框架,分离模型的不同组件(视觉编码器、投影器和语言模型),以便更好地理解各部分对量化的敏感性和性能影响。
技术框架:整体架构包括对Jetson Orin NX和AGX平台的六种量化配置进行实验,验证五个假设,重点分析MoE与稠密结构的表现差异。
关键创新:最重要的创新在于识别出量化敏感性受结构范式影响,而非仅仅是模型规模,提出了针对不同硬件的量化策略。
关键设计:在实验中,采用了INT4和INT8量化策略,分析了编码器与硬件的交互影响,并探讨了复合量化误差的加性特征。具体参数设置和损失函数设计未在摘要中详细说明,需参考完整论文。
🖼️ 关键图片
📊 实验亮点
实验结果显示,MoE骨干网络在INT4量化下能够有效减轻噪声影响,而稠密骨干网络则表现不佳。此外,尽管INT4量化显著降低了VRAM消耗,但令牌生成速度却因去量化开销而减慢,显示出量化策略的复杂性。
🎯 应用场景
该研究的潜在应用领域包括智能手机、边缘计算设备和物联网设备等,能够显著提升多模态智能应用的性能和效率。未来,随着对量化技术的深入理解,可能会推动更广泛的智能设备普及和应用。
📄 摘要(原文)
The emergence of vision language models with fewer than 3 billion parameters has accelerated the implementation of on-device multimodal intelligence. However, a detailed understanding of component-wise quantization remains a bottleneck for optimal deployment. This paper presents a systematic evaluation framework for empirically validating five hypotheses across six quantization configurations on the Jetson Orin NX and AGX. By separating the vision encoder, projector, and large language model backbone yields the following results: (1) Quantization sensitivity is governed by the structural paradigm (MoE vs. dense) rather than scale alone, with MoE backbones mitigating INT4 noise where dense backbones degrade; (2) SigLIP encoders incur disproportionate INT8 latency on Jetson Ampere--a deployment-specific encoder-kernel-hardware interaction, not a SigLIP flaw; (3) Although INT4 quantization of LLMs greatly reduces VRAM consumption, it also causes slower token generation due to dequantization overhead; (4) Composite quantization errors are largely additive, except along the modality-alignment path, which is architecture-dependent; (5) The intelligence-per-joule profile varies significantly across platforms owing to memory bandwidth constraints.