PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization

📄 arXiv: 2607.16184 📥 PDF

作者: Yuchen Yang, Yifan Zhao, Anisha Dasgupta, Sasa Misailovic

分类: cs.LG

发布日期: 2026-07-20


💡 一句话要点

提出PagedWeight以解决MoE LLM服务中的动态权重量化问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 混合专家 大规模语言模型 动态量化 内存优化 性能提升

📋 核心要点

  1. 现有的MoE模型在KV缓存密集的服务场景中面临GPU内存需求与缓存增长之间的矛盾,导致效率低下。
  2. PagedWeight通过动态量化MoE模型权重,平衡了权重精度与KV缓存大小,优化了模型性能。
  3. 实验结果显示,PagedWeight在多个场景中实现了高达72.0%的内存节省和1.94倍的吞吐量提升,显著优于现有方法。

📝 摘要(中文)

混合专家(MoE)是一类流行的大型语言模型(LLM),在效率和准确性方面表现优异。然而,在KV缓存密集的服务场景中,MoE模型权重的GPU内存需求与不断增长的KV缓存之间存在矛盾。本文提出PagedWeight,这是一种新颖的MoE LLM服务管理方法,能够在运行时动态量化MoE模型的权重,并平衡专家权重的精度与KV缓存的大小。PagedWeight有效揭示并导航模型任务准确性、内存消耗和吞吐量/延迟之间的复杂权衡。在多个内存敏感的MoE服务场景中,PagedWeight在质量-内存权衡方面超越了多种现有的量化基线,达到了FP16等效的准确性,同时实现了高达72.0%的GPU内存节省和1.94倍的吞吐量提升,并在相似内存预算下,质量提升幅度高达39.3%,吞吐量损失最多为4.1%。

🔬 方法详解

问题定义:本文旨在解决MoE LLM在KV缓存密集服务场景中,模型权重的GPU内存需求与KV缓存增长之间的矛盾。现有方法在内存消耗和性能之间存在明显的权衡痛点。

核心思路:PagedWeight的核心思路是动态量化MoE模型的权重,以适应运行时的内存需求,同时保持模型的任务准确性。通过这种方式,PagedWeight能够在内存和性能之间找到更优的平衡。

技术框架:PagedWeight的整体架构包括动态权重量化模块、KV缓存管理模块和性能评估模块。动态权重量化模块负责在运行时调整权重精度,KV缓存管理模块则优化缓存使用,性能评估模块用于实时监控模型的准确性和吞吐量。

关键创新:PagedWeight的主要创新在于其动态权重量化机制,能够根据实际内存使用情况实时调整权重精度。这一机制与传统静态量化方法相比,能够更灵活地应对内存和性能的变化。

关键设计:在设计上,PagedWeight采用了自适应量化策略,结合了多种量化算法的优点,确保在不同内存预算下实现最佳性能。此外,模型的损失函数和网络结构经过精心设计,以支持动态调整和高效计算。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

PagedWeight在多个内存敏感的MoE服务场景中表现出色,达到了FP16等效的准确性,GPU内存节省高达72.0%,吞吐量提升达到1.94倍。此外,在相似内存预算下,质量提升幅度高达39.3%,吞吐量损失最多为4.1%,显示出其优越的性能。

🎯 应用场景

PagedWeight的研究成果在多个领域具有广泛的应用潜力,尤其是在需要高效处理大规模语言模型的场景中,如智能客服、实时翻译和内容生成等。其动态量化机制能够显著降低内存消耗,同时提升模型的响应速度,具有重要的实际价值和未来影响。

📄 摘要(原文)

Mixture-of-Experts (MoE) is a popular class of large language models (LLMs), offering high efficiency and accuracy. However, in KV-cache-intensive serving scenarios, MoEs often exhibit a tension between the GPU memory requirements of the model weights and the growing KV cache. We propose PagedWeight, a novel management method for MoE LLM serving that dynamically quantizes MoE model's weights at runtime and balances expert-weight precision with the KV cache sizes. PagedWeight exposes and effectively navigates the complex tradeoff between the model's task accuracy, memory consumption, and throughput/latency. Across several memory-sensitive MoE serving scenarios, PagedWeight improves the quality-memory tradeoff over several existing quantization baselines. PagedWeight achieves FP16-equivalent accuracy with up to 72.0% GPU memory savings and 1.94$\times$ throughput improvement, and improves quality over quantization methods by up to 39.3% at a similar memory budget with at most 4.1% throughput loss.