HCRMap: Pressure-Aware Hot-Expert Residency Mapping for 3.5D MoE Chiplet Inference
作者: Yongqin Zhang
分类: cs.AI
发布日期: 2026-07-13
备注: 15 pages, 8 figures, 2 tables
💡 一句话要点
提出HCRMap以解决3.5D MoE推理中的专家热度不均问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 混合专家 推理优化 动态管理 资源分配 深度学习
📋 核心要点
- 现有的MoE推理方法在专家热度分配上存在显著不均,导致计算资源浪费和性能瓶颈。
- HCRMap通过动态管理专家副本的驻留,优化令牌路由,旨在平衡专家负载和资源使用。
- 实验结果显示,HCRMap在多个基准测试中显著降低了推理延迟,提升了系统性能。
📝 摘要(中文)
混合专家(MoE)大型语言模型在推理时仅激活少量专家,但令牌路由导致专家热度偏斜:少数热门专家持续接收大部分令牌,造成计算不平衡,并加剧通信、内存带宽、I/O和执行队列的压力。本文提出HCRMap,一个针对3.5D MoE推理的热门专家驻留映射框架,动态管理专家副本。HCRMap根据专家热度、权重加载成本、迁移开销和运行时资源压力,决定哪些专家应被提升、保留、降级或驱逐,并将路由的令牌组映射到合适的驻留副本,从而共同缓解通信、内存和队列瓶颈。实验结果表明,HCRMap在预填充和解码阶段分别比Hydra减少43.6%和43.0%的端到端延迟,比MoEntwine减少34.5%和33.1%,比PIMoE减少46.7%和46.0%。
🔬 方法详解
问题定义:本文要解决的问题是3.5D MoE推理中专家热度不均导致的计算不平衡和资源压力。现有方法未能有效管理专家副本,导致部分热门专家过载,而其他专家则处于轻负载状态。
核心思路:HCRMap的核心思路是根据专家的热度和资源压力动态调整专家副本的驻留策略,以优化令牌路由和资源分配,从而提高整体推理效率。
技术框架:HCRMap的整体架构包括专家热度监测、驻留策略决策和令牌映射三个主要模块。首先监测各专家的热度,然后根据实时资源压力和负载情况动态调整专家的驻留状态,最后将令牌映射到合适的驻留副本。
关键创新:HCRMap的主要创新在于其动态管理专家副本的能力,能够实时响应负载变化,显著改善了专家的负载均衡和资源利用率。这与传统静态映射方法形成了鲜明对比。
关键设计:在设计中,HCRMap考虑了专家热度、迁移开销和权重加载成本等多个因素,采用了自适应的决策机制,以确保在不同运行时条件下都能保持高效的性能。
🖼️ 关键图片
📊 实验亮点
HCRMap在多个实验中表现出色,尤其是在预填充和解码阶段,分别比Hydra减少了43.6%和43.0%的延迟,比MoEntwine减少了34.5%和33.1%,比PIMoE减少了46.7%和46.0%。这些结果表明HCRMap在提升推理效率方面的显著优势。
🎯 应用场景
HCRMap的研究成果在大型语言模型的推理优化中具有广泛的应用潜力,尤其是在需要高效资源管理和低延迟响应的场景,如智能助手、实时翻译和大规模文本生成等领域。未来,该框架还可以扩展到其他类型的深度学习模型中,以提升其推理效率和资源利用率。
📄 摘要(原文)
Mixture-of-Experts (MoE) large language models (LLM) activate only a small number of experts during inference, but token routing introduces persistent expert hotness skew: a small set of hot experts continuously receives most tokens, while the remaining experts are lightly loaded. On 3.5D multi-chiplet systems, this skew not only causes compute imbalance but also amplifies pressure on communication, memory bandwidth, I/O, and execution queues. Therefore, the core problem is not simply to reduce token movement, but to dynamically place and reuse hot expert replicas across different memory tiers. This paper proposes HCRMap, a hot expert residency mapping framework for pressure-aware expert replica management in 3.5D MoE inference. Based on expert hotness, weight loading cost, migration overhead, and runtime resource pressure, HCRMap dynamically determines which experts should be promoted, retained, demoted, or evicted. It then maps routed token groups to suitable resident replicas, thereby jointly mitigating communication, memory, and queue bottlenecks. Experimental results show that HCRMap reduces end-to-end latency by 43.6% and 43.0% over Hydra in the prefill and decode stages, respectively; by 34.5% and 33.1% over MoEntwine; and by 46.7% and 46.0% over PIMoE.