BlockServe: Block-Grained Continuous Batching for High-Throughput Diffusion LLM Serving
作者: Yuanjie Zhu, Liangwei Yang, Ke Xu, Weizhi Zhang, Shanghao Li, Zihe Song, Philip S. Yu
分类: cs.LG
发布日期: 2026-07-09
💡 一句话要点
提出BlockServe以解决扩散大语言模型服务中的收敛异质性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 扩散大语言模型 高吞吐量 块粒度调度 混合状态执行 计算感知接纳控制器 自然语言处理 深度学习服务
📋 核心要点
- 现有方法在处理扩散大语言模型时,由于收敛异质性,导致请求处理效率低下,影响整体吞吐量。
- 本文提出BlockServe,通过块粒度调度和混合状态执行,优化请求处理流程,减少计算泡沫和尾延迟。
- 在多个基准测试中,BlockServe的吞吐量提升显著,达到1.9到10.6倍,且生成质量保持在相似水平。
📝 摘要(中文)
扩散大语言模型(dLLMs)的高效服务受到收敛异质性的阻碍:在批处理多个请求时,不同序列以不同速率收敛,导致较快的请求被较慢的请求阻塞,从而引入计算泡沫和尾延迟。本文提出BlockServe,一个连续批处理框架,结合了块粒度调度和混合状态执行,通过收集-散布索引扩展双缓存和并行解码,以适应异构批次。此外,计算感知的接纳控制器通过基于令牌的补充扩展有效批次容量。在Dream和LLaDA的五个基准测试中,BlockServe在生成质量相当的情况下,实现了1.9到10.6倍的吞吐量提升,确立了块粒度调度作为高吞吐量离线dLLM推理的基础。
🔬 方法详解
问题定义:本文旨在解决扩散大语言模型服务中的收敛异质性问题。现有方法在批处理请求时,由于不同请求的收敛速度不同,导致较快请求被较慢请求阻塞,造成计算资源浪费和延迟增加。
核心思路:BlockServe的核心思路是通过块粒度调度和混合状态执行来优化请求处理。块粒度调度允许在块边界立即驱逐已完成的请求,而混合状态执行则通过收集-散布索引扩展双缓存和并行解码,以适应异构批次,从而提高整体吞吐量。
技术框架:BlockServe的整体架构包括块粒度调度模块、混合状态执行模块和计算感知接纳控制器。块粒度调度模块负责管理请求的调度和驱逐,混合状态执行模块则处理异构批次的解码,而接纳控制器则根据令牌预算动态调整批次容量。
关键创新:BlockServe的主要创新在于结合块粒度调度与混合状态执行,形成了一种新的请求处理机制。这种机制有效减少了计算泡沫和尾延迟,与传统方法相比,显著提升了吞吐量。
关键设计:在设计中,BlockServe采用了双缓存策略以提高数据访问效率,并通过收集-散布索引实现了并行解码。此外,计算感知接纳控制器的令牌预算机制使得批次容量能够灵活调整,以适应不同的请求负载。
🖼️ 关键图片
📊 实验亮点
在实验中,BlockServe在Dream和LLaDA的五个基准测试上实现了1.9到10.6倍的吞吐量提升,相较于Fast-dLLM,生成质量保持相当。这一结果表明,BlockServe在高吞吐量离线dLLM推理中具有显著优势,验证了块粒度调度的有效性。
🎯 应用场景
BlockServe的研究成果在多个领域具有广泛的应用潜力,尤其是在需要高吞吐量和低延迟的自然语言处理任务中。其优化的请求处理机制可以被应用于在线聊天机器人、智能助手以及大规模文本生成等场景,提升用户体验和系统效率。未来,BlockServe的框架也可扩展至其他类型的深度学习模型服务中,推动更高效的AI应用落地。
📄 摘要(原文)
Efficient serving of diffusion large language models (dLLMs) is hindered by convergence heterogeneity: when batching multiple requests, different sequences converge at different rates, causing faster requests to stall behind slower stragglers and introducing compute bubbles and tail latency. We present BlockServe, a continuous batching framework that integrates block-grained scheduling -- immediately evicting completed requests at block boundaries -- with mixed-state execution that extends dual cache and parallel decoding to heterogeneous batches via gather-scatter indexing. Furthermore, a compute-aware admission controller expands effective batch capacity through token-budgeted refill. On Dream and LLaDA across five benchmarks, BlockServe achieves 1.9--10.6$\times$ throughput over Fast-dLLM with comparable generation quality, establishing block-grained scheduling as a foundation for high-throughput offline dLLM inference.