Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation
作者: Qicheng Zhao, Qi Sun, Zheyu Yan
分类: cs.AI
发布日期: 2026-07-16
备注: Accepted to ACM Multimedia (ACM MM) 2026
💡 一句话要点
提出Seer框架以加速多模态大语言模型推理效率
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态推理 扩散模型 大语言模型 推理效率 信噪比 动态序列处理 模型加速
📋 核心要点
- 现有的多模态大语言模型在推理时受到固定长度生成的限制,导致冗余计算和效率低下。
- 本文提出Seer框架,通过信噪比标准检测有效语义边界,实现冗余后缀的截断,提升推理效率。
- 实验结果显示,Seer在9个基准测试中将吞吐量提升至约31倍,并在复杂视觉任务中提高了准确性。
📝 摘要(中文)
多模态扩散大语言模型(DMLLMs)在多模态推理中表现出色,但其推理效率受到固定长度生成限制的显著影响。由于实际输出长度未知,输出序列被填充到预定义的最大长度,导致在不必要的[EOS]标记上产生大量冗余计算。本文发现,DMLLMs在第一步去噪时隐含地揭示了有效语义边界,通过MLP激活稀疏性的显著变化来实现。基于此观察,我们提出了Seer,一个无训练的框架,通过信噪比(SNR)标准检测该边界,并对后续计算进行一次性截断。实验结果表明,Seer有效消除了填充浪费,将吞吐量提升至约31倍,并在复杂视觉任务上提高了准确性,提供了高效的DMLLM加速解决方案。
🔬 方法详解
问题定义:本文旨在解决多模态扩散大语言模型在推理过程中由于固定长度生成导致的冗余计算问题。现有方法在处理未知输出长度时,通常会填充到最大长度,造成效率低下和资源浪费。
核心思路:论文的核心思路是利用DMLLMs在第一步去噪时所显示的MLP激活稀疏性变化,来识别有效的语义边界,从而在后续计算中进行一次性截断,避免不必要的计算。
技术框架:Seer框架包括两个主要模块:首先,通过信噪比(SNR)标准检测有效语义边界;其次,采用混合执行策略以最大化吞吐量,支持动态序列长度的处理。
关键创新:Seer的主要创新在于其无训练的特性和基于SNR的边界检测方法,这与现有方法依赖于固定长度生成的方式有本质区别。
关键设计:在设计中,Seer采用了信噪比作为边界检测的标准,并通过混合执行策略优化了批处理服务的吞吐量,确保在动态序列长度下的高效计算。具体参数设置和损失函数未在摘要中详细说明,需参考原文获取更多细节。
🖼️ 关键图片
📊 实验亮点
实验结果表明,Seer有效消除了填充浪费,将推理吞吐量提升至约31倍。在9个基准测试中,Seer不仅保持了整体性能,还在复杂视觉任务中提高了准确性,例如DocVQA得分从63.52提升至63.66,展示了其在实际应用中的优势。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、计算机视觉和多模态学习等。通过提高多模态大语言模型的推理效率,Seer能够在实时应用中提供更快的响应时间,适用于智能助手、自动问答系统和复杂数据分析等场景,具有重要的实际价值和未来影响。
📄 摘要(原文)
Diffusion Multimodal Large Language Models (DMLLMs) are highly effective for multimodal reasoning, yet their inference efficiency is significantly hindered by fixed-length generation constraints. Since the actual output length is unknown, output sequences are padded to a predefined maximum length, resulting in substantial redundant computation over unnecessary [EOS] tokens. In this work, we discover that DMLLMs implicitly reveal their valid semantic boundary at the very first denoising step through a distinct shift in MLP activation sparsity. Leveraging this observation, we propose Seer, a training-free framework that detects this boundary using a Signal-to-Noise Ratio (SNR)-based criterion and performs one-shot truncation of the redundant suffix for all subsequent computations. To preserve these theoretical gains during batched serving, Seer incorporates a hybrid execution strategy that maximizes throughput while seamlessly accommodating dynamic sequence lengths. Experimental results demonstrate that Seer effectively eliminates padding waste, accelerating throughput by up to $\sim$31$\times$. Across 9 benchmarks, Seer robustly maintains overall performance and even improves accuracy on complex visual tasks by mitigating noise leakage (e.g., DocVQA score increases from 63.52 to 63.66), offering a highly efficient, plug-and-play solution for DMLLM acceleration.