STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU

📄 arXiv: 2607.09385v1 📥 PDF

作者: Victor J. B. Jung, Gagandeep Singh, Joseph Melber, Kristof Denolf, Francesco Conti, Luca Benini

分类: cs.DC, cs.AI, cs.PF

发布日期: 2026-07-10

备注: Accepted at IEEE COINS 2026


💡 一句话要点

提出STEEL以解决长序列推理中的能效问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长序列推理 能效优化 神经处理引擎 数据流计算 稀疏感知 FlashAttention XDNA NPU 智能代理

📋 核心要点

  1. 现有方法在长序列推理中能效不足,尤其是在笔记本SoC上,面临架构多样性和数据移动编程模型的挑战。
  2. STEEL通过数据流形式的预填充注意力,优化了NPU的空间并行性和片上内存的利用,解决了负载不平衡问题。
  3. 实验结果显示,STEEL在AMD Ryzen AI 9 HX 370 SoC上能耗减少9.17倍,延迟降低9.6倍,速度提升22.8倍。

📝 摘要(中文)

随着基于大型语言模型的智能代理在操作系统工作流中的广泛应用,笔记本级系统芯片(SoC)上的能效推理变得愈发重要。尽管云端卸载仍然常见,但它带来的可靠性和隐私问题在智能工作负载中尤为突出。为此,近期的笔记本SoC集成了针对能效优化的神经处理引擎(NPU),但将注意力机制有效映射到NPU上仍然面临挑战。本文提出了STEEL,这是针对XDNA类NPU的首个开源FlashAttention实现,采用数据流形式的预填充注意力,能够高效利用空间并行性和片上内存。此外,STEEL通过利用稀疏感知的管道放置来解决因因果掩码引起的负载不平衡,降低了同步开销并提高了利用率。实验结果表明,STEEL在AMD Ryzen AI 9 HX 370 SoC上相较于CPU和GPU基线分别减少了9.17倍和1.75倍的能耗。

🔬 方法详解

问题定义:本文旨在解决在笔记本级SoC上进行长序列推理时的能效问题。现有方法在将注意力机制映射到NPU时,面临架构多样性和数据移动编程模型的挑战,导致能效不足。

核心思路:STEEL的核心思路是采用数据流形式的预填充注意力,能够高效利用NPU的空间并行性和片上内存,同时通过稀疏感知的管道放置来解决因果掩码引起的负载不平衡问题。

技术框架:STEEL的整体架构包括数据流预填充注意力模块、稀疏感知管道放置模块和NPU调度模块。数据流模块负责高效处理输入数据,管道放置模块优化任务调度以减少同步开销。

关键创新:STEEL的主要创新在于首次将FlashAttention实现为开源,并针对XDNA类NPU进行了优化,显著提高了能效和性能。与现有方法相比,STEEL在处理长序列时表现出更高的能效和更低的延迟。

关键设计:在设计中,STEEL采用了稀疏感知的管道放置策略,优化了NPU的资源利用率,并通过调整参数设置和网络结构,确保了高效的注意力计算和数据流动。具体的损失函数和优化策略在实验中进行了验证。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,STEEL在AMD Ryzen AI 9 HX 370 SoC上相较于CPU和GPU基线分别减少了9.17倍和1.75倍的能耗。在XDNA 1上,STEEL实现了平均9.6倍的延迟降低,并在XDNA 2上相较于逐层注意力实现提供了22.8倍的速度提升。

🎯 应用场景

STEEL的研究成果在智能代理、自然语言处理和实时数据分析等领域具有广泛的应用潜力。通过提高长序列推理的能效,STEEL能够支持更复杂的任务,推动移动设备和边缘计算的智能化进程,降低能耗并提升用户体验。

📄 摘要(原文)

The growing adoption of large language model-based agents within operating system workflows has increased the importance of energy-efficient inference on laptop-class systems-on-chip (SoCs). While cloud offloading remains common, it introduces reliability and privacy concerns that are particularly problematic for agentic workloads. Recent laptop SoCs, therefore, incorporate neural processing engines (NPUs) optimized for energy efficiency; however, effectively mapping attention mechanisms onto NPUs remains challenging due to architectural diversity and explicit data-movement programming models. In this work, we present STEEL, the first open-source implementation of FlashAttention targeting XDNA-like NPUs. STEEL introduces a dataflow formulation of prefill attention, enabling efficient exploitation of spatial parallelism and on-chip memory. Furthermore, STEEL addresses the load imbalance induced by the causal mask by leveraging a sparsity-aware pipeline placement onto the NPU array, reducing synchronization overhead and improving utilization. We evaluate STEEL on the AMD Ryzen AI 9 HX 370 SoC and compare its performance against optimized CPU and GPU implementations. Experimental results show that STEEL reduces energy consumption by an average of 9.17x and 1.75x relative to CPU and GPU baselines, respectively. On XDNA 1, STEEL achieves an average 9.6x latency reduction over the prior state of the art, and delivers a 22.8x speedup on average compared to a layer-by-layer attention implementation on XDNA 2.