The Inhibitor: ReLU and Addition-Based Attention for Efficient Transformers under Fully Homomorphic Encryption on the Torus
作者: Rickard Brännvall, Andrei Stoian
分类: cs.LG
发布日期: 2023-10-03 (更新: 2025-10-01)
备注: 6 pages, 4 tables
💡 一句话要点
提出基于ReLU和加法的注意力机制以提高同态加密下的Transformer效率
🎯 匹配领域: 支柱五:交互与反应 (Interaction & Reaction)
关键词: 量化Transformer 同态加密 隐私保护AI 注意力机制 计算效率 ReLU激活 加法机制
📋 核心要点
- 现有的Transformer模型在计算效率上面临挑战,尤其是在资源受限的硬件或同态加密环境中。
- 本文提出了一种基于加法和ReLU激活的注意力机制,替代传统的点积和Softmax方法,以提高计算效率。
- 实验结果表明,该方法在多个基准任务上与传统方法的性能相当,并在计算上实现了显著节省。
📝 摘要(中文)
为提高量化Transformer的计算效率,本文提出了一种替代传统点积和Softmax注意力机制的新方法,采用仅基于加法和ReLU激活的机制。这种方法避免了矩阵乘法所需的双精度扩展和昂贵的Softmax评估,同时保留了传统点积注意力的大部分核心功能。通过在四个常见基准任务上的训练实验,结果显示其测试集预测得分与传统点积注意力的Transformer相当。此外,扩展实验表明在明文和加密情况下均有显著的计算节省,尤其是该机制可能支持在同态加密下的隐私保护AI应用,避免了加密变量的昂贵乘法。
🔬 方法详解
问题定义:本文旨在解决量化Transformer在计算效率上的不足,尤其是在同态加密环境中,传统的点积和Softmax注意力机制导致了高计算成本和资源消耗。
核心思路:提出一种仅使用加法和ReLU激活的注意力机制,避免了矩阵乘法和Softmax的计算开销,同时保持了注意力机制的核心功能。
技术框架:整体架构包括输入的量化表示,通过加法和ReLU激活计算注意力权重,最后将这些权重应用于输入特征以生成输出。主要模块包括输入处理、注意力计算和输出生成。
关键创新:最重要的创新在于用加法和ReLU替代了传统的点积和Softmax,显著降低了计算复杂度,特别是在同态加密场景中。
关键设计:在参数设置上,采用了量化表示以减少内存占用,损失函数设计上保持与传统Transformer一致,以确保训练的有效性。
📊 实验亮点
实验结果显示,基于ReLU和加法的注意力机制在四个基准任务上,其测试集预测得分与传统点积注意力的Transformer相当。此外,计算节省在明文和加密情况下均显著,表明该方法在资源受限环境中的有效性。
🎯 应用场景
该研究具有广泛的潜在应用,特别是在需要隐私保护的AI场景中,如医疗数据分析和金融交易监控。通过在同态加密下实现高效的Transformer模型,可以在保护用户隐私的同时,进行复杂的数据分析和决策支持,推动隐私保护AI技术的发展。
📄 摘要(原文)
To enhance the computational efficiency of quantized Transformers, we replace the dot-product and Softmax-based attention with an alternative mechanism involving addition and ReLU activation only. This side-steps the expansion to double precision often required by matrix multiplication and avoids costly Softmax evaluations but maintains much of the core functionality of conventional dot-product attention. It can enable more efficient execution and support larger quantized Transformer models on resource-constrained hardware or alternative arithmetic systems like homomorphic encryption. Training experiments on four common benchmark tasks show test set prediction scores comparable to those of conventional Transformers with dot-product attention. Our scaling experiments also suggest significant computational savings, both in plaintext and under encryption. In particular, we believe that the ReLU and addition-based attention mechanism examined in this paper may enable privacy-preserving AI applications operating under homomorphic encryption by avoiding the costly multiplication of encrypted variables.