Component-Aware Differential Privacy for Federated Multilingual Speech-LLMs
作者: Jordi Luque, Fernando López, Aleix Sant
分类: cs.CL
发布日期: 2026-09-10
备注: Accepted in SLT2026
💡 一句话要点
提出组件感知差分隐私以解决联邦多语言语音LLMs问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 差分隐私 联邦学习 语音识别 多语言模型 隐私保护 模型训练 深度学习
📋 核心要点
- 现有的每层差分隐私方法在处理声学编码器和语言解码器更新范数差异时表现不佳,导致训练崩溃或性能下降。
- 论文提出α-split方法,通过将参数分为独立的两个池,解决了交叉组件预算崩溃的问题,保持了隐私保证。
- 实验结果表明,α-split方法在词错误率上恢复了平坦DP的效用,同时显著提高了对抗攻击的噪声保护能力。
📝 摘要(中文)
每层差分隐私(DP)裁剪通过将每个矩阵的裁剪预算分配与参数数量成比例,改善了联邦学习中的梯度保真度。然而,当声学编码器和语言解码器在更新范数上相差一个数量级时,这一方法在语音大语言模型(speech-LLMs)中失效。单池每层方法遭遇了交叉组件预算崩溃,导致词错误率(WER)远离平坦的全局裁剪,甚至完全崩溃训练。我们提出了α-split,一种双池分配方法,将编码器和LLM参数规范化为独立池,证明了联合ℓ2敏感性和原始(ε,δ)-DP保证不变。经过架构校准的α,我们的方法在WER效用上恢复了平坦DP的效果,同时在仅增加2.6% LLM噪声开销的情况下,为编码器提供了4.47倍更紧的每组件噪声保护。
🔬 方法详解
问题定义:本论文旨在解决在联邦学习中,声学编码器和语言解码器的更新范数差异导致的每层差分隐私方法失效的问题。现有方法在这种情况下容易出现交叉组件预算崩溃,影响模型性能。
核心思路:论文提出的α-split方法通过将模型参数分为两个独立的池,分别处理声学编码器和语言解码器,从而避免了预算崩溃的问题。这种设计使得每个组件能够独立优化其隐私预算。
技术框架:整体架构包括两个主要模块:声学编码器池和语言解码器池。每个池根据其参数数量分配独立的裁剪预算,并在训练过程中保持隐私保证不变。
关键创新:最重要的技术创新在于提出了双池分配机制,能够有效应对不同组件之间的范数不平衡问题。这一方法与传统的单池方法本质上不同,避免了交叉组件预算崩溃。
关键设计:在参数设置上,α的选择经过架构校准,以确保在不同模型架构中均能有效工作。此外,损失函数和噪声保护机制经过优化,以提高模型的鲁棒性和隐私保护能力。
🖼️ 关键图片
📊 实验亮点
实验结果显示,α-split方法在词错误率(WER)上恢复了与平坦DP相当的效用,同时为编码器提供了4.47倍更紧的噪声保护,且仅增加了2.6%的LLM噪声开销。这表明该方法在隐私保护和模型性能之间取得了良好的平衡。
🎯 应用场景
该研究的潜在应用领域包括多语言语音识别、语音助手和智能客服等。通过提高模型在联邦学习中的隐私保护能力,能够更好地保护用户数据,同时提升语音模型的性能和可靠性。未来,该方法可能推动更多隐私敏感领域的应用,如医疗和金融等。
📄 摘要(原文)
Per-layer differential privacy (DP) clipping improves gradient fidelity in federated learning by allocating per-matrix clipping budgets proportional to parameter count. We show that this recipe breaks for speech large language models (speech-LLMs), when the acoustic encoder and the language decoder differ by an order of magnitude in update norm. Single-pool per-layer methods suffer \emph{cross-component budget collapse}, dragging word error rate (WER) far from flat global clipping or collapsing training entirely. When the norm imbalance is milder, adaptive single-pool methods partially recover, confirming that collapse severity scales with the inter-component norm ratio. We empirically diagnose the root cause across six per-layer methods and three speech-LLM architectures. We then propose \emph{$α$-split}, a two-pool allocation that normalises encoder and LLM parameters into independent pools, and show that joint $\ell_2$ sensitivity and the original $(\varepsilon,δ)$-DP guarantee are unchanged. At architecture-calibrated $α$, our method recovers WER utility compared to flat DP, while granting the encoder $4.47{\times}$ tighter per-component noise protection against speaker voice-based gradient-inversion attacks at only $+2.6\%$ LLM noise overhead.