RAMamba-Net: A Reliability-Aware and Mamba-Based Multimodal Fusion Network for Auditory Attention Detection

📄 arXiv: 2609.11372v1 📥 PDF

作者: Xingyi He, Ziwei Wang, Dongrui Wu

分类: cs.AI

发布日期: 2026-09-10

备注: RAMamba-Net, a reliability-aware Mamba-based multimodal fusion network for auditory attention decoding


💡 一句话要点

提出RAMamba-Net以解决听觉注意力检测中的多模态融合问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 听觉注意力解码 多模态融合 脑电图 眼电图 跨模态交互 可靠性意识 深度学习

📋 核心要点

  1. 现有的听觉注意力解码方法在跨模态交互、时间建模效率和对样本变化的鲁棒性方面存在明显不足。
  2. 本文提出的RAMamba-Net通过Mamba增强的卷积Transformer和双分支时空编码器,解决了模态融合中的可靠性问题。
  3. 实验结果显示,RAMamba-Net在两个基准测试中准确率提高了5.76%,并且在解码鲁棒性和判别表示上表现优异。

📝 摘要(中文)

听觉注意力解码(AAD)旨在从生理信号中识别被关注的发言者,支持神经驱动的听力设备和自然的人机交互。尽管脑电图(EEG)是AAD的主要模态,但在自然音频-视觉场景中提供的证据不够完整,因此需要融合EEG和眼电图(EOG)。现有方法在跨模态交互、时间建模效率和对样本变化的鲁棒性方面存在局限。为了解决这些问题,本文提出了RAMamba-Net,一个基于Mamba的多模态融合网络,具有可靠性意识。该网络通过Mamba增强的带感知卷积Transformer捕捉特定频段的EEG模式和长时间动态,同时采用双分支时空编码器建模EOG的时间和通道间依赖关系。跨模态注意力机制使得模态间的显式交互成为可能,可靠性意识模块则用于估计样本级模态权重,从而增强多模态融合效果。实验结果表明,RAMamba-Net在两个AAD基准测试中有效利用了EEG-EOG的互补信息,准确率比单模态基线提高了5.76%。

🔬 方法详解

问题定义:本文旨在解决听觉注意力解码中的多模态融合问题,现有方法在跨模态交互和时间建模方面存在不足,导致鲁棒性差和准确性低下。

核心思路:RAMamba-Net通过引入Mamba增强的带感知卷积Transformer和双分支时空编码器,旨在提高EEG和EOG的融合效果,增强模态间的交互和信息利用。

技术框架:该网络主要包括三个模块:Mamba增强的卷积Transformer用于处理EEG信号,双分支时空编码器用于建模EOG信号的时间和通道依赖关系,以及一个跨模态注意力机制以实现模态间的显式交互。

关键创新:最重要的创新在于引入了可靠性意识模块,该模块能够根据样本的可靠性动态调整模态权重,从而提高多模态融合的效果和鲁棒性。

关键设计:网络结构中采用了带感知卷积和Transformer相结合的设计,损失函数考虑了模态权重的动态调整,确保了特征和预测的一致性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,RAMamba-Net在两个AAD基准测试中实现了5.76%的准确率提升,相较于单模态基线,展现出更强的解码鲁棒性和判别能力,验证了跨模态交互和可靠性意识模块的有效性。

🎯 应用场景

该研究的潜在应用领域包括神经驱动的听力设备和自然的人机交互系统,能够显著提升用户在复杂环境中的听觉体验。未来,该技术有望在智能助听器、语音识别和人机交互等领域发挥重要作用。

📄 摘要(原文)

Auditory attention decoding (AAD) identifies the attended speaker from physiological signals, supporting neuro-steered hearing devices and natural human-machine interaction. Electroencephalography (EEG) is the dominant modality for AAD but provides incomplete evidence in naturalistic audio-visual scenes, motivating EEG and electrooculography (EOG) fusion. Existing approaches remain limited by weak cross-modal interaction, inefficient temporal modeling, and low robustness to sample variations. To address the limitations, we propose RAMamba-Net, a reliability-aware Mamba-based multimodal fusion network for AAD. RAMamba-Net employs a Mamba-enhanced band-aware convolutional Transformer to capture band-specific EEG patterns and long-range temporal dynamics. A dual-branch temporal-spatial encoder models EOG temporal and inter-channel dependencies. Cross-modal attention enables explicit modality interaction. Then, a reliability-aware module is introduced to estimate sample-wise modality weights for feature and prediction consistency, thereby enhancing multimodal fusion. Experiments on two AAD benchmarks demonstrate that RAMamba-Net effectively exploits complementary EEG-EOG information, yielding accuracy gains of 5.76% over unimodal baselines, together with more robust decoding and discriminative representations. Further analyses show that explicit cross-modal interaction improves multimodal alignment, while the reliability-aware module suppresses unreliable modality evidence and is robust to signal perturbation and parameter variation.