Noise Adaptive Streaming Audio-Visual Speech Token Enhancement for Robust Full-Duplex Spoken Dialogue Models
作者: Bella Godiva, Yeonju Kim, Yong Man Ro
分类: cs.SD, cs.AI, cs.HC
发布日期: 2026-09-08
备注: Accepted to EMNLP 2026
💡 一句话要点
提出AV-STE以解决全双工对话系统在噪声环境下的鲁棒性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 全双工对话 音视频融合 鲁棒性提升 语音处理 多模态学习
📋 核心要点
- 现有的全双工对话系统在背景噪声和重叠语音情况下,音频感知能力不足,导致响应不连贯。
- 论文提出AV-STE,一个模块化的音视频前端,能够在语音模型处理前恢复受损的语义语音标记,避免了对大型模型的重新训练。
- 实验结果显示,AV-STE在同一数据集的说话者干扰下,GPT-4o评判的响应连贯性从1.42提升至1.91,且保持了良好的轮流发言行为。
📝 摘要(中文)
全双工对话系统能够实现同时听说,但在背景噪声和重叠语音下,音频感知常常失败,导致响应不连贯。近期的音视频对话方法表明,结合视觉线索(如唇部动作)可以提高在音频损坏情况下的鲁棒性。然而,现有方法通常需要对大型对话模型进行适应性训练,以处理视觉输入,成本高昂。我们提出了AV-STE,这是一种模块化的流媒体音视频前端,能够在语音大语言模型处理之前,从嘈杂音频和唇部视频中恢复受损的语义语音标记。下游对话模型保持完全冻结,保留其预训练的对话能力。与冻结的Moshi集成后,AV-STE在同一数据集的说话者干扰下,将GPT-4o评判的响应连贯性从1.42提高到1.91,同时在很大程度上保持了轮流发言行为。提升效果也转移到域外的无缝交互中。
🔬 方法详解
问题定义:本论文旨在解决全双工对话系统在背景噪声和重叠语音下的鲁棒性问题。现有方法需要对大型对话模型进行适应性训练,成本高且效率低。
核心思路:AV-STE通过模块化设计,作为音视频前端,能够在语音大语言模型处理之前恢复受损的语义语音标记,从而提高系统的鲁棒性,而无需重新训练下游模型。
技术框架:AV-STE的整体架构包括音频处理模块和视觉处理模块,前者负责从嘈杂音频中提取语音特征,后者则从唇部视频中提取视觉特征,最终将恢复的语义标记传递给下游的对话模型。
关键创新:AV-STE的最大创新在于其模块化设计,使得下游对话模型保持冻结状态,从而保留其预训练能力,避免了高昂的多模态训练成本。
关键设计:在设计中,AV-STE采用了特定的损失函数来优化语音和视觉特征的融合,同时确保了处理延迟的最小化,以适应实时对话的需求。
🖼️ 关键图片
📊 实验亮点
实验结果表明,AV-STE在同一数据集的说话者干扰下,GPT-4o评判的响应连贯性从1.42提升至1.91,提升幅度达34.5%。此外,AV-STE在保持良好的轮流发言行为的同时,提升效果也成功转移到域外的无缝交互场景中。
🎯 应用场景
该研究的潜在应用场景包括智能助手、客服机器人以及任何需要实时语音交互的系统。通过提高在噪声环境下的鲁棒性,AV-STE能够显著提升用户体验,尤其是在嘈杂的公共场所或多说话者的环境中。未来,该技术有望推动更广泛的多模态对话系统的发展。
📄 摘要(原文)
Full-duplex spoken dialogue systems enable simultaneous listening and speaking, but their audio-only perception often fails under background noise and overlapping speech, leading to incoherent responses. Recent audio-visual dialogue approaches show that incorporating visual cues such as lip movements improve robustness under audio corruption. However, existing approaches often adapt the large speech dialogue model itself to process visual input, requiring costly multimodal training. We propose AV-STE, a modular streaming audio-visual front-end that restores corrupted semantic speech tokens from noisy audio and lip video before they reach the speech LLM. The downstream dialogue model remains entirely frozen, preserving its pretrained conversational capabilities. When integrated with frozen Moshi, AV-STE improves average GPT-4o-judged response coherence from 1.42 to 1.91 under same-dataset speaker interference while largely preserving turn-taking behavior. Gains also transfer to out-of-domain Seamless Interaction.