AVSRBench: A Multi-Condition AVSR Benchmark

📄 arXiv: 2609.10366v1 📥 PDF

作者: Rishabh Jain, Naomi Harte

分类: eess.AS, cs.CV, cs.MM

发布日期: 2026-09-09

备注: Accepted to IEEE SLT 2026


💡 一句话要点

提出AVSRBench以解决多条件下的AVSR泛化问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 音视频语音识别 多模态融合 泛化能力 Lombard语音 数据预处理 基准评估 视觉理解 声学回退

📋 核心要点

  1. 现有的AVSR方法在广播语音上表现良好,但在其他条件下的泛化能力不足,存在显著的性能差距。
  2. 论文提出了RoomReader-AV基准,评估多种AVSR架构在不同条件下的表现,旨在揭示和缩小泛化差距。
  3. 实验结果显示,视觉理解在非广播条件下显著下降,且多模态系统在Lombard语音环境中表现最佳,强调了发音清晰度的重要性。

📝 摘要(中文)

尽管在标准LRS3基准上,音视频语音识别(AVSR)已实现低于1%的字错误率,但其对广播语音的依赖使得我们无法判断这是否反映了真正的泛化能力或仅仅是领域适应。为此,本文评估了三种AVSR架构在六种不同条件下的表现,包括受控广播语音、固定语法的发言、超清晰的Lombard语音、专业和非专业发言者的朗读语音,以及自发的多方视频对话。研究发现,视觉单一性能在广播领域之外迅速下降,而音视频融合主要在Lombard语音环境中受益。此外,90°侧面视图下视觉理解急剧下降,多模态系统在很大程度上依赖声学回退。最后,发言者的发音清晰度比轻微的摄像机位移更为关键,而基于大语言模型的架构在域外泛化能力上表现不佳。为了解决这一问题,本文还引入了RoomReader-AV作为新的AVSR基准,并发布了统一的数据预处理管道,以便进行全面的多条件评估。

🔬 方法详解

问题定义:本文旨在解决当前AVSR系统在多种条件下的泛化能力不足的问题。现有方法主要依赖于广播语音,导致在其他环境下性能显著下降。

核心思路:通过引入RoomReader-AV基准,评估不同AVSR架构在多种真实场景下的表现,旨在揭示系统的泛化能力和局限性。

技术框架:研究设计了一个多条件评估框架,包含六种不同的语音条件,评估三种AVSR架构的性能,重点关注视觉和音频的融合效果。

关键创新:最重要的创新在于提出了RoomReader-AV基准和统一的数据预处理管道,使得多条件评估变得可行,填补了现有研究的空白。

关键设计:在实验中,采用了不同的语音条件和发言者类型,特别关注了视觉理解在不同视角下的表现,以及声学回退机制的有效性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,在非广播条件下,视觉单一性能迅速下降,尤其在90°侧面视图下,表现显著低于广播条件。多模态系统在Lombard语音环境中表现最佳,强调了发音清晰度的重要性。整体上,研究揭示了当前AVSR系统的泛化能力存在显著差距。

🎯 应用场景

该研究的潜在应用领域包括智能助手、无障碍技术和人机交互等。通过提高AVSR系统在多种真实场景下的表现,能够显著提升用户体验,尤其是在复杂环境中。未来,该研究可能推动更广泛的多模态学习和应用的发展。

📄 摘要(原文)

While AVSR has achieved sub-1% word error rates on the standard LRS3 benchmark, its reliance on broadcast speech obscures whether this reflects true generalization or just domain adaptation. To investigate this gap, we evaluate three AVSR architectures across six conditions: controlled broadcast speech, fixed-grammar utterances, hyper-articulated Lombard speech, read speech from professional lipspeakers and non-professional speakers, and spontaneous multi-party video conversations. We find that visual-only performance deteriorates rapidly beyond broadcast domains, and audio-video fusion mainly benefits Lombard speech environments. Visual understanding degrades sharply at 90° profile views, with multimodal systems relying largely on acoustic fallback. Additionally, speaker articulation proves more critical than minor camera shifts, and LLM-based architectures suffer from poor out-of-domain generalization. Our work highlights a significant generalization gap in current AVSR research. To address this, we also introduce RoomReader-AV as a new benchmark for AVSR and release a unified data preprocessing pipeline to make comprehensive multi-condition evaluation accessible.