ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions
作者: Fernando López, Ana Ayala, Guillermo Segovia, Fernando Ibáñez, Ana Martínez, Pablo Gómez, Jordi Luque
分类: cs.CL
发布日期: 2026-07-20
备注: Under review
💡 一句话要点
提出ESCUCHA基准以评估西班牙语在多样化声学条件下的理解能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 西班牙语理解 声学条件 推理能力 多模态评估 音频数据集 语言多样性 模型基准
📋 核心要点
- 现有的西班牙语语音理解研究在真实声学条件下的评估框架相对缺乏,导致模型性能评估不够全面。
- 论文提出ESCUCHA基准,专门设计用于评估LALMs在多样化声学条件下的表现,涵盖推理能力和语言多样性。
- 通过对多个先进的多模态和语音模型进行基准测试,发现与人类表现相比,模型存在显著的性能差距。
📝 摘要(中文)
随着大型音频语言模型(LALMs)的进步,建立稳健的评估框架变得至关重要。在这一背景下,西班牙语在现实声学条件下的理解研究受到的关注相对较少。我们提出了ESCUCHA,这是第一个旨在评估LALMs在异质声学条件和推理能力下表现的西班牙语语音理解基准。ESCUCHA包含1,000个经过人工筛选的问题,配有音频,总时长达162.9小时,音频来源于真实环境而非现有数据集,时长从几秒到超过80分钟不等。该基准强调推理能力,涵盖9个感知类别和10个推理类别,并通过多种西班牙口音和非规范性语言捕捉语言多样性。ESCUCHA还包括多音频问题、口语问题和音频指令,并标记哪些问题支持开放式评估。对多种最先进的多模态和语音模型进行基准测试显示,与训练有素的人类相比,存在显著的性能差距。
🔬 方法详解
问题定义:论文要解决的问题是缺乏针对西班牙语在多样化声学条件下的理解能力的评估基准。现有方法未能充分考虑真实环境中的语言多样性和推理能力的评估。
核心思路:论文的核心解决思路是构建ESCUCHA基准,通过真实环境中的音频数据和多样化的问题设计,全面评估LALMs的表现。这样设计旨在提高模型在实际应用中的有效性和可靠性。
技术框架:整体架构包括数据收集、问题设计、音频标注和模型评估四个主要模块。数据收集从真实环境中获取音频,问题设计涵盖多种类型的问题,音频标注确保数据的准确性,模型评估则通过对比分析不同模型的表现。
关键创新:最重要的技术创新点在于ESCUCHA基准的构建,它不仅考虑了音频的多样性,还强调了推理能力的评估,与现有方法相比,提供了更全面的评估框架。
关键设计:关键设计包括1,000个经过人工筛选的问题,涵盖9个感知类别和10个推理类别,音频时长从几秒到超过80分钟不等,确保了数据的多样性和代表性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,多个最先进的多模态和语音模型在ESCUCHA基准上的表现与训练有素的人类相比存在显著差距,揭示了当前模型在真实声学条件下的局限性。这一发现强调了进一步研究和改进的必要性。
🎯 应用场景
该研究的潜在应用领域包括语音识别、自然语言处理和人机交互等。通过提供一个全面的评估基准,ESCUCHA可以帮助研究人员和开发者更好地理解和改进西班牙语语音理解模型的性能,推动相关技术的发展和应用。
📄 摘要(原文)
As large audio language models (LALMs) advance, robust evaluation frameworks have become essential. In this context, Spanish speech understanding under realistic acoustic conditions has received particularly little attention. We introduce ESCUCHA, the first Spanish speech understanding benchmark designed to evaluate LALMs across heterogeneous acoustic conditions and reasoning abilities. ESCUCHA comprises 1,000 human-curated questions paired with audio, totaling 162.9 hours sourced directly ``from the wild'' rather than drawn from existing datasets, with durations ranging from a few seconds to over 80 minutes. The benchmark emphasizes reasoning, spanning 9 perceptual and 10 reasoning categories, and it captures linguistic diversity through multiple Spanish accents and non-normative speech. ESCUCHA further includes multi-audio questions, spoken questions, and audio instructions, and it flags which questions support open-ended evaluation. Benchmarking several state-of-the-art multimodal and speech models reveals substantial performance gaps relative to trained humans.