Xiaomi-CocktailASR-1 Technical Report
作者: Yiru Zhang, Hang Su, Lichun Fan, Ying Zeng, Chang Liu, Yifeng Wang, Yuquan Liang, Tao Li, Lian Li, Wenhao Yang, Jian Luan, Cong Zou, Heng Qu
分类: cs.SD, cs.CL, eess.AS
发布日期: 2026-09-10
💡 一句话要点
提出Xiaomi-CocktailASR-1以解决多说话者场景下的ASR问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 自动语音识别 多说话者识别 鸡尾酒会问题 声纹提示 负样本拒绝 大型语言模型 端到端架构
📋 核心要点
- 现有的ASR方法在多说话者场景中表现不佳,尤其是在鸡尾酒会问题上,导致单说话者性能下降和无法拒绝缺失目标说话者的情况。
- Xiaomi-CocktailASR-1通过利用参考语音作为声纹提示,直接转录目标说话者的语音,避免了语音分离的复杂性。
- 实验结果表明,Xiaomi-CocktailASR-1在多说话者和单说话者场景中均表现优异,具备负样本拒绝能力,达到了最先进的性能水平。
📝 摘要(中文)
近年来,基于大型语言模型的自动语音识别(ASR)模型取得了显著进展,但在多说话者场景中,鸡尾酒会问题仍然是ASR进一步发展的关键瓶颈。现有的时间序列ASR方法,包括带有说话者嵌入的端到端架构和最新的基于LLM的探索,通常在单说话者性能上有所下降,并且无法在目标说话者缺失时进行拒绝。在本文中,我们提出了Xiaomi-CocktailASR-1,这是一种基于LLM的端到端时间序列ASR架构。通过利用参考语音作为声纹提示,它直接转录目标说话者的语音,而无需进行语音分离。Xiaomi-CocktailASR-1在单说话者场景中保持了与主流ASR模型相当的竞争性能,并具备负样本拒绝能力,当目标说话者在混合语音中缺失时输出空文本。此外,Xiaomi-CocktailASR-1支持链式思维推理模式,提供明确的推理步骤。大量在各种合成和真实世界多说话者基准上的实验表明,Xiaomi-CocktailASR-1实现了最先进的性能,有效解决了鸡尾酒会问题,统一架构平衡了多说话者和单说话者的识别准确性及拒绝能力。
🔬 方法详解
问题定义:本文旨在解决多说话者场景下的自动语音识别(ASR)问题,尤其是鸡尾酒会问题。现有方法在处理多说话者时,通常会导致单说话者性能下降,并且无法有效拒绝缺失的目标说话者。
核心思路:Xiaomi-CocktailASR-1的核心思路是利用参考语音作为声纹提示,直接转录目标说话者的语音,而无需进行复杂的语音分离。这种设计使得模型在多说话者场景中能够更好地识别目标说话者的语音。
技术框架:该架构为端到端的时间序列ASR模型,包含声纹提示输入模块、语音识别模块和输出处理模块。模型通过参考语音进行训练,增强了对目标说话者的识别能力,同时具备负样本拒绝功能。
关键创新:Xiaomi-CocktailASR-1的主要创新在于其负样本拒绝能力,能够在目标说话者缺失时输出空文本。这一特性在现有ASR方法中并不常见,显著提升了模型的实用性。
关键设计:模型采用了特定的损失函数以优化识别性能,并在网络结构中引入了声纹提示的处理模块。参数设置经过精细调优,以确保在多说话者和单说话者场景中均能保持高性能。
🖼️ 关键图片
📊 实验亮点
在多说话者基准测试中,Xiaomi-CocktailASR-1展现出最先进的性能,单说话者识别准确率与主流模型相当,同时在目标说话者缺失时能够准确输出空文本,提升了模型的实用性和可靠性。
🎯 应用场景
Xiaomi-CocktailASR-1的研究成果在多个领域具有广泛的应用潜力,包括智能助手、会议记录、语音翻译等。其在多说话者环境中的优越表现,能够显著提升语音识别的准确性和用户体验,未来可能推动相关技术的进一步发展和商业化应用。
📄 摘要(原文)
Recently, large language model (LLM) based ASR models have achieved significant progress, yet they generally lack support for multi-speaker scenarios, where the cocktail party problem remains a critical bottleneck for further advancing ASR. Existing TS-ASR methods, including end-to-end architectures with speaker embeddings and latest LLM-based explorations suffer from degraded single-speaker performance and the inability to reject when the target speaker is absent. In this paper, we propose Xiaomi-CocktailASR-1, an LLM-based end-to-end TS-ASR architecture. By utilizing reference speech as voiceprint prompts, it directly transcribes the target speaker's speech without requiring speech separation. Xiaomi-CocktailASR-1 maintains competitive performance in single-speaker scenarios, comparable to mainstream ASR models. It also features a negative sample rejection capability, outputting empty text when the target speaker is absent from the mixed speech. Additionally, Xiaomi-CocktailASR-1 supports a Chain-of-Thought (CoT) reasoning mode to provide explicit reasoning steps. Extensive experiments on various synthetic and real-world multispeaker benchmarks demonstrate that Xiaomi-CocktailASR-1 achieves state-of-the-art performance, effectively addressing the cocktail party problem through a unified architecture that balances multispeaker and single-speaker recognition accuracy, along with rejection capability.