The Sound of Absence: Audio-Language Embedding Models Struggle with Negation
作者: Chun-Yi Kuan, Hung-yi Lee
分类: eess.AS, cs.AI, cs.CL, cs.LG, cs.SD
发布日期: 2026-07-14
备注: Manuscript in progress
💡 一句话要点
提出NegEval-Audio框架以解决音频语言嵌入模型的否定问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 音频语言嵌入 否定概念 多模态学习 模型评估 Retrieval-Neg MCQ-Neg 肯定偏见
📋 核心要点
- 现有音频语言嵌入模型在处理否定概念时存在显著不足,导致肯定和否定的表示几乎相同。
- 论文提出NegEval-Audio框架,通过将数据集转换为否定感知任务,评估模型对存在与缺失事件的区分能力。
- 实验结果显示,在否定任务下,模型性能显著下降,尤其是在多项选择任务中准确率远低于随机水平。
📝 摘要(中文)
音频语言嵌入模型如CLAP通常在匹配存在的声音事件上进行评估,但对否定的评估却很少。我们展示了这种仅限肯定的评估隐藏了一个关键限制:这些模型无法编码否定的声音概念,将肯定和否定的字幕映射到几乎相同的表示。为揭示这一盲点,我们引入了NegEval-Audio框架,将现有数据集转换为两个关注否定的任务,以探测模型是否能区分存在与缺失的事件。在AudioCaps和Clotho数据集上,模型在否定任务下的表现急剧下降,否定类型的多项选择准确率远低于随机水平,这一失败在最近的多模态LLM嵌入模型中依然存在。虽然无训练的引导方法改善了MCQ-Neg的表现,但对Retrieval-Neg的提升微乎其微。这表明肯定偏见是表示几何中的一个根本缺陷,迫切需要明确的否定意识训练目标。
🔬 方法详解
问题定义:本论文旨在解决音频语言嵌入模型在处理否定概念时的不足,现有方法在评估时未能有效区分肯定与否定的声音事件,导致模型在实际应用中存在盲点。
核心思路:论文的核心思路是引入NegEval-Audio框架,通过将现有数据集转化为两个否定感知任务,来评估模型在处理否定概念时的能力,从而揭示模型的局限性。
技术框架:NegEval-Audio框架包含两个主要任务:Retrieval-Neg和多项选择否定(MCQ-Neg),通过这些任务探测模型对存在与缺失事件的区分能力。
关键创新:最重要的技术创新在于引入了否定感知的评估任务,明确指出了现有模型在处理否定概念时的根本缺陷,推动了对模型训练目标的重新思考。
关键设计:在实验中,采用了无训练的引导方法来改善MCQ-Neg的表现,但对Retrieval-Neg的提升效果有限,表明需要更深入的模型设计和训练策略以解决肯定偏见问题。
🖼️ 关键图片
📊 实验亮点
实验结果显示,在AudioCaps和Clotho数据集上,模型在否定任务下的表现显著下降,MCQ-Neg的准确率远低于随机水平,表明现有模型在处理否定概念时存在严重缺陷。
🎯 应用场景
该研究的潜在应用领域包括音频理解、语音识别和多模态学习等。通过改进音频语言嵌入模型对否定概念的处理能力,可以提升这些系统在复杂场景下的表现,具有重要的实际价值和未来影响。
📄 摘要(原文)
Audio-language embedding models such as CLAP are widely evaluated on matching present sound events, but rarely on negation. We show this affirmation-only evaluation hides a key limitation: these models fail to encode negated sound concepts, mapping affirmative and negated captions to nearly identical representations. To expose this blind spot, we introduce NegEval-Audio, a framework that converts existing datasets into two negation-aware tasks, Retrieval-Neg and Multiple-Choice Negation (MCQ-Neg), to probe whether models distinguish present from absent events. On AudioCaps and Clotho, performance degrades sharply under negation, with negation-type MCQ accuracy falling far below chance, and the failure persists even for a recent multimodal LLM-based embedding model. While a training-free steering method improves MCQ-Neg, it yields marginal gains for Retrieval-Neg. This indicates that affirmation bias is a fundamental flaw in the representation geometry, necessitating explicit negation-aware training objectives.