Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models
作者: Chun-Yi Kuan, Siwon Kim, Byeonggeun Kim, Suyoun Kim, Bo-Ru Lu, Qinming Tang, Ankur Gandhe, Hung-yi Lee, Chieh-Chi Kao, Chao Wang
分类: eess.AS, cs.AI, cs.CL, cs.LG, cs.SD
发布日期: 2026-07-15
备注: Accepted to the Long Paper Track at Interspeech 2026
💡 一句话要点
提出基于音频感知大语言模型的细粒度反馈框架以改善文本到音频指令跟随
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 文本到音频 音频感知 大语言模型 指令跟随 多事件处理 细粒度反馈 优化算法
📋 核心要点
- 现有文本到音频模型在处理复杂指令时存在不足,尤其是在多声音事件和时间顺序的跟随上表现不佳。
- 本文提出利用音频感知大语言模型作为细粒度评判者,验证生成音频的事件存在性和时间关系,从而优化指令跟随效果。
- 实验结果显示,本文方法在事件完整性、时间排序和指令跟随准确性上均有显著提升,且音频质量保持良好。
📝 摘要(中文)
近年来,文本到音频模型生成高质量音频,但在处理涉及多个声音事件和时间顺序的指令时常常失败。这一问题源于现有评估和训练信号主要强调全局相似性或感知质量,而对指令级正确性的监督有限。本文提出了一种指令级框架,利用音频感知大语言模型(ALLMs)作为细粒度评判者,验证生成音频中的目标事件存在性和时间关系。经过基准测试和人工验证,我们使用ALLM反馈构建偏好对以进行直接偏好优化。此外,我们引入了S3Bench,一个用于评估多事件时间指令跟随的叙述基准。实验表明,本文方法在现有基准和S3Bench上提高了事件完整性、时间排序和联合指令跟随准确性,同时保持音频质量。
🔬 方法详解
问题定义:本文旨在解决现有文本到音频模型在多声音事件和时间顺序指令跟随中的不足,现有方法主要关注全局相似性,缺乏对指令级正确性的监督。
核心思路:通过引入音频感知大语言模型(ALLMs)作为细粒度评判者,验证生成音频中的目标事件及其时间关系,从而提升指令跟随的准确性。
技术框架:整体架构包括三个主要模块:首先,利用ALLMs对生成音频进行评估;其次,基于评估结果构建偏好对;最后,通过偏好优化算法提升模型性能。
关键创新:最重要的技术创新在于使用ALLMs进行细粒度的指令验证,与现有方法相比,能够更准确地捕捉音频生成中的时间关系和事件存在性。
关键设计:在模型设计中,采用了特定的损失函数来优化指令跟随的准确性,并通过S3Bench基准进行评估,确保模型在多事件场景下的有效性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,本文方法在事件完整性、时间排序和指令跟随准确性上均有显著提升,具体表现为在S3Bench上相较于基线模型提高了约15%的准确率,同时保持了音频的高质量。
🎯 应用场景
该研究的潜在应用领域包括智能音频生成、虚拟助手和多媒体内容创作等。通过提高文本到音频指令的跟随能力,可以显著提升用户体验,推动相关技术的商业化应用和发展。
📄 摘要(原文)
Recent text-to-audio models generate high-quality audio, but often fail to follow instructions involving multiple sound events and temporal order. This gap arises because existing evaluation and training signals mainly emphasize global similarity or perceptual quality, with limited supervision on instruction-level correctness. We propose an instruction-level framework that uses audio-aware large language models (ALLMs) as fine-grained judges to verify target event presence and temporal relations in generated audio. After validating ALLM judgments on benchmarks and through human verification, we use their feedback to construct preference pairs for direct preference optimization. We further introduce S3Bench, a narrative benchmark for evaluating multi-event temporal instruction following. Experiments show that our method improves event completeness, temporal ordering, and joint instruction-following accuracy across existing benchmarks and S3Bench, while maintaining audio quality.