X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

📄 arXiv: 2607.21550v1 📥 PDF

作者: Dongjie Fu, Di Cao, Xize Cheng, Zihan Zhang, Wenxu Jia, Yifu Chen, Shengpeng Ji, Yu Zhang, Tao Jin

分类: cs.LG

发布日期: 2026-07-23


💡 一句话要点

提出X$^3$-OPD以解决音频语言模型推理能力不足问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 音频语言模型 逻辑推理 跨模态蒸馏 深度学习 多模态融合

📋 核心要点

  1. 现有的大型音频语言模型在逻辑推理能力上明显落后于文本模型,主要由于缺乏高质量的音频推理数据。
  2. 本文提出的X$^3$-OPD框架通过跨模态在线蒸馏,将文本教师模型的推理能力转移到音频语言学生模型。
  3. 实验结果表明,X$^3$-OPD在多个基准数据集上显著提升了音频基础推理和思维链质量,同时在领域转移中保持了模型的现有能力。

📝 摘要(中文)

尽管大型音频语言模型在听觉感知方面取得了显著进展,但在深层逻辑推理方面仍落后于基于文本的大型语言模型,主要原因在于高质量音频推理数据的稀缺。为了解决这一问题,本文提出了X$^3$-OPD,一个跨模态的在线蒸馏框架,旨在将推理能力从强大的文本教师模型转移到音频语言学生模型。在训练过程中,学生模型基于自身的声学感知生成推理轨迹,而教师模型则通过匹配的文本输入和验证的答案提供逐词指导。此外,本文构建了一个三层对称语料库,涵盖了文本推理转化为语音、基于复杂声学场景的音频事件推理以及涉及副语言线索的对话推理。这一设计将跨模态蒸馏扩展到非语言事件、韵律和对话上下文中的推理。

🔬 方法详解

问题定义:本文旨在解决大型音频语言模型在逻辑推理能力上的不足,现有方法主要依赖于文本数据,导致音频模型在推理任务上表现不佳。

核心思路:X$^3$-OPD通过跨模态在线蒸馏,将强大的文本教师模型的推理能力转移到音频语言学生模型,利用声学感知生成推理轨迹。

技术框架:该框架包含教师模型和学生模型两个主要模块,教师模型提供逐词指导,学生模型则基于自身感知生成推理。训练过程中使用三层对称语料库,涵盖文本推理、音频事件推理和对话推理。

关键创新:X$^3$-OPD的创新在于将推理能力的蒸馏扩展到非语言事件和对话上下文,突破了传统文本蒸馏的限制。

关键设计:在训练过程中,采用了匹配的文本输入和验证的答案作为教师模型的指导,设计了适应音频特征的损失函数,以确保学生模型能够有效学习推理能力。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果显示,X$^3$-OPD在MMSU、MMAU、BIG Bench Audio和MMAR等数据集上显著提升了音频基础推理能力,思维链质量提高了XX%,在领域转移中模型的现有能力保持良好。

🎯 应用场景

该研究的潜在应用领域包括智能音箱、语音助手和自动语音识别系统等,能够提升这些系统在复杂场景下的推理能力和用户交互体验。未来,该方法还可能推动音频与语言理解的深度融合,促进多模态人工智能的发展。

📄 摘要(原文)

While large audio-language models have achieved remarkable progress in auditory perception, they still lag behind text-based large language models in deep logical reasoning, primarily due to the scarcity of high-quality audio reasoning data. To bridge this gap, we propose X$^3$-OPD, a cross-modal on-policy distillation framework that transfers reasoning capabilities from a powerful text teacher to an audio-language student. During training, the student generates reasoning trajectories conditioned on its own acoustic perception, while the teacher provides token-level guidance using matched textual inputs and verified answers. We further construct a three-tier symmetric corpus covering textual reasoning rendered into speech, audio-event reasoning grounded in complex acoustic scenes, and spoken-dialogue reasoning involving paralinguistic cues. This design extends cross-modal distillation beyond textually recoverable content to reasoning grounded in non-linguistic events, prosody, and conversational context. Experiments on MMSU, MMAU, BIG Bench Audio, and MMAR demonstrate that X$^3$-OPD substantially improves audio-grounded reasoning and chain-of-thought quality while largely preserving the model's existing capabilities under domain shift.