SALMONN: Towards Generic Hearing Abilities for Large Language Models

📄 arXiv: 2310.13289v2 📥 PDF

作者: Changli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Chao Zhang

分类: cs.SD, cs.CL, eess.AS

发布日期: 2023-10-20 (更新: 2024-04-08)

🔗 代码/项目: GITHUB


💡 一句话要点

提出SALMONN以实现大型语言模型的通用听觉能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态模型 音频处理 语音识别 情感分析 跨模态能力 少量样本学习 人工智能

📋 核心要点

  1. 现有的人工智能模型在处理音频信息时往往缺乏通用性,无法有效理解和生成多种类型的声音。
  2. SALMONN通过将预训练的文本基础大型语言模型与语音和音频编码器集成,形成一个能够直接处理音频输入的多模态模型。
  3. SALMONN在多个语音和音频任务上表现出色,并展现出未训练情况下的新兴能力,推动了AI听觉能力的发展。

📝 摘要(中文)

听觉被认为是人工智能(AI)代理在物理世界中的基本能力,涉及对一般听觉信息的感知和理解,包括语音、音频事件和音乐等三种声音类型。本文提出了SALMONN,一个集成了预训练文本基础的大型语言模型(LLM)与语音和音频编码器的多模态模型。SALMONN使LLM能够直接处理和理解一般音频输入,并在自动语音识别、翻译、基于听觉信息的问题回答、情感识别、说话人验证以及音乐和音频字幕等多个任务上取得了竞争力的表现。此外,SALMONN还展现了一系列在训练中未见的多样化新兴能力,包括未训练语言的语音翻译、基于语音的槽填充、基于口语查询的问题回答、基于音频的讲故事和语音音频共同推理等。本文研究了跨模态新兴能力的存在,并提出了一种新颖的少量样本激活调优方法来激活这些能力。SALMONN是此类模型中的首个实例,标志着朝着具备通用听觉能力的AI迈出了一步。

🔬 方法详解

问题定义:本论文旨在解决现有AI模型在处理和理解音频信息时的局限性,尤其是在多模态音频任务中的表现不足。现有方法往往无法有效整合语音、音频事件和音乐等多种声音类型的信息。

核心思路:SALMONN的核心思路是将大型语言模型与音频编码器结合,使其能够直接处理和理解音频输入。这种设计使得模型能够在多种音频任务中表现出色,且具备跨模态的理解能力。

技术框架:SALMONN的整体架构包括三个主要模块:预训练的文本基础大型语言模型、语音编码器和音频编码器。模型通过这些模块的协同作用,能够实现对音频信息的全面理解和处理。

关键创新:SALMONN的最大创新在于其跨模态新兴能力的实现,尤其是在未训练语言的语音翻译和音频讲故事等任务中的表现。这与传统方法的单一模态处理形成了鲜明对比。

关键设计:在模型设计中,采用了少量样本激活调优方法,以激活新兴能力。此外,模型的损失函数和网络结构经过精心设计,以确保在多种任务上的高效学习和表现。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

SALMONN在多个语音和音频任务上表现出色,尤其是在自动语音识别和翻译任务中,取得了显著的性能提升。具体而言,模型在未训练语言的语音翻译任务中表现出色,展示了其强大的跨模态理解能力。

🎯 应用场景

SALMONN的研究成果在多个领域具有广泛的应用潜力,包括智能助手、语音翻译、情感分析、音频内容生成等。随着AI听觉能力的提升,未来可能在教育、娱乐、医疗等行业中发挥重要作用,推动人机交互的进一步发展。

📄 摘要(原文)

Hearing is arguably an essential ability of artificial intelligence (AI) agents in the physical world, which refers to the perception and understanding of general auditory information consisting of at least three types of sounds: speech, audio events, and music. In this paper, we propose SALMONN, a speech audio language music open neural network, built by integrating a pre-trained text-based large language model (LLM) with speech and audio encoders into a single multimodal model. SALMONN enables the LLM to directly process and understand general audio inputs and achieve competitive performances on a number of speech and audio tasks used in training, such as automatic speech recognition and translation, auditory-information-based question answering, emotion recognition, speaker verification, and music and audio captioning etc. SALMONN also has a diverse set of emergent abilities unseen in the training, which includes but is not limited to speech translation to untrained languages, speech-based slot filling, spoken-query-based question answering, audio-based storytelling, and speech audio co-reasoning etc. The presence of cross-modal emergent abilities is studied, and a novel few-shot activation tuning approach is proposed to activate such abilities. To our knowledge, SALMONN is the first model of its type and can be regarded as a step towards AI with generic hearing abilities. The source code, model checkpoints and data are available at https://github.com/bytedance/SALMONN.