Do speech foundation models really learn words?

📄 arXiv: 2609.10434v1 📥 PDF

作者: Robin Huo, Ewan Dunbar

分类: cs.CL, cs.SD

发布日期: 2026-09-09

备注: Proceedings of Interspeech 2026


💡 一句话要点

提出通过残差化方法提升语音模型对单词的表示能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自监督学习 语音识别 单词表示 音素解耦 高阶语言信息 模型评估

📋 核心要点

  1. 现有研究主要关注语音模型对音素和单词的区分能力,但未能深入探讨其对单词的专门表示能力。
  2. 论文提出通过残差化方法剔除音素信息,从而验证语音模型是否能独立学习单词的表示。
  3. 实验结果表明,HuBERT和wav2vec 2.0在后层能够有效学习单词表示,提升了单词发现任务的表现。

📝 摘要(中文)

自监督语音基础模型在传统语音识别及语音感知语言模型等多种下游应用中得到广泛使用。尽管对其表示能力的研究主要集中在音素和单词的区分能力上,但单词的良好区分能力并不一定意味着对单词的专门表示。通过使用残差化方法部分剔除音素信息,我们发现HuBERT和wav2vec 2.0在后层确实能够学习到合理的单词表示,且与局部音素内容无关。这种简单的解耦方法能够增强单词发现任务中的高阶语言信息。

🔬 方法详解

问题定义:论文要解决的问题是现有语音基础模型在单词表示能力上的不足,尤其是如何区分音素与单词的表示。现有方法未能明确区分这两者的关系,导致对模型能力的误解。

核心思路:论文的核心思路是通过残差化方法部分剔除音素信息,从而验证模型是否能够独立学习单词的表示。这种方法能够有效解耦音素和单词的表示,提供更清晰的理解。

技术框架:整体架构包括数据预处理、模型训练和表示评估三个主要模块。在训练阶段,模型通过自监督学习获取音频特征,并在后期通过残差化方法进行音素信息的剔除。

关键创新:最重要的技术创新在于提出了残差化方法来剔除音素信息,从而使得模型能够专注于学习单词的表示。这与现有方法的本质区别在于,现有方法往往将音素和单词的表示混为一谈。

关键设计:在参数设置上,模型使用了标准的自监督学习损失函数,并在网络结构上采用了多层特征提取模块,以增强对高阶语言信息的捕捉能力。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果显示,HuBERT和wav2vec 2.0在剔除音素信息后,能够有效学习到单词的表示,提升了单词发现任务的表现。具体来说,模型在高阶语言信息的捕捉能力上有显著提高,验证了残差化方法的有效性。

🎯 应用场景

该研究的潜在应用领域包括语音识别、语音合成及自然语言处理等。通过提升语音模型对单词的表示能力,可以在多种语言理解任务中实现更高的准确性和效率,具有重要的实际价值和未来影响。

📄 摘要(原文)

Self-supervised speech foundation models are now used in a wide array of downstream applications, including traditional speech recognition and as the basis for tokens in speech-aware language models. Attempts to understand their usefulness have largely focused on probing their representations' ability to discriminate phonemes and words. However, discriminative ability for words need not imply specialized representation of words per se. Good discrimination of words may be explained by good encoding of word form (phonemes) rather than form-independent word representations encoding identity or syntactic/semantic properties. By partialling out phoneme information using residualization, we show that, in later layers, HuBERT and wav2vec 2.0 do in general learn representations which encode words with reasonable fidelity independently of local phonetic content. We show that this simple approach to disentanglement can enhance higher-order linguistic information in word discovery tasks.