No Pitch Left Behind: Addressing Gender Unbalance in Automatic Speech Recognition through Pitch Manipulation

📄 arXiv: 2310.06590v1 📥 PDF

作者: Dennis Fucci, Marco Gaido, Matteo Negri, Mauro Cettolo, Luisa Bentivogli

分类: cs.CL

发布日期: 2023-10-10

备注: Accepted at ASRU 2023


💡 一句话要点

提出基于音高操控的数据增强技术以解决ASR中的性别不平衡问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control)

关键词: 自动语音识别 性别偏见 数据增强 基频操控 深度学习

📋 核心要点

  1. 现有的ASR系统在性别识别准确率上存在显著差异,尤其是女性说话者的代表性不足导致的偏见问题。
  2. 本文提出了一种通过操控基频和共振峰进行数据增强的方法,以模拟女性说话者的声音,增加数据的多样性。
  3. 实验结果显示,该方法在女性说话者的识别上实现了最高9.87%的WER改善,尤其在低频范围内效果更佳。

📝 摘要(中文)

自动语音识别(ASR)系统对语音数据的社会语言变异性非常敏感,其中性别扮演着关键角色。这导致男性和女性说话者之间的识别准确率存在差异,主要原因是训练数据中女性说话者的代表性不足。尽管在混合ASR模型中提出了多种解决方案,但在端到端神经架构中,性别偏见问题尚未得到明确解决。为填补这一空白,本文提出了一种通过操控基频(f0)和共振峰进行数据增强的技术,旨在减少性别间的数据不平衡,并增加每个性别组内的变异性。实验结果表明,该技术在自发英语语音的女性说话者的识别上,词错误率(WER)相对改善高达9.87%,在最少代表的f0范围内提升更为显著。

🔬 方法详解

问题定义:本文旨在解决自动语音识别系统中性别不平衡导致的识别准确率差异问题。现有方法未能有效处理端到端神经网络中的性别偏见,尤其是女性说话者的代表性不足。

核心思路:提出通过操控基频(f0)和共振峰进行数据增强,以模拟女性说话者的声音,从而减少性别间的数据不平衡,并增加每个性别组内的变异性。

技术框架:整体流程包括数据预处理、基频和共振峰的操控、数据增强生成以及训练模型。主要模块包括音频特征提取、数据增强算法和ASR模型训练。

关键创新:本研究的创新点在于首次在端到端神经架构中引入基频操控的技术,显著改善了女性说话者的识别性能,与传统方法相比,提供了更为有效的解决方案。

关键设计:在参数设置上,选择了适当的基频范围和共振峰特征,以确保生成的音频数据具有足够的自然性和多样性。此外,采用了适合的损失函数以优化模型在性别识别上的表现。

🖼️ 关键图片

img_0

📊 实验亮点

实验结果显示,采用基于音高操控的数据增强技术后,女性说话者的词错误率(WER)相对改善高达9.87%。在低频范围内,识别性能的提升幅度更为显著,表明该方法在解决性别不平衡问题上具有重要效果。

🎯 应用场景

该研究的潜在应用领域包括语音助手、电话客服系统及其他需要高准确率语音识别的场景。通过改善性别识别的准确性,能够提升用户体验,推动ASR技术在更广泛领域的应用,尤其是在女性用户的语音交互中。未来,该技术可能会影响语音识别系统的设计标准,促进性别公平的实现。

📄 摘要(原文)

Automatic speech recognition (ASR) systems are known to be sensitive to the sociolinguistic variability of speech data, in which gender plays a crucial role. This can result in disparities in recognition accuracy between male and female speakers, primarily due to the under-representation of the latter group in the training data. While in the context of hybrid ASR models several solutions have been proposed, the gender bias issue has not been explicitly addressed in end-to-end neural architectures. To fill this gap, we propose a data augmentation technique that manipulates the fundamental frequency (f0) and formants. This technique reduces the data unbalance among genders by simulating voices of the under-represented female speakers and increases the variability within each gender group. Experiments on spontaneous English speech show that our technique yields a relative WER improvement up to 9.87% for utterances by female speakers, with larger gains for the least-represented f0 ranges.