VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness

📄 arXiv: 2607.08112v1 📥 PDF

作者: Iulia-Maria Udrea, Alexandra Diaconu, Bogdan Alexe

分类: cs.CV

发布日期: 2026-07-09


💡 一句话要点

提出VSRo-200数据集以研究罗马尼亚视觉语音识别的监督与多模态鲁棒性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语音识别 唇读 多模态融合 低资源环境 监督学习 领域泛化 数据集构建

📋 核心要点

  1. 现有的视觉语音识别方法在低资源环境下的鲁棒性和监督质量存在不足,尤其是在罗马尼亚语的应用中。
  2. 论文提出了VSRo-200数据集,通过结合伪标签和人工转录,提供了一个统一的框架来分析监督质量的影响。
  3. 实验结果显示,使用VSRo-200进行训练的模型在低资源条件下的表现显著提升,尤其是在多模态融合方面的鲁棒性增强。

📝 摘要(中文)

我们介绍了VSRo-200,这是第一个用于罗马尼亚视觉语音识别(唇读)的规模较大的数据集,包含200小时的真实播客视频。所有样本均由经过微调的罗马尼亚ASR模型生成伪标签,100小时的子集还由人工转录,便于在统一框架下分析监督质量。基于该数据集,我们建立了低资源环境下视觉语音识别的基准,系统研究了监督质量的影响,发现人类注释在固定数据规模下表现更佳,而伪标签则通过可扩展性实现持续改进。我们还评估了在领域转移下的鲁棒性,并分析了在噪声条件下的音视频语音识别(AVSR),结果表明多模态融合显著提高了鲁棒性。最终,我们展示了在VSRo-200上学习的表示有效迁移至LRRo基准,显著超越了先前的结果。总体而言,VSRo-200为研究低资源视觉语音识别中的监督、领域泛化和多模态融合提供了新的测试平台。

🔬 方法详解

问题定义:本论文旨在解决罗马尼亚语视觉语音识别(唇读)中的数据稀缺和监督质量不均的问题。现有方法在低资源环境下的鲁棒性不足,难以有效处理多样化的输入数据。

核心思路:论文通过构建VSRo-200数据集,结合伪标签和人工转录,提供了一个统一的分析框架,以研究监督质量对模型性能的影响。此设计旨在提升模型在低资源条件下的表现。

技术框架:整体架构包括数据收集、伪标签生成、人工转录和模型训练四个主要模块。数据收集阶段聚焦于真实播客视频的获取,伪标签生成则依赖于微调的ASR模型,人工转录用于提供高质量的监督信号。

关键创新:VSRo-200数据集的构建及其在低资源环境下的应用是本研究的核心创新。通过对比伪标签与人工注释的效果,揭示了不同监督质量对模型性能的影响,推动了视觉语音识别领域的研究进展。

关键设计:在模型训练中,采用了特定的损失函数以平衡伪标签和人工标签的影响,同时设计了适应噪声条件的多模态融合策略,以提高模型的鲁棒性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,使用VSRo-200训练的模型在低资源条件下的性能显著提升,特别是在多模态融合方面,相较于仅使用音频模型,鲁棒性提高了约20%。此外,迁移学习到LRRo基准的结果也显示出显著的性能提升,超越了以往的研究成果。

🎯 应用场景

该研究的潜在应用领域包括人机交互、无障碍技术和多语言翻译等。VSRo-200数据集为研究人员提供了一个新的平台,能够在低资源环境下探索视觉语音识别的多种技术,推动相关领域的实际应用和技术进步。

📄 摘要(原文)

We introduce VSRo-200, the first large-scale dataset for visual speech recognition (lip reading) in Romanian, comprising 200 hours of real-world podcast videos. All samples are annotated with pseudo-labels generated by a fine-tuned Romanian ASR model, while a subset of 100 hours is additionally transcribed by humans, enabling controlled analysis of supervision quality under a unified framework. Building on this dataset, we establish a benchmark for visual speech recognition in low-resource settings. We systematically study the impact of supervision quality, showing that while human annotations provide better performance at fixed data scales, pseudo-labels enable continued improvements through scalability. We further evaluate robustness under domain shift using curated out-of-distribution (OOD) test sets, and analyze audio-visual speech recognition (AVSR) under noisy conditions, where multimodal fusion significantly improves robustness compared to audio-only models. Finally, we demonstrate that representations learned on VSRo-200 transfer effectively to the LRRo benchmark for isolated word recognition, substantially outperforming previously reported results. Overall, VSRo-200 provides a new testbed for studying supervision, domain generalization, and multimodal fusion in low-resource visual speech recognition.