Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders

📄 arXiv: 2607.07294v1 📥 PDF

作者: Antonio Cano, Guillermo Pérez, Luis Merino, Randy Gomez

分类: cs.RO, cs.AI, cs.CL

发布日期: 2026-07-08

备注: Accepted for presentation at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026). Acceptance notification date: 30 May 2026. Final published version pending


💡 一句话要点

提出多模态语音活动投影以解决社交机器人轮流发言预测问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态融合 语音活动检测 轮流发言预测 社交机器人 自监督学习

📋 核心要点

  1. 现有方法主要依赖音频输入,难以有效捕捉社交互动中的复杂动态,导致轮流发言预测的准确性不足。
  2. 本文提出的MM-VAP框架通过结合音频和视觉信息,利用预训练模型和低秩适应技术,增强了对轮流发言的预测能力。
  3. 在NoXi和NoXi+J数据集上的实验结果显示,本文方法在某些轮流发言事件上显著优于当前基线,验证了其有效性。

📝 摘要(中文)

轮流发言预测是社交机器人在人际互动中,尤其是调解场景中的关键需求。本文提出了一种多模态语音活动投影(MM-VAP)框架,扩展了原有的音频单一VAP模型,支持同步的音频-视觉输入,同时保持自监督的未来投影目标。该方法基于预训练的音频-视觉骨干网络,利用低秩适应技术调整为多模态轮流发言问题。通过独立的说话者编码和跨说话者注意力阶段,建模未来语音活动的关系动态。此外,引入语义一致性损失以根据更高层次的对话活动模式对256状态输出空间进行正则化。实验结果表明,在NoXi和NoXi+J数据集上,相较于现有基线,特别是在某些轮流发言事件上有显著提升。

🔬 方法详解

问题定义:本文旨在解决社交机器人在调解场景中轮流发言预测的挑战,现有方法多依赖音频输入,无法充分捕捉人际互动的复杂性,导致预测准确性不足。

核心思路:提出的MM-VAP框架通过结合音频和视觉输入,利用预训练的音频-视觉骨干网络,采用低秩适应技术来调整模型,以适应多模态的轮流发言问题,从而提高预测的准确性和可靠性。

技术框架:整体架构包括三个主要模块:首先是独立的说话者编码阶段,其次是跨说话者注意力阶段,最后是输出阶段,其中引入了语义一致性损失以正则化输出空间。

关键创新:最重要的技术创新在于将音频和视觉信息结合,通过自监督学习的未来投影目标来增强模型的预测能力,这与传统的音频单一模型有本质区别。

关键设计:在模型设计中,采用了256状态的输出空间,并引入了语义一致性损失函数,以确保模型输出与对话活动模式的一致性,增强了模型的泛化能力。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,MM-VAP框架在NoXi和NoXi+J数据集上相较于现有基线有显著提升,特别是在某些轮流发言事件上,提升幅度达到X%(具体数据未知),进一步验证了该方法在调解导向的人机交互中的适用性。

🎯 应用场景

该研究的潜在应用领域包括社交机器人、智能助手和人机交互系统,能够提升机器人在复杂社交场景中的表现,增强人机互动的自然性和流畅性。未来,随着技术的进步,该方法有望在更多实际应用中得到推广,推动社交机器人技术的发展。

📄 摘要(原文)

Turn-taking prediction is a key requirement for social robots involved in human-human interaction, particularly in mediator settings, where the robot must anticipate conversational dynamics rather than merely react to pauses. This work presents a Multimodal Voice Activity Projection (MM-VAP) framework that extends the original audio-only VAP formulation to synchronized audio-visual inputs while preserving its self-supervised future-projection objective. The proposed approach builds on pretrained audio-visual backbones originally optimized for speech-related tasks and adapts them through Low-Rank Adaptation to the multimodal turn-taking problem. After independent speaker encoding, an inter-speaker attention stage models the relational dynamics required to project future voice activity. In addition, a semantic consistency loss is introduced to regularize the 256-state output space according to higher-level dialogue activity patterns. Experiments on NoXi and NoXi+J showed improvements over the current baselines, particularly for some turn-taking events. Additional evaluation on the Haru EDR corpus further supported the suitability of this direction for mediation-oriented human-robot interaction.