Team RAS in 11th ABAW Competition: Multimodal Ambivalence Recognition Approach
作者: Elena Ryumina, Maxim Markitantov, Alexandr Axyonov, Fedor Shchetinin, Timur Abdulkadirov, Dmitry Ryumin, Alexey Karpov
分类: cs.CV, cs.AI
发布日期: 2026-07-16
备注: 10 pages, 2 figures
💡 一句话要点
提出单一文本中心的多模态方法以解决模棱两可情感识别问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 模棱两可识别 多模态融合 情感计算 文本中心模型 深度学习
📋 核心要点
- 现有方法在模棱两可和犹豫状态的识别上面临挑战,通常依赖于复杂的模型集成,导致计算成本高。
- 本文提出了一种文本中心的多模态融合方法,通过将文本作为锚定模态,结合其他模态特征进行识别。
- 实验结果显示,文本残差融合模型在多个测试集上均表现优异,尤其在私有测试集上达到了78.24%的宏F1分数,显著优于传统文本模型。
📝 摘要(中文)
自动识别模棱两可和犹豫状态具有挑战性,因为这些状态可能通过不一致的语言、声学、面部和上下文模式表达,而顶尖系统通常依赖于计算成本高昂的集成方法。本文提出了一种针对第11届情感与行为分析挑战赛(ABAW)的单一文本中心多模态方法,用于视频级别的模棱两可和犹豫识别。该方法结合了语言、声学、面部和场景特征,采用文本残差融合模型。实验结果表明,文本是最强的单模态,文本残差融合模型在开发和公共测试子集上达到了75.14%的平均宏F1分数,在私有测试子集上达到了78.24%,比文本模型提高了4.03%。这些结果表明,互补的多模态信息可以在不需要大型模型集成的情况下提高识别性能。
🔬 方法详解
问题定义:本文旨在解决模棱两可和犹豫情感状态的自动识别问题。现有方法通常依赖于复杂的模型集成,导致计算成本高且难以实现实时应用。
核心思路:提出了一种单一文本中心的多模态融合方法,利用文本作为锚定模态,通过门控残差调整结合其他模态特征,以提高识别准确性。
技术框架:整体架构包括文本特征提取、声学特征提取、面部特征提取和场景特征提取四个主要模块,最后通过文本残差融合模型进行特征融合和分类。
关键创新:最重要的技术创新在于文本残差融合模型的设计,它通过将文本作为主导模态,利用其他模态的信息进行补充,从而提高了识别性能,区别于传统的多模态集成方法。
关键设计:模型采用了门控机制来调整不同模态的影响力,损失函数设计为适应多模态特征的融合,网络结构则基于深度学习框架,确保了高效的特征提取和融合。
🖼️ 关键图片
📊 实验亮点
实验结果显示,文本残差融合模型在开发和公共测试子集上达到了75.14%的平均宏F1分数,而在私有测试子集上更是达到了78.24%,比传统文本模型提高了4.03%。这些结果表明,采用多模态信息能够显著提升情感识别的准确性。
🎯 应用场景
该研究的潜在应用领域包括情感计算、心理健康监测和人机交互等。通过提高模棱两可情感状态的识别能力,可以在社交机器人、虚拟助手等领域实现更自然的互动,提升用户体验和情感理解能力。未来,该方法有望在实时情感分析和智能监控系统中发挥重要作用。
📄 摘要(原文)
Automatic recognition of ambivalence and hesitancy is challenging because these states may be expressed through inconsistent linguistic, acoustic, facial, and contextual patterns, while top-performing systems often rely on computationally expensive ensembles. We present a single text-centered multimodal approach for video-level ambivalence and hesitancy recognition for the 11th Affective & Behavior Analysis in-the-Wild (ABAW) Challenge. The proposed approach combines linguistic, acoustic, facial, and scene features using text-centered multimodal fusion model. Text Residual Fusion treats text as the anchor modality and applies gated residual adjustments based on the other modalities. Experiments on the Behavioural Ambivalence/Hesitancy (BAH) corpus confirm that text is the strongest unimodal modality. The Text Residual Fusion model achieves an average Macro F1-score (MF1) of 75.14% across the Development and Public Test subsets. On the Private Test subset, it reaches an MF1 of 78.24%, outperforming the text model by 4.03%. These results demonstrate that complementary multimodal information can improve recognition performance without requiring a large model ensemble.