Multimodal Ambivalence and Hesitancy Recognition via Cross-Attention and Gated Fusion
作者: Oussama Berhili, Yassine Ouzar, Larbi Boubchir
分类: cs.CV
发布日期: 2026-07-20
💡 一句话要点
提出多模态框架以解决视频中的模棱两可与犹豫识别问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态融合 模棱两可识别 犹豫识别 视频理解 情感分析
📋 核心要点
- 现有方法在模棱两可与犹豫识别中未能有效融合多种模态信息,导致识别性能不足。
- 提出的框架通过双向交叉注意力机制与门控多模态单元(GMU)结合,优化了多模态信息的融合。
- 实验结果显示,该模型在验证集上取得了0.7394的Macro F1,相较于最佳单模态基线提升了11.0%。
📝 摘要(中文)
本文提出了一种多模态框架,用于视频中的模棱两可与犹豫(A/H)识别,旨在应对ECCV 2026的ABAW11挑战。该方法融合了来自BAH数据集的文本、音频和视觉模态,使用三种预训练编码器:F2LLM-v2-0.6B用于文本(1024维)、WavLM-Large用于音频(1024维)和VideoMAE V2用于面部视频(768维)。通过建立全面的单模态基线,最终在验证集上实现了0.7394的Macro F1,较最佳单模态基线提升了11.0%。
🔬 方法详解
问题定义:本文旨在解决视频中模棱两可与犹豫的识别问题。现有方法在多模态信息融合方面存在不足,导致识别效果不理想。
核心思路:通过引入双向交叉注意力机制和门控多模态单元(GMU),实现对文本、音频和视觉模态的有效融合,从而捕捉到单一模态无法提供的互补信息。
技术框架:整体架构包括三个主要模块:文本编码器(F2LLM-v2-0.6B)、音频编码器(WavLM-Large)和视频编码器(VideoMAE V2)。通过这些编码器提取特征后,利用双向交叉注意力机制进行模态间的交互,最后通过GMU进行融合。
关键创新:最重要的创新在于引入了双向交叉注意力机制,使得不同模态之间能够进行有效的信息交互,显著提升了识别性能。
关键设计:在实验中,使用了Optuna进行超参数优化,选择了最佳的架构和优化超参数。最终模型在验证集上实现了0.7394的Macro F1,显示出显著的性能提升。
🖼️ 关键图片
📊 实验亮点
实验结果表明,提出的多模态框架在验证集上达到了0.7394的Macro F1,相较于最佳单模态基线(0.6659)提升了11.0%。此外,该模型在文本特征上表现尤为突出,显著优于零-shot Video-LLaVA基线(0.2827)。
🎯 应用场景
该研究的潜在应用领域包括情感分析、社交媒体监测和人机交互等。通过准确识别模棱两可与犹豫的情感状态,可以帮助系统更好地理解用户情感,从而提升用户体验和交互质量。未来,该技术有望在智能客服、心理健康监测等领域发挥重要作用。
📄 摘要(原文)
We present a multimodal framework for Ambivalence/Hesitancy (A/H) recognition in video, developed for the ABAW11 challenge at ECCV 2026. The proposed approach fuses textual, acoustic, and visual modalities extracted from the BAH dataset using three pretrained encoders: F2LLM-v2-0.6B for transcripts (1024-d), WavLM-Large for audio (1024-d), and VideoMAE V2 for facial video (768-d). We first establish comprehensive unimodal baselines using classical classifiers (MLP, Random Forest, GBDT), each optimized via Optuna, and obtain a best unimodal Macro F1 of \textbf{0.6659} on the test set using text features alone -- substantially outperforming the zero-shot Video-LLaVA baseline (Macro F1: 0.2827). Building on these baselines, we propose a multimodal fusion architecture that combines bidirectional cross-attention across all three modalities with a Gated Multimodal Unit (GMU), with both architectural and optimization hyperparameters selected through a 50-trial Optuna search. This model achieves a Macro F1 of \textbf{0.7394} on the validation set, a relative improvement of 11.0\% over the best unimodal baseline, confirming that explicit cross-modal interaction captures complementary cues that no single modality provides in isolation. Final predictions on the official, unlabeled private test set are generated using this model and submitted according to the challenge protocol. Code is publicly available atthis https URL