HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition
作者: Aleksei Bakin, Andrey V. Savchenko
分类: cs.CV, cs.AI
发布日期: 2026-07-14
备注: to be submitted to ABAW-11 workshop of ECCV 2026
💡 一句话要点
提出多任务学习方法以解决情感视频识别问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多任务学习 情感识别 模糊情感 轻量级模型 多模态融合 视频分析 系统后处理
📋 核心要点
- 现有方法在情感视频识别中面临多任务学习和模糊情感识别的挑战,尤其是在处理复杂的情感状态时。
- 论文提出了一种基于轻量级特征提取器的多任务学习框架,结合系统的后处理技术以提高情感识别的准确性。
- 实验结果显示,模型在多个任务上均实现了性能提升,特别是在BAH数据集上,视频级Macro F1分数达到0.73,显著优于基线。
📝 摘要(中文)
本文展示了我们在第11届情感行为分析挑战赛中的成果。我们在s-Aff-Wild2数据集上进行多任务学习,同时预测情感的价值、唤醒度、面部表情和动作单元,采用了轻量级的面部特征提取器MT-EmotiDDAMFN和MT-EmotiEffNet-B0,并结合系统的后处理方法。在官方验证集上,我们的集成模型显著超越了ConvNeXt基线。在扩展的BAH数据集上进行的模糊/犹豫视频识别中,我们通过面部、HuBERT音频和RoBERTa文本分类器的晚期融合,提升了视频级的Macro F1分数。实验结果表明,系统的预测校准和轻量级多模态融合能够与更重的端到端方法竞争,同时提供更高的效率和灵活性。
🔬 方法详解
问题定义:本文旨在解决在情感视频识别中多任务学习的挑战,尤其是如何有效识别复杂的情感状态如模糊和犹豫。现有方法往往依赖于重型模型,缺乏灵活性和效率。
核心思路:论文的核心思路是利用轻量级的面部特征提取器进行多任务学习,同时结合系统的后处理技术,以提高情感识别的准确性和效率。通过这种设计,模型能够在不依赖重型骨干网络的情况下,仍然实现竞争力的性能。
技术框架:整体架构包括多个模块:首先是轻量级面部特征提取器MT-EmotiDDAMFN和MT-EmotiEffNet-B0,随后是针对每个任务的独立头部,最后通过时间高斯平滑、表达偏差调整、AffectNet融合等后处理技术进行优化。
关键创新:最重要的技术创新在于采用了轻量级的特征提取器和系统的后处理方法,使得模型在多个任务上均能实现高效的性能,而无需对重型骨干进行微调。
关键设计:在模型设计中,采用了时间聚合、全局文本门控等技术细节,确保了多模态数据的有效融合。同时,针对每个动作单元的阈值调优和加权骨干融合也被纳入设计中,以提升整体性能。
🖼️ 关键图片
📊 实验亮点
实验结果显示,模型在BAH数据集上的视频级Macro F1分数达到0.73,较之前的0.74提升至0.79,且在多个任务上均显著超越了ConvNeXt基线。这表明轻量级模型在情感识别任务中具备强大的竞争力。
🎯 应用场景
该研究的潜在应用领域包括情感分析、心理健康监测和人机交互等。通过提高情感识别的准确性和效率,该方法能够在实时监控和反馈系统中发挥重要作用,促进情感计算的发展。未来,该技术可能会在社交媒体分析、虚拟助手和智能监控等领域得到广泛应用。
📄 摘要(原文)
This article presents our results for the 11th Affective Behavior Analysis in-the-Wild (ABAW) competition. For multi-task learning with simultaneous prediction of valence, arousal, facial expressions, and action units on s-Aff-Wild2 dataset, we use frozen lightweight facial extractors, MT-EmotiDDAMFN and MT-EmotiEffNet-B0, with separate heads and systematic post-processing: temporal Gaussian smoothing, per-class expression bias, AffectNet blending, per-AU threshold tuning, and weighted backbone fusion. On the official validation set, our ensemble significantly exceeds the performance of the ConvNeXt baseline. For ambivalence/hesitancy video recognition on the expanded BAH dataset, we extend the audiovisual pipeline to video-level Macro F1 by late fusion of face, HuBERT audio, and RoBERTa text classifiers, temporal aggregation, and a global-text gate. Frame-level Weighted F1 on validation set rises from 0.74 in ABAW-8 to 0.79, while the best public-test video-level Macro F1 reaches 0.73. In both tasks, competitive performance is achieved without fine-tuning heavy backbones. These results indicate that systematic prediction calibration and lightweight multimodal fusion can rival substantially heavier end-to-end approaches while offering improved efficiency and deployment flexibility.