Multimodal Emotion Recognition in Conversations via Class-Wise Adaptive Modality Fusion and Affective Geometry
作者: Oriol Marín, Roger Marí, Gloria Haro, Rafael Redondo
分类: cs.CV
发布日期: 2026-09-09
备注: Accepted at the 11th Workshop and Competition on Affective Behavior Analysis in-the-Wild (ABAW) at ECCV 2026
💡 一句话要点
提出多模态情感识别方法以解决对话中的情感动态问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态情感识别 自蒸馏变换器 几何视觉表示 类别自适应融合 情感动态
📋 核心要点
- 现有的情感识别方法在处理对话中的情感动态和上下文信息时存在不足,难以有效整合多种模态信息。
- 本文提出了一种扩展的自蒸馏变换器架构,通过结合几何视觉表示和类别自适应模态融合来提升情感识别性能。
- 实验结果表明,几何增强的视觉表示和类别自适应融合在多个数据集上显著提高了情感识别的准确性和F1分数。
📝 摘要(中文)
对话中的情感识别(ERC)需要整合异构的文本、音频和视觉线索,同时考虑对话上下文和情感动态。本文扩展了自蒸馏变换器架构,结合外观与几何视觉表示、类别自适应模态融合以及情感过渡的效价-唤醒先验。在MELD和IEMOCAP数据集上,几何增强的视觉表示分别比仅使用外观特征提高了0.27和4.36的加权F1分数,而类别自适应融合在原始softmax门控基础上进一步提升了0.17和0.25的分数。效价-唤醒先验在情感转变的发言中带来了0.30和0.74的准确率提升,同时保持了对稳定发言的性能。这些结果表明,结构化的面部线索、情感依赖的模态加权和情感几何为多模态ERC提供了互补的优势。
🔬 方法详解
问题定义:本文旨在解决对话中的情感识别问题,现有方法在整合文本、音频和视觉信息时,难以有效捕捉情感动态和上下文信息。
核心思路:论文提出通过扩展自蒸馏变换器架构,结合外观与几何视觉表示,以及类别自适应模态融合,来提升情感识别的准确性和鲁棒性。
技术框架:整体架构包括三个主要模块:1) 自蒸馏变换器用于特征提取;2) 几何视觉表示用于增强视觉信息;3) 类别自适应模态融合用于动态调整不同模态的权重。
关键创新:最重要的技术创新在于引入了几何视觉表示和类别自适应模态融合,这与传统的静态模态融合方法形成了鲜明对比,能够更好地适应情感变化。
关键设计:在参数设置上,采用了针对不同类别的模态加权策略,并设计了适应性损失函数以优化情感识别性能,同时保持了对稳定发言的良好表现。
🖼️ 关键图片
📊 实验亮点
实验结果显示,几何增强的视觉表示在MELD和IEMOCAP数据集上分别提高了0.27和4.36的加权F1分数,而类别自适应融合进一步提升了0.17和0.25的分数。此外,效价-唤醒先验在情感转变的发言中带来了0.30和0.74的准确率提升,显示出显著的性能改进。
🎯 应用场景
该研究的潜在应用领域包括智能客服、社交机器人和情感分析工具等,能够帮助机器更好地理解和响应人类情感,提升人机交互的自然性和有效性。未来,该方法也可扩展到其他多模态情感识别任务中,具有广泛的实际价值。
📄 摘要(原文)
Emotion Recognition in Conversations (ERC) requires integrating heterogeneous textual, audio, and visual cues while accounting for conversational context and emotional dynamics. We extend the Self-Distillation Transformer architecture for ERC with appearance+geometry visual representations, class-wise adaptive modality fusion, and a valence-arousal prior for affective transitions. On the MELD and IEMOCAP datasets, geometry-enhanced visual representations improve weighted F1 by 0.27 and 4.36 points over appearance-only features, respectively, while class-wise adaptive fusion provides further gains of 0.17 and 0.25 points over the original softmax gate. The valence-arousal prior yields targeted improvements of 0.30 and 0.74 accuracy points on emotionally shifted utterances while preserving performance on stable turns. These results indicate that structured facial cues, emotion-dependent modality weighting, and affective geometry provide complementary benefits for multimodal ERC.