CF-Net: Conflict Fusion with Speaker Normalisation and Certainty Weighting for Ambivalence/Hesitancy Recognition
作者: Tung Hung Bui, Hong Hai Nguyen, Van Thong Huynh
分类: cs.CV
发布日期: 2026-07-15
备注: 6 pages, 3 figues, 3 tables, 26 references
💡 一句话要点
提出CF-Net以解决视频中的模棱两可和犹豫识别问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 模棱两可识别 犹豫检测 多模态融合 深度学习 特征归一化 冲突融合 情感分析
📋 核心要点
- 现有方法在非约束视频中识别模棱两可和犹豫信号面临挑战,主要由于信号的模糊性和跨模态的不一致性。
- CF-Net通过多模态网络架构,结合视觉、音频和文本流,采用特征归一化和冲突融合模块来解决这一问题。
- CF-Net在BAH数据集上表现优异,验证集宏F1分数为0.7155,私有测试集达到0.7364,显示出显著的性能提升。
📝 摘要(中文)
在非约束视频中检测模棱两可和犹豫(AH)信号具有挑战性,因为目标信号本质上模糊,并通过细微的跨模态不一致性而非典型情感表达。本文提出CF-Net,一个深度多模态网络,旨在通过编码视觉、音频和文本流来识别AH。CF-Net使用冻结的SigLIP2、HuBERT和DistilBERT作为基础网络,针对每个说话者进行特征归一化,以减少身份泄漏,并通过ConflictFusion模块显式计算成对的跨模态不一致性。训练过程中结合了确定性加权焦点损失、流形混合和模态丢弃,辅助的确定性回归头利用模糊注释来稳定对真正边界样本的学习。CF-Net在BAH验证集上取得了0.7155的宏F1分数,在私有挑战测试集上达到了0.7364(AP = 0.7492)。
🔬 方法详解
问题定义:本文旨在解决在非约束视频中识别模棱两可和犹豫(AH)信号的问题。现有方法往往无法有效处理信号的模糊性和跨模态的不一致性,导致识别效果不佳。
核心思路:CF-Net的核心思路是通过深度多模态网络架构,结合视觉、音频和文本流,利用特征归一化和冲突融合模块来显式计算跨模态的不一致性,从而提高AH信号的识别准确性。
技术框架:CF-Net的整体架构包括三个主要模块:视觉流(使用SigLIP2)、音频流(使用HuBERT)和文本流(使用DistilBERT)。这些流经过归一化处理后,通过ConflictFusion模块进行融合,最终输出AH识别结果。
关键创新:CF-Net的主要创新在于引入了ConflictFusion模块,该模块能够显式计算跨模态的不一致性,进而提高了对模棱两可和犹豫信号的识别能力。这一设计与传统方法的融合方式有本质区别。
关键设计:在训练过程中,CF-Net采用了确定性加权焦点损失、流形混合和模态丢弃等技术,此外,辅助的确定性回归头利用模糊注释来稳定学习,特别是在处理真正边界样本时。
🖼️ 关键图片
📊 实验亮点
CF-Net在BAH验证集上取得了0.7155的宏F1分数,在私有挑战测试集上达到了0.7364(AP = 0.7492),显示出显著的性能提升。这些结果表明CF-Net在模棱两可和犹豫识别任务中的有效性,优于现有基线方法。
🎯 应用场景
该研究的潜在应用领域包括情感分析、心理健康监测以及人机交互等。通过提高模棱两可和犹豫信号的识别能力,CF-Net可以帮助开发更智能的情感识别系统,进而提升用户体验和交互质量。未来,该技术可能在社交媒体分析和视频内容理解等领域发挥重要作用。
📄 摘要(原文)
Detecting ambivalence and hesitancy (AH) in unconstrained video is challenging because the target signal is inherently ambiguous and expressed through subtle cross-modal incongruence rather than prototypical affect. We present CF-Net, a deep multimodal network submitted to the 3rd Edition of the AH Video Recognition Challenge (ABAW 11th, ECCV 2026), targeting the BAH dataset. CF-Net encodes visual, audio, and transcript streams with frozen SigLIP2, HuBERT, and DistilBERT backbones, normalises backbone features per speaker to reduce identity leakage, and fuses them via a ConflictFusion module that explicitly computes pairwise cross-modal incongruence. Training combines certainty-weighted focal loss, manifold mixup, and modality dropout; an auxiliary certainty-regression head leverages ambiguity annotations to stabilise learning on genuinely borderline samples. CF-Net achieves a Macro F1 of 0.7155 on the BAH validation set and 0.7364 (AP = 0.7492) on the private challenge test set.