Audio-Text Cross-Attention with Psycholinguistic Support Features for Ambivalence/Hesitancy Recognition
作者: Luiz F. B. F. Martins, Rodrigo W. Pisaia, Matheus M. Girardi, Isabella Berkembrock, João A. Almeida, André G. Hochuli, Rayson Laroca, Alceu S. Britto
分类: cs.CV
发布日期: 2026-07-15
🔗 代码/项目: GITHUB
💡 一句话要点
提出音频-文本跨注意力模型以识别矛盾与犹豫情感
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 音频-文本融合 情感识别 跨注意力机制 心理语言学特征 多模态学习
📋 核心要点
- 现有方法在处理视频中的情感识别时,通常依赖视觉信息,导致在缺乏视觉数据时表现不佳。
- 本文提出了一种将音频和文本信息结合的跨注意力机制,利用心理语言学特征增强模型对矛盾和犹豫情感的识别能力。
- 在实验中,模型在公共开发集上取得了0.875的平均精度和0.72的宏F1分数,显示出显著的性能提升。
📝 摘要(中文)
本文提出了一种音频-文本系统,旨在解决第11届ABAW竞赛中的矛盾/犹豫视频识别挑战。该方法不使用视觉帧,而是将每个视频表示为与转录时间戳对齐的重叠5秒窗口。每个窗口结合了320维的音频描述符、768维的情感导向RoBERTa嵌入和74个手工特征,捕捉不确定性、模糊和态度冲突。音频和文本通过时间跨注意力进行融合,支持特征在门控多实例学习池化之前注入,以调节窗口的重要性。五个独立初始化模型的预测结果进行了平均。在标记的公共开发集上,集成模型达到了0.875的平均精度和0.72的宏F1分数。源代码已公开发布。
🔬 方法详解
问题定义:本文旨在解决视频中矛盾与犹豫情感的识别问题。现有方法往往依赖视觉信息,导致在缺乏视觉数据时的识别效果不佳。
核心思路:论文提出了一种音频-文本融合的方法,通过跨注意力机制将音频和文本信息结合,同时引入心理语言学特征,以增强对情感的识别能力。
技术框架:整体架构包括音频描述符、文本嵌入和手工特征的提取,随后通过时间跨注意力进行融合,最后使用门控多实例学习池化来调节窗口的重要性。
关键创新:最重要的创新在于将心理语言学特征与音频和文本信息结合,形成了一种新的多模态融合方法,显著提升了对矛盾和犹豫情感的识别能力。
关键设计:模型使用320维的音频描述符和768维的RoBERTa嵌入,结合74个手工特征,采用门控机制来调节不同窗口的重要性,最终通过五个独立模型的预测结果进行平均以提高准确性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,所提出的集成模型在公共开发集上达到了0.875的平均精度和0.72的宏F1分数,表现优于现有的基线模型,展示了显著的性能提升,验证了多模态融合的有效性。
🎯 应用场景
该研究在情感分析、心理健康监测和人机交互等领域具有广泛的应用潜力。通过准确识别矛盾和犹豫情感,能够帮助改善用户体验和提供更个性化的服务,未来可能在社交媒体分析和心理咨询等方面发挥重要作用。
📄 摘要(原文)
We present an audio-text system for the Ambivalence/Hesitancy Video Recognition Challenge of the 11th ABAW Competition. The method excludes visual frames and represents each video as overlapping 5-second windows aligned with transcript timestamps. Each window combines a 320-dimensional prosodic audio descriptor, a 768-dimensional emotion-oriented RoBERTa embedding, and 74 handcrafted features capturing uncertainty, hedging, and attitudinal conflict. Audio and text are fused via temporal cross-attention, while support features are injected prior to gated multiple-instance learning (MIL) pooling to modulate the window's importance. Predictions from five independently initialized models are averaged. On the labeled public development set, the ensemble achieved an average precision of 0.875 and a macro-F1 of 0.72. Our source code is publicly available at https://github.com/Liga-de-IA-PUCPR/abaw-11-ah-challenge/.