Multimodal Variational Auto-encoder based Audio-Visual Segmentation
作者: Yuxin Mao, Jing Zhang, Mochu Xiang, Yiran Zhong, Yuchao Dai
分类: cs.CV, cs.SD, eess.AS
发布日期: 2023-10-12
备注: Accepted by ICCV2023,Project page(https://npucvr.github.io/MMVAE-AVS),Code(https://github.com/OpenNLPLab/MMVAE-AVS)
💡 一句话要点
提出显式条件多模态变分自编码器解决音视频分割问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 音视频分割 多模态学习 变分自编码器 表示学习 互信息最大化 深度学习 计算机视觉
📋 核心要点
- 现有的音视频分割方法主要依赖隐式特征融合,导致在有限数据集上的性能不佳。
- 论文提出的ECMVAE通过显式建模音频和视觉模态的贡献,提升了音视频分割的效果。
- 在AVSBench上的实验结果显示,ECMVAE在MS3子集上实现了3.84 mIOU的显著提升,成为新的最优方法。
📝 摘要(中文)
我们提出了一种显式条件多模态变分自编码器(ECMVAE),用于音视频分割(AVS),旨在对视频序列中的声音源进行分割。现有的AVS方法主要集中在隐式特征融合策略上,模型训练通常依赖于数据集中的离散样本,导致在有限且多样性不足的数据集上性能不佳。相对而言,我们从有效的表示学习角度出发,明确建模每种模态的贡献。具体而言,我们发现音频包含声音产生者的关键类别信息,而视觉数据提供了候选声音产生者的信息。它们的共享信息对应于视觉数据中显示的目标声音产生者。在这种情况下,跨模态共享表示学习对于AVS尤为重要。为此,我们的ECMVAE将每种模态的表示分解为模态共享表示和模态特定表示,并在共享和特定表示之间施加正交约束,以保持因子化潜在编码的独占属性。此外,引入互信息最大化正则化器,以实现对每种模态的广泛探索。对AVSBench的定量和定性评估证明了我们方法的有效性,在多个声音源分割的挑战性MS3子集上实现了3.84 mIOU的性能跃升,成为AVS的新最优状态。
🔬 方法详解
问题定义:本论文旨在解决音视频分割(AVS)中现有方法在有限和多样性不足的数据集上性能不佳的问题。现有方法主要依赖隐式特征融合,未能有效利用音频和视觉模态的互补信息。
核心思路:论文提出的显式条件多模态变分自编码器(ECMVAE)通过明确建模音频和视觉模态的贡献,利用音频中的类别信息和视觉中的候选声音产生者信息,增强了跨模态共享表示学习。
技术框架:ECMVAE的整体架构包括模态共享表示和模态特定表示的因子化,正交约束用于保持表示的独占性,并引入互信息最大化正则化器以促进模态的广泛探索。
关键创新:最重要的创新点在于显式建模音频和视觉模态的贡献,采用正交约束和互信息最大化正则化器,使得模型能够更好地捕捉模态间的共享信息,显著提升了AVS的性能。
关键设计:在模型设计中,采用了正交约束来确保共享和特定表示的独占性,损失函数中引入了互信息最大化正则化器,以促进对每种模态的全面探索,确保了模型的有效性和鲁棒性。
🖼️ 关键图片
📊 实验亮点
在AVSBench的实验中,ECMVAE在多个声音源分割的MS3子集上实现了3.84 mIOU的性能提升,显著超越了现有基线,标志着在音视频分割领域的最新进展。
🎯 应用场景
该研究在音视频分割领域具有广泛的应用潜力,尤其是在多媒体内容分析、智能监控和人机交互等场景中。通过更准确的声音源分割,能够提升视频理解和处理的智能化水平,推动相关技术的发展与应用。
📄 摘要(原文)
We propose an Explicit Conditional Multimodal Variational Auto-Encoder (ECMVAE) for audio-visual segmentation (AVS), aiming to segment sound sources in the video sequence. Existing AVS methods focus on implicit feature fusion strategies, where models are trained to fit the discrete samples in the dataset. With a limited and less diverse dataset, the resulting performance is usually unsatisfactory. In contrast, we address this problem from an effective representation learning perspective, aiming to model the contribution of each modality explicitly. Specifically, we find that audio contains critical category information of the sound producers, and visual data provides candidate sound producer(s). Their shared information corresponds to the target sound producer(s) shown in the visual data. In this case, cross-modal shared representation learning is especially important for AVS. To achieve this, our ECMVAE factorizes the representations of each modality with a modality-shared representation and a modality-specific representation. An orthogonality constraint is applied between the shared and specific representations to maintain the exclusive attribute of the factorized latent code. Further, a mutual information maximization regularizer is introduced to achieve extensive exploration of each modality. Quantitative and qualitative evaluations on the AVSBench demonstrate the effectiveness of our approach, leading to a new state-of-the-art for AVS, with a 3.84 mIOU performance leap on the challenging MS3 subset for multiple sound source segmentation.