AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning
作者: Benjamin Robson, Santeri Mentu, Wenshuai Zhao, Arno Solin
分类: cs.MM, cs.AI, cs.LG, cs.SD
发布日期: 2026-07-20
💡 一句话要点
提出AV-JEPA以解决音视频自监督学习的对齐问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 音视频自监督学习 多模态对齐 视觉变换器 模态丢弃 特征优化 SIGReg目标 零-shot检索
📋 核心要点
- 现有的音视频自监督学习方法在模态对齐和特征提取上存在不足,导致性能受限。
- AV-JEPA通过早期融合的视觉变换器和模态丢弃技术,优化了音视频特征的对齐过程。
- 实验结果显示,AV-JEPA在VGGSound和AudioSet上分别达到了57.1%和32.7 mAP的优异性能,且支持零-shot检索。
📝 摘要(中文)
我们提出了AV-JEPA,这是LeJEPA在音视频自监督学习中的优雅多模态扩展。该模型使用早期融合的视觉变换器和模态丢弃作为掩蔽,训练模型对齐全局和每种模态的局部视图的嵌入,同时SIGReg目标鼓励理论上的最优分布。这实现了潜在空间中的跨模态对齐,构建了一个没有解码器、EMA教师、复杂多项损失或对比负样本的干净架构。所提出的AV-JEPA骨干网络在VGGSound(57.1% top-1)和AudioSet(32.7 mAP)上提供了竞争力的分类性能,并支持开箱即用的零-shot音视频检索。
🔬 方法详解
问题定义:本论文旨在解决音视频自监督学习中模态对齐不足的问题。现有方法通常依赖复杂的解码器和多项损失,导致架构复杂且难以优化。
核心思路:AV-JEPA的核心思想是通过早期融合的视觉变换器和模态丢弃技术,简化模型结构,同时有效对齐不同模态的特征嵌入。这样的设计使得模型能够在潜在空间中实现跨模态对齐。
技术框架:AV-JEPA的整体架构包括一个早期融合的视觉变换器,利用模态丢弃作为掩蔽策略。模型通过SIGReg目标进行训练,以优化特征分布。
关键创新:AV-JEPA的主要创新在于去除了传统方法中的解码器和EMA教师,简化了模型架构,同时通过SIGReg目标实现了理论上的最优分布。
关键设计:在关键设计方面,AV-JEPA采用了模态丢弃策略以增强模型的鲁棒性,损失函数则通过SIGReg目标来优化特征对齐,确保了模型在不同模态间的有效学习。
🖼️ 关键图片
📊 实验亮点
AV-JEPA在VGGSound数据集上达到了57.1%的top-1分类准确率,在AudioSet上实现了32.7 mAP的性能,显示出其在音视频自监督学习中的竞争力。这些结果表明,AV-JEPA在简化模型架构的同时,仍能保持高效的性能表现。
🎯 应用场景
AV-JEPA在音视频检索、内容推荐和多模态理解等领域具有广泛的应用潜力。其高效的特征对齐能力可以提升多模态数据处理的准确性和效率,为未来的智能系统提供更强的支持。
📄 摘要(原文)
We present AV-JEPA, an elegant multimodal extension of LeJEPA to audio-visual self-supervised learning. Using an early-fusion Vision Transformer and modality dropout as masking, the model is trained to align the embeddings of global and per-modality local views, while the SIGReg objective encourages a theoretically optimal distribution. This achieves cross-modal alignment in the latent space, resulting in a remarkably clean architecture with no decoder, EMA teacher, complex multi-term losses, or contrastive negatives. The proposed AV-JEPA backbone delivers competitive classification performance on VGGSound (57.1% top-1) and AudioSet (32.7 mAP) and supports zero-shot audio-video retrieval out of the box.