STELLA: Continual Audio-Video Pre-training with Spatio-Temporal Localized Alignment
作者: Jaewoo Lee, Jaehong Yoon, Wonjae Kim, Yunji Kim, Sung Ju Hwang
分类: cs.CV, cs.LG
发布日期: 2023-10-12 (更新: 2024-05-28)
备注: ICML 2024
💡 一句话要点
提出STELLA以解决音视频持续学习中的时空关联问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 音视频理解 持续学习 多模态学习 时空关联 知识保留 补丁选择 音频推理
📋 核心要点
- 现有方法在持续学习音视频语义时面临稀疏的时空关联和多模态信息覆盖的问题,导致知识遗忘。
- 本文提出的解决方案包括局部补丁重要性评分和重放引导的关联评估,以增强音视频补丁的关联性和知识保留。
- 实验结果显示,STELLA在多个基准测试中相较于强基线提升了3.69%的性能,并显著降低了内存消耗。
📝 摘要(中文)
在不断变化的世界中,持续学习多种音视频语义对于音频相关推理任务至关重要。然而,这一过程面临两个主要挑战:音视频对之间的稀疏时空关联以及多模态关联的覆盖问题。为此,本文提出了一种新的持续音视频预训练方法,包含两个创新点:一是局部补丁重要性评分,通过多模态编码器评估每个补丁的重要性,强调语义相互关联的音视频补丁;二是重放引导的关联评估,旨在减少因漂移导致的音视频知识损失,通过评估当前补丁与过去步骤的关联性,识别与过去高度相关的补丁。实验结果表明,该方法在零-shot检索任务中相较于强基线实现了3.69%的相对性能提升,同时减少了约45%的内存消耗。
🔬 方法详解
问题定义:本文旨在解决音视频持续学习中的稀疏时空关联和多模态关联覆盖问题,现有方法往往导致知识遗忘和性能下降。
核心思路:提出局部补丁重要性评分和重放引导的关联评估,通过评估补丁的重要性和历史关联性来增强模型的学习能力,减少知识遗忘。
技术框架:整体架构包括多模态编码器用于补丁重要性评分,重放机制用于关联评估,最终通过概率补丁选择实现有效的持续学习。
关键创新:局部补丁重要性评分和重放引导的关联评估是本文的核心创新,与现有方法相比,更加注重补丁间的时空关联性和历史知识的保留。
关键设计:在模型设计中,采用了多模态编码器来计算补丁的重要性评分,并设计了重放机制来评估当前补丁与历史补丁的关联性,确保模型在学习新知识时不遗忘旧知识。
🖼️ 关键图片
📊 实验亮点
在多个基准测试中,STELLA在零-shot检索任务上相较于强基线实现了3.69%的相对性能提升,同时内存消耗减少约45%。这一结果表明,STELLA在持续学习音视频语义方面具有显著优势。
🎯 应用场景
该研究具有广泛的应用潜力,尤其在音视频理解、智能监控、自动视频摘要等领域。通过提高音视频数据的处理能力,STELLA能够为多模态学习任务提供更为稳健的解决方案,推动相关技术的进步与应用。未来,该方法可能在实时音视频分析和交互式智能系统中发挥重要作用。
📄 摘要(原文)
Continuously learning a variety of audio-video semantics over time is crucial for audio-related reasoning tasks in our ever-evolving world. However, this is a nontrivial problem and poses two critical challenges: sparse spatio-temporal correlation between audio-video pairs and multimodal correlation overwriting that forgets audio-video relations. To tackle this problem, we propose a new continual audio-video pre-training method with two novel ideas: (1) Localized Patch Importance Scoring: we introduce a multimodal encoder to determine the importance score for each patch, emphasizing semantically intertwined audio-video patches. (2) Replay-guided Correlation Assessment: to reduce the corruption of previously learned audiovisual knowledge due to drift, we propose to assess the correlation of the current patches on the past steps to identify the patches exhibiting high correlations with the past steps. Based on the results from the two ideas, we perform probabilistic patch selection for effective continual audio-video pre-training. Experimental validation on multiple benchmarks shows that our method achieves a 3.69%p of relative performance gain in zero-shot retrieval tasks compared to strong continual learning baselines, while reducing memory consumption by ~45%.