Continual Video-MLLM Adaptation over Evolving Domains

📄 arXiv: 2607.18716v1 📥 PDF

作者: Rui Cheng, Meixing Shi, Yuxiang Cai, Jingcai Guo, Jianwei Yin, Zhi Chen

分类: cs.CV

发布日期: 2026-07-21

备注: Accepted to ACM MM 2026


💡 一句话要点

提出DAER框架以解决视频多模态大语言模型的持续适应问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视频理解 多模态学习 持续学习 领域适应 专家路由 灾难性遗忘 模型优化

📋 核心要点

  1. 现有的持续学习方法在处理视频多模态大语言模型时,容易导致跨领域干扰和灾难性遗忘。
  2. 本文提出分布感知专家路由(DAER),通过领域隔离的轻量级专家与冻结的主干网络实现领域特定适应。
  3. 实验结果表明,DAER在多个视频理解基准上表现优异,显著优于现有方法。

📝 摘要(中文)

视频多模态大语言模型在视频理解方面表现出色,但其在连续演变领域的适应性仍然未得到充分探索。现实中,视频数据通常来自异构领域,模型需要在不覆盖已学知识的情况下获取新的领域特定知识。现有的持续学习方法依赖共享适应空间,可能导致跨领域干扰和灾难性遗忘。为此,本文提出了一种参数高效的框架——分布感知专家路由(DAER),通过保持领域隔离的轻量级专家并冻结预训练的Video-MLLM主干,解耦领域特定适应与预训练模型的一般多模态知识。我们引入了基于MMD的领域内分布感知路由机制和领域间路由机制,以增强领域识别的鲁棒性。实验表明,DAER在多个基准数据集上优于现有方法。

🔬 方法详解

问题定义:本文旨在解决视频多模态大语言模型在连续演变领域中的适应性问题。现有方法通常依赖共享适应空间,导致跨领域干扰和灾难性遗忘,无法有效处理异构领域的持续学习需求。

核心思路:本文提出的DAER框架通过保持领域隔离的轻量级专家,同时冻结预训练的Video-MLLM主干,从而实现领域特定的适应,避免了对已有知识的覆盖。

技术框架:DAER的整体架构包括领域隔离的专家模块、基于MMD的领域内路由机制和领域间路由机制。输入数据通过这些模块进行处理,以实现精细化的领域适应。

关键创新:DAER的主要创新在于引入了领域内和领域间的路由机制,能够在缺乏任务身份的情况下进行有效的领域识别,显著提升了模型的适应能力。

关键设计:在设计上,DAER采用了自适应领域合并策略以提高参数可扩展性,并使用两阶段优化策略来稳定专家的专业化过程。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,DAER在十个VidQA数据集上进行评估,表现出色,显著优于现有方法,具体性能提升幅度达到XX%(具体数据需根据实验结果填写)。

🎯 应用场景

该研究的潜在应用领域包括智能监控、自动驾驶、视频内容分析等,能够帮助模型在不断变化的环境中保持高效的学习能力。未来,DAER框架有望推动视频理解技术的进一步发展,提升多模态学习的实用性和灵活性。

📄 摘要(原文)

Video multimodal large language models have shown strong capability in video understanding, yet their adaptation to sequentially evolving domains remains underexplored. In real-world deployments, video data often arrives continuously from heterogeneous domains, requiring the model to acquire new domain-specific knowledge without overwriting previously learned capabilities. Existing continual learning methods typically rely on shared adaptation spaces, which can induce severe cross-domain interference and catastrophic forgetting. We propose Distribution-Aware Expert Routing, a parameter-efficient framework for continual Video-MLLM adaptation over evolving domains. DAER maintains domain-isolated lightweight experts while keeping the pretrained Video-MLLM backbone frozen, thereby decoupling domain-specific adaptation from the general multimodal knowledge of the pretrained model. To enable fine-grained specialization, we introduce an intra-domain distribution-aware routing mechanism that matches each input to expert-level prototype reservoirs using MMD. To address the absence of task identities at inference time, we further propose an inter-domain routing mechanism that performs prototype matching in a discriminative subspace for robust domain identification. In addition, we introduce adaptive domain merging to improve parameter scalability and adopt a two-stage optimization strategy to stabilize expert specialization during continual learning. We evaluate DAER by curating a domain-incremental benchmark built from ten VidQA datasets covering diverse visual environments and reasoning demands. Experiments on two strong Video-MLLM backbones show that DAER consistently outperforms prior methods.