Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors

📄 arXiv: 2607.15689 📥 PDF

作者: Yilin Wang, Xiangxi Zheng, Dongxing Mao, Linjie Li, Zhengyuan Yang, Ping Yu, Rui Yan, Yuan Yao, Alex Jinpeng Wang

分类: cs.CV

发布日期: 2026-07-20


💡 一句话要点

提出DAFS以解决长视频理解中的帧选择问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长视频理解 多模态大语言模型 帧选择 动态规划 跨模态注意力 训练自由 视频分析

📋 核心要点

  1. 现有方法在长视频理解中面临帧选择的挑战,通常需要先理解视频内容才能选择合适的帧。
  2. 本文提出DAFS,通过利用MLLM中的跨模态注意力机制,直接从选定层提取帧相关性,而无需自回归生成。
  3. 在实验中,DAFS在32帧预算下相较于均匀采样提升了6.4分,并在多个任务中表现出色,具有良好的泛化能力。

📝 摘要(中文)

理解长视频需要从数千个候选帧中选择一个紧凑的帧集,但识别合适的帧通常需要先理解视频。本文提出了一种新方法,利用多模态大语言模型(MLLM)中的跨模态注意力机制,构建了DAFS(动态注意力预算感知帧选择器),该选择器无需训练即可提取帧级证据。通过将选择层的注意力转换为相关性分数,DAFS能够在不进行自回归解码的情况下实现帧间比较。实验表明,在32帧预算下,该选择器在Video-MME上比均匀采样提高了6.4分,并在匹配帧预算下超越了以往的训练基础选择器,且无需重新训练即可在不同任务和骨干网络间泛化。

🔬 方法详解

问题定义:本文旨在解决长视频理解中的帧选择问题,现有方法通常依赖于复杂的自回归生成过程,导致效率低下和准确性不足。

核心思路:通过利用多模态大语言模型中的跨模态注意力机制,DAFS能够在验证选择的提取层中直接获取与查询相关的帧证据,从而避免了对视频的全面理解。

技术框架:DAFS的整体架构包括两个主要模块:首先是轻量级的MLLM选择器,通过查询条件聚合将选择层的注意力转换为相关性分数;其次是动态规划算法,用于解决候选池大小和每帧令牌预算的联合分配问题。

关键创新:DAFS的创新之处在于其训练自由的特性,能够在不依赖于传统训练方法的情况下,实现高效的帧选择。这一方法与现有的训练基础选择器相比,显著提高了效率和准确性。

关键设计:选择器的设计中,采用了仅有2B参数的轻量级MLLM,并通过动态规划解决了帧预算的优化问题,确保在不同任务和骨干网络中具有良好的泛化能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,DAFS在32帧预算下相较于均匀采样提高了6.4分,并在匹配帧预算下超越了以往的训练基础选择器,展示了其在不同任务和骨干网络间的良好泛化能力,具有显著的性能提升。

🎯 应用场景

该研究在长视频理解、视频摘要生成和多模态信息检索等领域具有广泛的应用潜力。通过高效的帧选择,DAFS能够显著提升视频分析的速度和准确性,推动相关技术的实际应用和发展。未来,该方法可能在实时视频处理和智能监控等场景中发挥重要作用。

📄 摘要(原文)

Understanding long videos with multimodal large language models (MLLMs) requires selecting a compact set of frames from thousands of candidates, yet identifying the right frames seemingly requires understanding the video first. We resolve this circular dependency with a simple observation: cross-modal attention at validation-selected extraction layers in MLLMs already provides query-relevant frame evidence without requiring autoregressive generation. We exploit this property to build DAFS (Dynamic Attention-based Budget-aware Frame Selection), a training-free frame selector. A lightweight MLLM selector, even with only 2B parameters, can extract frame-level evidence by converting selected-layer attention into relevance scores through query-conditioned aggregation. This enables cross-frame comparison without autoregressive decoding. To handle the selector's own context constraint, we formulate the joint allocation of candidate pool size and per-frame token budget as a discrete optimization problem solved by dynamic programming. Under a 32-frame budget, our selector improves over uniform sampling by up to 6.4 points on Video-MME and outperforms prior training-based selectors under matched frame budgets, while generalizing across selector and answerer backbones, and across tasks, without retraining.