VideoSEMA: a scalable and efficient Mamba-like attention for video understanding
作者: Nhat Thanh Tran, Fanghui Xue andShuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin
分类: cs.CV, cs.AI
发布日期: 2026-07-16
备注: 15 pages, 3 figures
💡 一句话要点
提出VideoSEMA以解决视频理解中的计算效率问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 视频理解 时空注意力 计算效率 深度学习 模型优化
📋 核心要点
- 现有视频理解方法在计算效率和准确性上存在不足,尤其是在处理高分辨率视频时表现不佳。
- 论文提出的VideoSEMA模型通过分裂时空注意力机制,结合局部和全局信息,提升了视频理解的效率与准确性。
- 在K400和SSv2数据集上,VideoSEMA在准确率和计算效率上均优于现有的重型模型,表现出更好的扩展性。
📝 摘要(中文)
我们提出了一种用于视频理解(分类)的分裂时空注意力模型VideoSEMA,该模型由一种可扩展且高效的类似Mamba的注意力(SEMA)块和一种软最大时间注意力组成。在每帧中,SEMA注意力在局部窗口注意力与全局平均之间并行应用,形成了Mamba宏架构。我们证明了在某些秩条件下,计算上更便宜的分裂时空注意力等同于完整的时空注意力。在K400基准数据集上,VideoSEMA的性能优于更重的视觉变换器和Mamba模型。在SSv2基准数据集上,VideoSEMA在相似参数规模的模型中取得了最高的top-1准确率。随着图像分辨率从标准的$224^2$提升至$1024^2$,VideoSEMA在准确率上比VideoMamba的降级表现更为优越。未来有望将VideoSEMA扩展到更长的视频,采用扩张/稀疏时间注意力。
🔬 方法详解
问题定义:论文要解决的是视频理解中的计算效率和准确性问题,现有方法在处理高分辨率视频时面临性能瓶颈和计算开销大等痛点。
核心思路:论文的核心解决思路是提出VideoSEMA模型,通过分裂时空注意力机制,结合局部窗口注意力和全局平均,优化计算效率,同时保持高准确性。
技术框架:VideoSEMA模型由两个主要模块组成:空间上的SEMA注意力块和时间上的软最大注意力。SEMA注意力块在每帧中并行应用局部和全局信息,从而实现高效的信息处理。
关键创新:最重要的技术创新点在于提出了Mamba-like的注意力机制,使得分裂时空注意力在计算上更为高效,同时在特定条件下等同于完整的时空注意力,显著降低了计算复杂度。
关键设计:模型在参数设置上进行了优化,采用了适应性窗口大小和全局平均策略,损失函数设计上也考虑了多任务学习的需求,以提升模型的泛化能力。
🖼️ 关键图片
📊 实验亮点
在K400数据集上,VideoSEMA的性能超越了更重的视觉变换器和Mamba模型,且在SSv2数据集中取得了相似参数规模模型中的最高top-1准确率。随着图像分辨率的提升,VideoSEMA的准确率降级表现优于VideoMamba,显示出更好的扩展性。
🎯 应用场景
该研究的潜在应用领域包括视频监控、自动驾驶、智能家居等场景,能够有效提升视频分析的实时性和准确性。未来,VideoSEMA有望在长视频理解和多模态融合等领域发挥更大作用,推动相关技术的发展。
📄 摘要(原文)
We present for video understanding (classification) a split space-time attention model, VideoSEMA, consisting of a scalable and efficient Mamba-like attention (SEMA) block in space and a softmax temporal attention in time. In each frame, SEMA attention applies a local window attention in parallel with a global averaging in a Mamba macro-architecture, which is called Mamba-like. Under certain rank conditions, we prove that the computationally cheaper split space-time attention is equivalent to full space-time attention. On benchmark K400 data sets, VideoSEMA out-performs heavier vision transformer and Mamba models. On benchmark SSv2 data, VideoSEMA leads in top-1 accuracy among models of similar parameter sizes. As image resolution scales up from standard $224^2$ to $1024^2$ on K400 and without fine-tuning, VideoSEMA degrades much more gracefully than VideoMamba in accuracy. It is promising to extend VideoSEMA to longer videos with a dilated/sparse temporal attention.