Reinforcement Learning-based Mixture of Vision Transformers for Video Violence Recognition
作者: Hamid Mohammadi, Ehsan Nazerfard, Tahereh Firoozi
分类: cs.CV
发布日期: 2023-10-04
💡 一句话要点
提出基于强化学习的混合视觉变换器以解决视频暴力识别问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 视频暴力识别 视觉变换器 强化学习 专家混合 深度学习 计算效率 模型优化
📋 核心要点
- 现有的视频暴力识别方法主要依赖于CNN模型,面临准确性和计算成本的挑战。
- 本文提出了一种基于变换器的专家混合系统,通过强化学习优化路由器,实现高效的视频暴力识别。
- 实验结果显示,所提方法在RWF数据集上取得92.4%的准确率,显著优于传统CNN模型。
📝 摘要(中文)
基于深度学习的视频暴力识别关注于准确且可扩展的人类暴力识别。目前,大多数先进的视频暴力识别研究使用基于卷积神经网络(CNN)的模型来表示和分类视频。然而,最近的研究表明,预训练的变换器在各种视频分析基准上比CNN模型更准确。本文提出了一种新颖的基于变换器的专家混合(MoE)视频暴力识别系统。通过智能组合大型视觉变换器和高效的变换器架构,所提出的系统不仅利用了视觉变换器架构的优势,还降低了使用大型视觉变换器的成本。该架构通过基于强化学习的路由器最大化暴力识别系统的准确性,同时主动降低计算成本。实证结果表明,所提出的MoE架构在RWF数据集上以92.4%的准确率优于基于CNN的模型。
🔬 方法详解
问题定义:本文旨在解决视频暴力识别中现有基于CNN的方法在准确性和计算效率上的不足。传统方法在处理复杂视频内容时表现不佳,且计算成本高。
核心思路:论文提出的混合专家系统结合了大型视觉变换器和高效变换器架构,通过强化学习优化模型选择,从而提高识别准确率并降低计算开销。
技术框架:整体架构包括多个视觉变换器模块和一个强化学习路由器。路由器根据输入视频的特征动态选择最合适的变换器进行处理,确保资源的高效利用。
关键创新:最重要的创新在于引入了混合专家模型和强化学习路由器的结合,显著提升了视频暴力识别的准确性和效率,与传统CNN方法相比具有本质的优势。
关键设计:在模型设计中,采用了多层次的视觉变换器结构,并通过强化学习算法优化路由器的决策过程,确保在不同场景下的最佳性能。
🖼️ 关键图片
📊 实验亮点
实验结果表明,所提出的MoE架构在RWF数据集上达到了92.4%的准确率,明显优于传统的CNN模型,展示了该方法在视频暴力识别中的有效性和优势,提升幅度显著。
🎯 应用场景
该研究在视频监控、社交媒体内容审核和安全监测等领域具有广泛的应用潜力。通过提高暴力行为的自动识别能力,可以有效减少人工审核的工作量,提升安全防范措施的及时性和有效性,未来可能对公共安全和社会治理产生积极影响。
📄 摘要(原文)
Video violence recognition based on deep learning concerns accurate yet scalable human violence recognition. Currently, most state-of-the-art video violence recognition studies use CNN-based models to represent and categorize videos. However, recent studies suggest that pre-trained transformers are more accurate than CNN-based models on various video analysis benchmarks. Yet these models are not thoroughly evaluated for video violence recognition. This paper introduces a novel transformer-based Mixture of Experts (MoE) video violence recognition system. Through an intelligent combination of large vision transformers and efficient transformer architectures, the proposed system not only takes advantage of the vision transformer architecture but also reduces the cost of utilizing large vision transformers. The proposed architecture maximizes violence recognition system accuracy while actively reducing computational costs through a reinforcement learning-based router. The empirical results show the proposed MoE architecture's superiority over CNN-based models by achieving 92.4% accuracy on the RWF dataset.