EgoPolice: A Benchmark for Egocentric Video Understanding in High-Stakes Police Body-Worn Camera Footage
作者: Max Gonzalez Saez-Diez, Jihoon Chung, Adam D. Wolsky, Gregory Lanzalotto, Dean Knox, Jonathan Mummolo, Brandon M. Stewart, Olga Russakovsky
分类: cs.CV
发布日期: 2026-07-07
💡 一句话要点
提出EgoPolice以解决警用身体摄像头视频理解问题
🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction)
关键词: 警用视频理解 自我视角 数据集构建 高风险行为识别 深度学习模型
📋 核心要点
- 现有的警用身体摄像头视频理解方法在处理快速运动和复杂人际互动时表现不足,难以准确识别高风险行为。
- EgoPolice数据集通过逐秒标注警民互动视频,提供了分类和多选问答任务,旨在提升模型在高风险事件识别中的表现。
- 实验结果表明,尽管使用了先进的视频模型,仍然难以准确预测高风险行为,显示出该领域的研究潜力和挑战。
📝 摘要(中文)
我们介绍了EgoPolice,这是一个精心策划的数据集,包含真实的以自我视角记录的警民互动,来源于公开的身体摄像头视频。我们选择了对警务行为研究至关重要的警民行为标签,并以逐秒的粒度进行标注。视频中包含快速且不规则的摄像头运动、密集的人际互动以及罕见的高风险事件,使得该数据集成为一个挑战性的基准,适用于运动鲁棒性和上下文感知的自我视角感知。我们提供了分类和多选问答两种任务,并对开源和闭源模型进行了基准测试。即使是最好的视频模型如Gemini 2.5 Pro,在准确预测“武器出示”等高风险行为时仍然面临困难。EgoPolice不仅作为基准,还为开发能够识别大规模身体摄像头视频库中感兴趣事件的模型奠定了基础,从而提高后续人工审核的效率。
🔬 方法详解
问题定义:本论文旨在解决警用身体摄像头视频理解中的高风险行为识别问题。现有方法在快速运动和复杂场景下的表现不足,导致高风险事件的识别率低。
核心思路:论文提出EgoPolice数据集,通过精细的逐秒标注和多样化的任务设计,帮助模型更好地理解和识别警民互动中的关键行为。这样的设计旨在提高模型在复杂场景中的鲁棒性和准确性。
技术框架:整体架构包括数据集构建、标注、模型训练和评估四个主要阶段。数据集中的视频经过精细标注,模型在此基础上进行训练,并通过分类和问答任务进行评估。
关键创新:EgoPolice数据集的最大创新在于其高质量的标注和多样化的任务设计,使得模型能够在复杂的警民互动场景中进行有效学习。这与现有方法的单一任务或低质量标注形成鲜明对比。
关键设计:在模型训练中,采用了针对高风险行为的特定损失函数和网络结构,以提高模型对快速和复杂场景的适应能力。具体参数设置和网络架构细节在论文中进行了详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果显示,尽管使用了先进的视频模型Gemini 2.5 Pro,仍然在高风险行为识别上表现不佳,特别是在“武器出示”这一行为的预测上,准确率未达到预期。这表明EgoPolice数据集在推动该领域研究中的重要性和必要性。
🎯 应用场景
EgoPolice数据集的潜在应用场景包括警务行为分析、公共安全监控和法律证据审核等领域。通过提高模型对高风险行为的识别能力,可以有效支持警务决策和人力资源分配,提升公共安全管理的效率和准确性。未来,该研究可能推动更多基于视频分析的智能监控系统的发展。
📄 摘要(原文)
We introduce EgoPolice, a carefully curated dataset of real, egocentric police-civilian interactions, sourced from publicly available body-worn camera videos. We select police-civilian action labels that are critical for police behavioral research and annotate them at a second-by-second granularity. The videos feature rapid and irregular camera motion, dense human interactions, and rare high-stakes events, making the dataset a challenging benchmark for motion-robust and context-aware egocentric perception. We provide two different tasks, classification and multiple-choice question-answering, and benchmark both open-source and closed-source models. We find that even the best video models like Gemini 2.5 Pro still struggle to accurately predict high-risk actions such as "Weapon Out". Beyond serving as a benchmark, EgoPolice provides a foundation for developing models capable of identifying events of interest in large-scale body-worn camera video repositories, enabling more efficient downstream human review.