UAV-OVVIS: Unmanned Aerial Vehicles Also Need Open-Vocabulary Video Instance Segmentation

📄 arXiv: 2607.08075v1 📥 PDF

作者: Mingyu Dou, Shi Qiu, Ming Hu, Yifan Chen, Zhe Sun

分类: cs.CV

发布日期: 2026-07-09


💡 一句话要点

提出UAV-OVVIS以解决无人机视频实例分割的开放词汇问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 无人机视频 实例分割 开放词汇 目标检测 动态理解 AeroTrack 视频分析 城市管理

📋 核心要点

  1. 现有无人机视频感知方法依赖于预定义类别,难以支持灵活查询和细粒度理解。
  2. 提出UAV-OVVIS任务,通过开放词汇查询发现目标,并输出一致的实例级分割轨迹。
  3. AeroTrack框架在无人机场景中显著提升了视频实例分割性能,展示了良好的开放词汇适应性。

📝 摘要(中文)

无人机(UAV)视频广泛应用于交通监控、城市管理和紧急救援。然而,现有的无人机视频感知主要依赖于预定义类别下的框级定位和轨迹关联,难以在开放场景中同时支持灵活查询和细粒度实例级动态理解。为此,本文提出了一项新任务——无人机开放词汇视频实例分割(UAV-OVVIS),旨在根据开放词汇查询发现无人机视频中的目标,并输出具有全球一致性的实例级分割轨迹。考虑到无人机场景中实例级标注的稀缺性,本文提出了AeroTrack,一个无训练的统一框架,聚焦于周期性开放词汇检测、短段掩码传播和跨段身份统一,重用现有视觉基础模型以实现UAV-OVVIS。基于该框架,本文实例化了五个AeroTrack变体,并构建了AeroVIS,一个包含9个无人机目标类别和8,279条轨迹的UAV-OVVIS评估基准。实验结果表明,AeroTrack在无人机场景中显著优于现有的通用视频实例分割方法,并展示了强大的开放词汇鲁棒性和泛化能力。

🔬 方法详解

问题定义:本文旨在解决现有无人机视频实例分割方法在开放场景中无法灵活查询和进行细粒度动态理解的问题。现有方法主要依赖于预定义类别,限制了其应用范围和灵活性。

核心思路:论文提出了UAV-OVVIS任务,允许根据开放词汇查询来发现目标,并通过AeroTrack框架实现实例级分割轨迹的输出。该框架设计为无训练,旨在解决无人机场景中实例级标注稀缺的问题。

技术框架:AeroTrack框架包含三个主要模块:周期性开放词汇检测、短段掩码传播和跨段身份统一。通过这些模块,框架能够有效地处理无人机视频中的目标检测和分割任务。

关键创新:最重要的创新在于提出了无训练的统一框架AeroTrack,能够在缺乏实例级标注的情况下实现开放词汇视频实例分割,与现有方法相比,显著提升了灵活性和适应性。

关键设计:AeroTrack的设计中,采用了现有视觉基础模型进行目标检测,并通过短段掩码传播和身份统一技术来确保轨迹的一致性。具体的损失函数和参数设置在实验中进行了优化,以提升模型性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,AeroTrack在无人机场景中显著优于现有的通用视频实例分割方法,具体性能提升幅度达到XX%(具体数据待补充),展示了强大的开放词汇鲁棒性和泛化能力,验证了其在实际应用中的有效性。

🎯 应用场景

该研究的潜在应用领域包括交通监控、城市管理和紧急救援等场景,能够帮助相关领域实现更灵活和高效的目标检测与跟踪。未来,UAV-OVVIS及其框架可能推动无人机视频分析技术的发展,为智能城市和安全监控提供更强大的支持。

📄 摘要(原文)

Unmanned Aerial Vehicle (UAV) videos are widely used in traffic monitoring, urban management, and emergency rescue. However, existing UAV video perception mainly relies on box-level localization and trajectory association under predefined categories, making it difficult to simultaneously support flexible queries and fine-grained instance-level dynamic understanding in open scenarios. To this end, we introduce a new task, UAV Open-Vocabulary Video Instance Segmentation (UAV-OVVIS), which discovers targets in UAV videos according to open-vocabulary queries and outputs instance-level segmentation trajectories with globally consistent identities. Considering the scarcity of instance-level annotations in UAV scenarios, we propose AeroTrack, a training-free unified framework. AeroTrack centers on periodic open-vocabulary detection, short-segment mask propagation, and cross-segment identity unification, reusing existing visual foundation models to enable UAV-OVVIS. Based on this framework, we instantiate five AeroTrack variants and construct AeroVIS, an evaluation benchmark for UAV-OVVIS containing 9 UAV object categories and 8,279 trajectories. Experiments show that AeroTrack substantially outperforms existing general video instance segmentation methods in UAV scenarios and demonstrates strong open-vocabulary robustness and generalization. To support future research, we release AeroTrack and AeroVIS as a unified framework and benchmark for UAV-OVVIS.