ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation
作者: Yuanjia Li, Tianyang Xu, Tao Zhou, Zhangyong Tang, Xiao-Jun Wu, Josef Kittler
分类: cs.CV
发布日期: 2026-07-27
💡 一句话要点
提出ReflexTrack以解决训练无关的引用视频目标分割问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 引用视频目标分割 训练无关 反馈机制 掩膜引导 多模态融合
📋 核心要点
- 现有的引用视频目标分割方法在空间定位和时间预测的可靠性上存在不足,导致分割结果不稳定。
- ReflexTrack通过引入反馈机制,结合掩膜引导的空间细化和视频级掩膜反射,提升了分割的准确性和可靠性。
- 实验结果显示,ReflexTrack在Ref-VPS和ReasonVOS数据集上分别取得了69.7和67.2的高分,显著提升了训练无关RVOS的性能。
📝 摘要(中文)
引用视频目标分割(RVOS)需要在视频中根据自然语言指定的目标进行分割。现有的代理方法结合了多模态大型语言模型与可提示分割模型,能够在没有任务特定训练的情况下执行RVOS。然而,大多数流程依赖于一次性空间定位和后续的掩膜传播,导致初始提示和时间预测的可靠性未得到验证。本文提出了ReflexTrack,这是一种训练无关的反馈驱动代理,旨在在空间和时间层面上闭合这一环路。通过掩膜引导的空间细化和视频级掩膜反射,ReflexTrack显著提高了训练无关RVOS的可靠性,最终在Ref-VPS上获得了69.7的整体$ ext{Q}$分数,在ReasonVOS上获得了67.2的$ ext{J} ext{&} ext{F}$分数。
🔬 方法详解
问题定义:本文旨在解决引用视频目标分割(RVOS)中存在的训练无关方法的可靠性问题。现有方法通常依赖一次性空间定位和掩膜传播,导致初始提示和时间预测的准确性未得到验证。
核心思路:ReflexTrack通过反馈驱动的机制,结合掩膜引导的空间细化和视频级掩膜反射,旨在在空间和时间层面上增强分割的可靠性。该设计允许在不进行额外训练的情况下,动态更新和验证分割结果。
技术框架:ReflexTrack的整体架构包括两个主要模块:掩膜引导的空间细化和视频级掩膜反射。前者通过评估当前关键帧提示引导的掩膜,迭代更新边界框;后者则评估完整的掩膜序列,识别不可靠的时间区间并生成候选预测。
关键创新:ReflexTrack的核心创新在于其反馈驱动机制,能够在空间和时间上动态调整分割结果。这与传统方法的静态掩膜传播机制形成鲜明对比,显著提高了分割的可靠性。
关键设计:在设计中,ReflexTrack保持所有组件在推理阶段的冻结状态,确保了模型的稳定性和高效性。掩膜引导的空间细化和视频级掩膜反射的结合,使得模型能够在不依赖训练的情况下,进行有效的分割更新。
🖼️ 关键图片
📊 实验亮点
ReflexTrack在Ref-VPS数据集上取得了69.7的$ ext{Q}$分数,在ReasonVOS上获得了67.2的$ ext{J} ext{&} ext{F}$分数,显著优于现有基线,展示了反馈机制在提升训练无关RVOS可靠性方面的有效性。
🎯 应用场景
ReflexTrack在视频分析、自动驾驶、监控系统等多个领域具有广泛的应用潜力。其训练无关的特性使得该方法能够快速适应不同场景,提升目标分割的准确性和可靠性,具有重要的实际价值和未来影响。
📄 摘要(原文)
Referring video object segmentation (RVOS) requires segmenting a target specified by natural language throughout a video. Recent agentic approaches combine multimodal large language models with promptable segmentation models to perform RVOS without task-specific training. However, most pipelines rely on one-shot spatial grounding followed by mask propagation, leaving both the initial prompts and temporal predictions largely unverified. We introduce ReflexTrack, a training-free, feedback-driven agent that closes this loop at both spatial and temporal levels. Mask-guided Spatial Refinement evaluates the mask induced by the current keyframe prompt and iteratively updates the bounding box together with positive and negative points, yielding a more reliable initialization. Video-level Mask Reflection assesses the complete mask sequence, localizes unreliable intervals, selects complementary repair keyframes, and generates candidate predictions through mask-guided re-propagation. Only candidates that provide a verified improvement are used to update the affected intervals, preserving reliable predictions elsewhere. All components remain frozen during inference. ReflexTrack achieves an overall $\mathcal{Q}$ score of $69.7$ on Ref-VPS and a $\mathcal{J}\&\mathcal{F}$ score of $67.2$ on ReasonVOS. These results demonstrate that prediction-level feedback substantially improves the reliability of training-free RVOS.