Efficient Tracking and Understanding Object Transformations

📄 arXiv: 2607.19743v1 📥 PDF

作者: Yihong Sun, Bharath Hariharan

分类: cs.CV

发布日期: 2026-07-22

🔗 代码/项目: GITHUB


💡 一句话要点

提出FluxGraph以解决对象变换跟踪的高计算成本问题

🎯 匹配领域: 支柱八:物理动画 (Physics-based Animation)

关键词: 对象跟踪 状态变换 时空划分 轻量级检测 实时应用

📋 核心要点

  1. 现有方法在对象变换跟踪中计算成本高,限制了实时应用的可能性。
  2. 论文提出FluxGraph,通过轻量级触发器检测变换,避免对所有实体的跟踪。
  3. 实验结果显示FluxGraph在多个数据集上实现了3.3倍的速度提升,同时保持了跟踪性能。

📝 摘要(中文)

通过状态变换跟踪对象对于理解现实世界的动态至关重要。然而,现有方法计算成本高,限制了实时部署的可能性。TubeletGraph展示了出色的能力,但其推理成本(约每个对象帧4.4秒)使其难以应用。我们观察到,TubeletGraph的开销源于对输入视频的时空划分:每帧都密集计算实体分割,且跟踪场景中的每个实体,导致成本随场景复杂度增加。为了解决这两个问题,我们提出了FluxGraph,一种反应式变体,利用SAM2的内部多掩码不一致性作为轻量级触发器进行变换检测,并去除了对所有实体的跟踪。FluxGraph在VOST上比TubeletGraph快约3.3倍,同时提高了跟踪性能并保持状态图质量。我们还观察到在VSCOS、M$^3$-VOS和DAVIS17上有3.7-10.7倍的速度提升,同时保持性能。代码已公开发布。

🔬 方法详解

问题定义:本论文旨在解决对象变换跟踪中的高计算成本问题。现有方法如TubeletGraph在处理时空划分时,需对每帧进行密集的实体分割计算,并跟踪场景中的所有实体,导致计算开销随场景复杂度增加。

核心思路:论文提出的FluxGraph通过利用SAM2的内部多掩码不一致性作为轻量级触发器来检测变换,从而减少不必要的计算,避免对所有实体的跟踪,提升效率。

技术框架:FluxGraph的整体架构包括变换检测模块和跟踪模块。变换检测模块通过分析多掩码不一致性来识别变换,而跟踪模块则专注于跟踪那些发生变换的实体,显著降低了计算负担。

关键创新:FluxGraph的主要创新在于其反应式设计,能够动态响应场景中的变换,而不是静态跟踪所有实体。这一设计使得FluxGraph在速度和性能上均优于现有方法。

关键设计:在设计中,FluxGraph采用了轻量级的多掩码不一致性检测机制,减少了对每帧的密集计算,并通过优化的跟踪策略,确保了在复杂场景下的高效性和准确性。实验中还调整了损失函数和网络结构,以适应新的跟踪需求。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,FluxGraph在VOST数据集上比TubeletGraph快约3.3倍,同时在VSCOS、M$^3$-VOS和DAVIS17上实现了3.7-10.7倍的速度提升,且保持了跟踪性能,显示出其在效率和效果上的显著优势。

🎯 应用场景

该研究的潜在应用领域包括视频监控、自动驾驶、机器人导航等需要实时对象跟踪和动态理解的场景。FluxGraph的高效性和准确性使其在这些领域具有重要的实际价值,能够支持更复杂的实时决策系统。

📄 摘要(原文)

Tracking objects through state transformations is essential for understanding real-world dynamics. However, existing methods are computationally expensive. TubeletGraph recently showed impressive capabilities, but its inference cost (~$4.4$ seconds per object-frame on VOST) precludes any real-time deployment possibilities. We observe that TubeletGraph's overhead arises from building a spatiotemporal partition of the input video: (1) entity segmentation is computed densely for every frame regardless of whether a transformation occurs, and (2) every entity in the scene is tracked, scaling cost with scene complexity rather than the number of transformations of interest. To address both, we propose FluxGraph, a reactive variant that uses SAM2's internal multi-mask disagreement as a lightweight trigger for transformation detection, and removes the need for tracking all entities in the given video. FluxGraph is ~$3.3\times$ faster than TubeletGraph on VOST while improving tracking performance and preserving state graph quality. Furthermore, we also observe consistent speedups of $3.7-10.7\times$ across VSCOS, M$^3$-VOS, and DAVIS17 while maintaining performance. Code is publicly available at https://github.com/YihongSun/FluxGraph.