ReferTrack: Referring Then Tracking for Embodied Visual Tracking

📄 arXiv: 2607.20061v1 📥 PDF

作者: Hanjing Ye, Tianle Zeng, Jiazhao Zhang, Shaoan Wang, Zibo Zhang, Weisi Situ, Yuchen Zhou, Yonggen Ling, Hong Zhang

分类: cs.RO

发布日期: 2026-07-22

🔗 代码/项目: GITHUB


💡 一句话要点

提出ReferTrack以解决自然语言描述目标的跟踪问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 具身视觉跟踪 目标识别 路径规划 视觉-语言-动作 机器人导航 时间视角特征 自然语言处理

📋 核心要点

  1. 现有的视觉-语言-动作策略在目标识别和轨迹规划中存在抽象空间潜在问题,难以有效监督和对齐。
  2. ReferTrack采用了先识别后跟踪的策略,通过单个摄像头进行目标选择和路径解码,增强了跟踪的准确性。
  3. 在EVT-Bench上,ReferTrack在单目标、干扰和模糊跟踪分割上分别达到了89.4%、73.3%和74.1%的成功率,表现优异。

📝 摘要(中文)

本论文提出了ReferTrack,一个针对具身视觉跟踪(EVT)的新方法,旨在通过单个前向摄像头持续跟踪自然语言描述的特定目标。现有的视觉-语言-动作(VLA)策略在目标识别和轨迹规划方面存在抽象空间潜在问题,难以监督且与图像空间检测的对齐度较低。ReferTrack通过首先从索引的边界框中选择目标,然后基于这一图像基础决策解码跟踪路径点,来解决这一问题。此外,ReferTrack通过维护一个滑动窗口队列来保留目标运动线索,并通过时间视角边界框指示符(TVBI)标记将几何特征注入视觉历史。实验结果表明,ReferTrack在EVT-Bench上实现了89.4%的单目标跟踪成功率,超越了多个多摄像头基线,验证了其在真实世界中的应用能力。

🔬 方法详解

问题定义:本论文旨在解决具身视觉跟踪(EVT)中,如何有效地通过自然语言描述来识别和跟踪目标的问题。现有方法在目标识别和轨迹规划上存在抽象空间潜在问题,导致难以进行有效监督和对齐。

核心思路:ReferTrack提出了一种先识别后跟踪的策略,首先从一组索引的边界框中选择目标,然后基于这一决策解码跟踪路径点。这样的设计使得目标选择与跟踪过程紧密结合,增强了跟踪的准确性和稳定性。

技术框架:ReferTrack的整体架构包括目标选择模块和路径解码模块。目标选择模块通过图像基础决策从边界框中选取目标,路径解码模块则根据选择的目标生成跟踪路径。此外,系统还维护一个滑动窗口队列,以保留历史目标信息。

关键创新:ReferTrack的主要创新在于引入了时间视角边界框指示符(TVBI)标记,能够将几何特征注入视觉历史,从而有效保留目标运动线索。这一设计与现有方法的本质区别在于其对时间信息的有效利用。

关键设计:在参数设置上,ReferTrack采用了自定义的Refer-QA数据集进行联合训练,以增强目标识别能力。损失函数设计上,结合了目标选择和路径解码的损失,确保模型在训练过程中能够有效学习到目标的动态特征。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

ReferTrack在EVT-Bench上实现了89.4%的单目标跟踪成功率,73.3%的干扰跟踪成功率和74.1%的模糊跟踪成功率,表现超越了多个多摄像头基线,显示出其在目标识别任务中的优越性。

🎯 应用场景

该研究的潜在应用领域包括机器人导航、智能监控和人机交互等场景。通过实现自然语言描述的目标跟踪,ReferTrack能够提升机器人在复杂环境中的自主决策能力,具有重要的实际价值和未来影响。

📄 摘要(原文)

Embodied visual tracking (EVT) requires a mobile agent to continuously follow a specific target described in natural language using only onboard vision. While recent vision-language-action (VLA) policies unify target identification and trajectory planning, their chain-of-thought (CoT) reasoning often operates in abstract spatial latents that are difficult to supervise and weakly aligned with explicit image-space detections. To address this, we introduce ReferTrack, a referring-then-tracking paradigm that grounds EVT using a single forward-facing camera. Our model first selects the target from an indexed set of bounding boxes, then decodes tracking waypoints conditioned on this image-grounded decision. To preserve target motion cues over time, ReferTrack maintains a sliding-window queue of previously selected bounding boxes, injecting their geometric features into the visual history via temporal-viewpoint-bbox indicator (TVBI) tokens. We further enhance target identification by co-training on a custom Refer-QA dataset. On EVT-Bench, ReferTrack achieves state-of-the-art single-view performance with success rates of 89.4%, 73.3%, and 74.1% on the single-target, distracted, and ambiguity tracking splits, respectively -- matching or even surpassing several multi-camera baselines on identification-heavy tasks. Finally, real-world deployments on legged and humanoid robots validate its robust sim-to-real transfer capabilities. Code is available at https://github.com/MedlarTea/referTrack.