Whareformer: Learning to Track What is Where in Long Egocentric Videos

📄 arXiv: 2607.08537v1 📥 PDF

作者: Jacob Chalk, Saptarshi Sinha, Dima Damen, Yannis Kalantidis, Diane Larlus

分类: cs.CV

发布日期: 2026-07-09

备注: Accepted at ECCV 2026. Project Webpage: https://jacobchalk.github.io/Whareformer/


💡 一句话要点

提出Whareformer以解决长时间自我中心视频中的物体追踪问题

🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction)

关键词: 自我中心视频 物体追踪 变换器模型 动态轨迹 实时处理 深度学习 计算机视觉

📋 核心要点

  1. 现有方法在自我中心视频中追踪物体时,难以处理物体离开视野或被遮挡的情况,导致追踪精度下降。
  2. Whareformer通过引入可更新的轨迹内存和跟踪分配模块,在线追踪物体并维护其位置,解决了OSNOM任务。
  3. 在仅使用56个训练视频的情况下,Whareformer在260个长测试视频上实现了SOTA性能,显著超越了以往方法。

📝 摘要(中文)

近年来提出的“视线之外,不代表心中无”的(OSNOM)任务,专注于在自我中心视频中追踪由摄像机佩戴者移动的物体,要求在线维护物体实例位置的知识,即使它们离开视野或被严重遮挡。本文提出了第一个基于学习的OSNOM任务解决方案:Whareformer,这是一种基于变换器的模型,包含两个组件:可更新的已建立轨迹内存和跟踪分配模块,能够以前馈方式将观察与现有轨迹关联。Whareformer同时推理物体外观的演变(what)和更新的3D位置(where),并采用专门的“新轨迹”标记来推理新物体。得益于使用相对距离和演变轨迹表示的设计选择,Whareformer在仅用56个视频训练的情况下,在来自EPIC-KITCHENS-100(未见视频)、IT3DEgo和HD-EPIC的260个长测试视频上实现了SOTA性能,相较于之前的工作有显著的绝对提升。

🔬 方法详解

问题定义:本文旨在解决在自我中心视频中追踪物体的OSNOM任务,现有方法在物体离开视野或被遮挡时无法有效维持追踪,导致信息丢失。

核心思路:Whareformer通过构建一个可更新的轨迹内存和跟踪分配模块,能够实时关联观察与现有轨迹,同时推理物体外观和3D位置的变化,从而实现更精确的物体追踪。

技术框架:Whareformer的整体架构包括两个主要模块:一个是用于存储和更新物体轨迹的内存模块,另一个是跟踪分配模块,负责将新观察与已有轨迹进行关联。模型通过变换器结构实现信息的高效处理。

关键创新:Whareformer的主要创新在于其使用相对距离和动态轨迹表示的设计,使得模型能够在物体状态变化时保持高效的追踪能力,这与传统方法的静态处理方式有本质区别。

关键设计:模型采用了专门的“新轨迹”标记来处理新出现的物体,并在损失函数中引入了针对轨迹更新的优化策略,确保模型在训练过程中能够有效学习物体的动态变化。整体网络结构基于变换器,具有良好的扩展性和适应性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

Whareformer在仅用56个训练视频的情况下,成功在260个长测试视频上实现了SOTA性能,尤其在EPIC-KITCHENS-100数据集上表现突出,相较于之前的方法有显著的绝对提升,展示了其在物体追踪任务中的有效性和优越性。

🎯 应用场景

Whareformer的研究成果在多个领域具有潜在应用价值,包括智能监控、增强现实和虚拟现实等场景。在这些应用中,能够实时追踪物体并维护其位置信息,将极大提升用户体验和系统的智能化水平。未来,该技术可能推动更复杂的交互式系统的发展,提升人机交互的自然性和流畅性。

📄 摘要(原文)

The recently established 'Out of Sight, Not out of Mind' (OSNOM) task for egocentric videos focuses on tracking objects that are moved by the camera wearer, online, maintaining knowledge of instance locations throughout the video even when they leave the field of view or become heavily occluded. In this paper, we propose the first learning-based solution to the OSNOM task: Whareformer, a transformer-based model with two components: an updatable memory of established tracks and a track assignment module that associates observations with existing tracks in a feed-forward manner. Whareformer jointly reasons over evolving object appearance (what) and updated 3D location (where), and employs a dedicated New Track token to reason about novel objects. Thanks to its design choices of using relative distances and evolving track representations, Whareformer is trained on a small set of 56 videos but achieves SOTA performance on 260 long test videos from three datasets: EPIC-KITCHENS-100 (unseen videos), IT3DEgo, and HD-EPIC, with significant absolute improvements over prior work.