Linguistic Trajectory Encoding for Efficient Long-Horizon Spatial Memory in Embodied Agents

📄 arXiv: 2609.04802v1 📥 PDF

作者: Tianyidan Xie, Shenyi Wang, Qiang Tang, Mingjie Wang, Zhicheng Qiu, Xuanfu Li, Zhan Xu, Jian Yang, Lanjun Wang, Zili Yi

分类: cs.CV, cs.AI

发布日期: 2026-09-04


💡 一句话要点

提出语言轨迹编码以解决长时间空间记忆问题

🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction)

关键词: 长时间任务 动态物体 语言轨迹编码 空间记忆 自然语言处理 智能体 多模态学习

📋 核心要点

  1. 现有方法在长时间任务中无法有效查询动态物体的状态转变,导致信息丢失。
  2. 提出的语言轨迹编码(LTE)通过混合表示压缩动态物体运动历史,使得状态转变可用自然语言查询。
  3. 在空间记忆基准(SMB)上,LTE系统在语义轨迹和长时间物体检索上均显著优于现有方法,提升幅度明显。

📝 摘要(中文)

具身智能体在执行长时间任务时,需要一种记忆表示,使得动态物体的状态转变能够在数小时到数天的观察范围内通过自然语言进行查询。现有系统要么忽略细粒度运动,要么仅保留原始坐标,或围绕即时任务上下文组织记忆。本文的关键贡献是提出了语言轨迹编码(LTE),通过结合自然语言描述、稀疏空间锚点和视觉锚点的混合表示,压缩动态物体的运动历史。LTE根据运动复杂性调整压缩方式,保持准确性。通过构建空间记忆基准(SMB),评估其在语义轨迹检索和长时间物体检索方面的能力,LTE系统在SMB上取得了45.3%的语义轨迹检索成功率和48.7%的长时间物体检索成功率,显著超越了现有基线。

🔬 方法详解

问题定义:本文旨在解决具身智能体在长时间任务中动态物体状态转变的查询问题。现有方法无法提供可查询的每个物体的时间线,导致信息的缺失和查询效率低下。

核心思路:论文提出的语言轨迹编码(LTE)通过结合自然语言描述和空间锚点,压缩动态物体的运动历史,确保在长时间观察中仍能准确查询状态转变。

技术框架:LTE的整体架构包括三个主要模块:自然语言描述生成、稀疏空间锚点的设置和视觉锚点的整合。通过这些模块,系统能够在缺乏可靠观察时,依赖最后一次观察的位置进行状态表示。

关键创新:LTE的核心创新在于其混合表示方式,能够根据运动复杂性自适应地调整压缩策略,与传统的几何SLAM和结构化记忆方法相比,提供了更高的查询灵活性和准确性。

关键设计:在设计中,LTE使用了稀疏空间锚点和几何路径点来表示运动,并通过损失函数优化自然语言描述的生成,确保在长时间视频中保持低延迟的查询响应。具体参数设置和网络结构细节在论文中进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在空间记忆基准(SMB)上,基于LTE的系统在语义轨迹检索中取得了45.3%的成功率,在长时间物体检索中达到48.7%,显著超越了结构化记忆和视觉语言模型基线(最佳前者为31.9%和34.4%)。此外,LTE实现了8.7倍到26.1倍的轨迹压缩,并在24小时视频上保持亚秒级查询延迟。

🎯 应用场景

该研究的潜在应用领域包括智能机器人、自动驾驶、虚拟现实等,能够提升具身智能体在复杂环境中的理解和交互能力。未来,LTE有望在多模态学习和人机交互中发挥更大作用,推动智能体的智能化进程。

📄 摘要(原文)

Embodied agents performing long-horizon tasks require a memory representation in which the state transitions of dynamic objects remain queryable in natural language across hours-to-days observation horizons. Existing systems either drop fine-grained motion (clip-level video-language embeddings), keep it only as raw coordinates (geometric SLAM), or organise it around immediate task context (agent working memories). None of them gives the agent a per-object timeline whose state transitions are themselves queryable in language. Our key contribution is \textbf{Linguistic Trajectory Encoding} (LTE), which compresses dynamic object motion histories via a hybrid representation combining natural language descriptions, sparse spatial anchors, and visual anchors. LTE adapts compression to motion complexity by anchoring periods without reliable observations to the last seen location, while representing motion with geometric waypoints and linguistic descriptions to preserve accuracy. To evaluate these capabilities across extended time horizons, we construct the \textbf{Spatial Memory Benchmark} (SMB) from EgoLife multi-day recordings, targeting capabilities absent in existing benchmarks: semantic trajectory retrieval and long-horizon object retrieval. On SMB, the LTE-based system achieves $45.3\%$ success in semantic trajectory retrieval and $48.7\%$ in long-horizon object retrieval, outperforming structured-memory and VLM baselines (best prior: $31.9\%$ and $34.4\%$). LTE achieves trajectory compression by factors of $8.7\times$ to $26.1\times$ with sub-second query latency on $24$\,h video. On Ego4D natural-language queries, the system reaches $28.75\%$ / $55.10\%$ R@1/R@5, $+15.80$ / $+31.30$ pts over EgoVLPv2.