DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs
作者: Rongxin Gao, Yuzhi Huang, Dongxuan Liu, Chu Li, Zhenye Wang, Jie Wu, Shuzhao Xie, Jingyan Jiang, Xinghao Ding, Xiaotong Tu, Yue Huang
分类: cs.CV
发布日期: 2026-07-14
备注: Accepted by ACM MM 2026
💡 一句话要点
提出DynTrace以解决动态场景感知不足问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 动态场景理解 时空推理 多模态大语言模型 动态轨迹可视化 动态追踪令牌 几何信息 机器人导航 自动驾驶
📋 核心要点
- 现有多模态大语言模型在动态场景感知中依赖稀疏的帧级观察,导致无法有效跟踪动态物体证据。
- 本文提出DynTrace框架,通过动态轨迹可视化和动态追踪令牌,提供几何信息的视觉先验,增强4D时空推理能力。
- DynTrace在Dyn-Bench、VLM4D和DSI-Bench等基准测试中取得了最先进的结果,验证了其有效性。
📝 摘要(中文)
4D时空推理是理解动态世界和实现具身交互的关键。尽管现有的多模态大语言模型(MLLMs)在静态场景理解和粗粒度4D任务上表现出色,但在连续动态场景感知方面仍存在显著局限,尤其是在跟踪动态物体证据以实现连贯的4D时空推理方面。为了解决这一问题,本文提出了DynTrace,一个无训练的框架,包含动态轨迹可视化(DTV)和动态追踪令牌(DT-Token)两个互补组件,提供几何信息的视觉先验和结构化的时空轨迹,从而持续跟踪动态物体证据。实验结果表明,DynTrace在多个基准测试上显著提升了MLLMs的性能,验证了动态物体证据跟踪在4D时空推理中的重要性。
🔬 方法详解
问题定义:本文旨在解决现有多模态大语言模型在连续动态场景感知中的不足,特别是在动态物体证据跟踪方面的挑战。现有方法主要依赖稀疏的帧级观察,难以有效区分真实物体动态与相机引起的表观运动。
核心思路:DynTrace框架通过动态轨迹可视化(DTV)和动态追踪令牌(DT-Token)两个组件,提供几何信息的视觉先验,帮助模型更好地理解和跟踪动态物体的演变。
技术框架:DynTrace的整体架构包括两个主要模块:DTV负责将世界坐标轨迹重投影到图像平面,提供几何信息的视觉先验;DT-Token则组织成动态追踪图(DTG),用于跟踪物体级动态线索和关键时刻,确保持续的动态物体证据。
关键创新:本文的主要创新在于提出了无训练的DynTrace框架,结合了几何信息的视觉先验与结构化的时空轨迹,显著提升了动态场景的理解能力。与现有方法相比,DynTrace能够更有效地处理动态物体的跟踪与推理。
关键设计:在设计中,DTV模块通过几何重投影技术实现动态轨迹的可视化,DT-Token则通过图结构组织动态信息,确保信息的连贯性和完整性。
🖼️ 关键图片
📊 实验亮点
在多个基准测试中,DynTrace显著提升了多模态大语言模型的性能,尤其是在Dyn-Bench、VLM4D和DSI-Bench上,均取得了最先进的结果,验证了动态物体证据跟踪的重要性。
🎯 应用场景
DynTrace的研究成果在多个领域具有广泛的应用潜力,包括自动驾驶、机器人导航、虚拟现实和增强现实等。通过提升动态场景的理解能力,能够为这些领域提供更为精准的决策支持和交互体验,推动智能系统的发展。
📄 摘要(原文)
4D spatio-temporal reasoning, jointly modeling 3D spatial structure and temporal evolution, is essential for understanding dynamic worlds and enabling embodied interaction. While current Multimodal Large Language Models (MLLMs) show strong capabilities in static scene understanding and coarse-grained 4D tasks, they still have notable limitations in continuous dynamic scene perception, especially in tracking dynamic object evidence for coherent 4D spatio-temporal reasoning. This shortcoming stems mainly from relying on sparse frame-level observations, fragmenting continuous dynamic cues and leaving models unable to disentangle genuine object dynamics from camera-induced apparent motion. Inspired by humans tracking dynamic cues while compensating for viewpoint changes, we propose DynTrace, a training-free framework for 4D spatio-temporal reasoning with two complementary components. Dynamic Trajectory Visualization (DTV) reprojects world-coordinate trajectories onto the image plane, providing geometry-informed visual priors that disentangle genuine object dynamics from camera-induced apparent motion. Meanwhile, the Dynamic Trace Token (DT-Token), organized into a Dynamic Trace Graph (DTG), tracks object-level dynamic cues, trace evolution, and key moments, maintaining continuous dynamic object evidence for coherent 4D reasoning. Together, these two components equip MLLMs with continuously tracked dynamic object evidence, grounded in geometry-informed visual priors and structured spatio-temporal traces. DynTrace consistently improves open-source MLLMs, achieving state-of-the-art results on Dyn-Bench, VLM4D, and DSI-Bench, validating the importance of tracking dynamic object evidence for robust 4D spatio-temporal reasoning.