Self-Supervised Learning of Structured Dynamics from Videos
作者: Lukas Knobel, Andrew Zisserman, Yuki M. Asano
分类: cs.CV
发布日期: 2026-07-23
备注: preprint, Project page: https://lukasknobel.github.io/projects/StructuredDynamics
💡 一句话要点
提出结构化动态模型以解决视频运动理解问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics) 支柱七:动作重定向 (Motion Retargeting) 支柱八:物理动画 (Physics-based Animation)
关键词: 视频运动理解 结构化动态 自监督学习 特征预测 合成数据 运动表示 视觉变换器
📋 核心要点
- 现有方法在视频运动理解中未能有效分离相机运动与物体运动,导致动态表示不够稳健。
- 本文提出的结构化动态模型(SDM)通过未来特征预测,显式分离主要动态源与残余动态,提供更清晰的运动表示。
- SDM在新的ProbeMotion评估套件上表现优异,超越了传统基线,并在多个测试中与强监督方法相当,显示出其有效性。
📝 摘要(中文)
理解视频中的运动是视觉学习中的一个基本挑战,因为帧间变化涉及相机运动和物体运动两个动态源。这种分解在表示学习中尚未得到充分探索,部分原因是这些因素在自然视频中紧密耦合且难以单独监督。然而,恢复这些动态对于学习稳健的运动表示至关重要。本文提出结构化动态模型(SDM),通过未来特征预测显式分离主要的时间变化源与残余动态。训练结合了真实视频的自监督学习和合成数据的弱监督。实验结果表明,SDM在多个基准测试中优于传统方法,并在使用较弱监督的情况下与强监督表示相媲美。
🔬 方法详解
问题定义:本文旨在解决视频运动理解中的相机运动与物体运动的分离问题。现有方法通常将这两种动态耦合在一起,导致难以提取有意义的运动表示。
核心思路:论文提出的结构化动态模型(SDM)通过未来特征预测来分离主要的时间变化源与残余动态。这种方法允许模型在不需要强监督的情况下,学习到更稳健的运动表示。
技术框架:SDM的整体架构包括两个主要模块:一是从预训练的图像视觉变换器中提取冻结特征,二是通过未来特征预测来实现动态分离。训练过程中结合了真实视频的自监督学习与合成数据的弱监督。
关键创新:SDM的核心创新在于其通过未来特征预测的方式,显式分离相机运动与物体运动。这与传统方法的单一耦合表示或无结构的过渡标记形成鲜明对比。
关键设计:在模型设计中,使用了特定的损失函数来优化未来特征的预测精度,并采用了合成Kubric数据集进行弱监督训练,以增强模型的泛化能力。
🖼️ 关键图片
📊 实验亮点
实验结果显示,SDM在ProbeMotion评估套件上超越了使用全局CLS或平均池化特征的基线,且在多个测试中与强监督表示VGGT相比较,表现出色,尽管使用了显著较弱的监督,显示出其有效性和潜力。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶、视频监控和运动分析等。通过更准确地理解视频中的运动动态,能够提升这些领域中模型的决策能力和分析精度,具有重要的实际价值和未来影响。
📄 摘要(原文)
Understanding motion in video is a fundamental challenge for visual learning, as frame-to-frame change entangles two sources of dynamics: camera motion and object motion. This decomposition has remained underexplored in representation learning, partly because these factors are tightly coupled in natural videos and difficult to supervise separately. Yet recovering it is important for learning robust motion representations that separate meaningful object dynamics from camera-induced variation. We study whether such structured motion representations can be recovered from frozen features of a pretrained image vision transformer. We propose the Structured Dynamics Model (SDM), which explicitly separates the dominant source of temporal change from residual dynamics through future-feature prediction, rather than representing video change with a single entangled latent or with unstructured, spatially dense transition tokens. Training combines self-supervised learning on real video with weak supervision of scene dynamics on synthetic Kubric data. We evaluate SDM on ProbeMotion, a new evaluation suite spanning synthetic and real videos with camera motion, object motion, and combined dynamics. SDM outperforms backbone baselines using global CLS or average-pooled features, and compares favorably to strongly supervised representations such as VGGT on several probes, despite using substantially weaker supervision. These results suggest that pretrained image models can be readily repurposed into structured video-dynamics representations, providing a useful inductive bias for learning and analyzing latent video dynamics.