TRIG: Trajectory-Rig Decoupled Metric Geometry Learning

📄 arXiv: 2607.05801v1 📥 PDF

作者: Lizhou Liao, Wentao Xu, Handong Wang, Lirong Yang, Shuai Yang, Weiwei Liu, Chang Huang

分类: cs.CV, cs.RO

发布日期: 2026-07-07

备注: 9 pages, 3 figures, 8 tables


💡 一句话要点

提出TRIG以解决多摄像头自驾车几何感知问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱七:动作重定向 (Motion Retargeting) 支柱八:物理动画 (Physics-based Animation)

关键词: 自主驾驶 几何感知 多摄像头系统 姿态估计 深度预测 3D重建 时空注意力 解耦学习

📋 核心要点

  1. 现有的视觉几何模型未针对刚性多摄像头系统进行优化,导致相机姿态的纠缠表示限制了几何先验的利用。
  2. TRIG通过将相机姿态分解为自我轨迹和相机刚性组件,实现了自我运动与静态拓扑的独立建模。
  3. 在五个自主驾驶基准测试中,TRIG在姿态估计和3D重建等任务上表现出色,达到了最先进的性能。

📝 摘要(中文)

视觉中心的自主驾驶需要从同步的多摄像头观测中准确估计度量几何和自我运动。现有的视觉几何模型在姿态估计、深度预测和3D重建方面表现良好,但并未针对刚性多摄像头驾驶系统进行优化,导致相机姿态被编码为纠缠的表示,限制了车辆几何先验的利用。为此,本文提出了轨迹-刚性解耦度量几何学习(TRIG),该框架将相机姿态分解为自我轨迹和相机刚性组件,从而实现自我运动和静态多摄像头拓扑的独立建模。通过引入解耦的姿态编码和监督,分别约束轨迹演变和刚性几何,实现度量一致的学习。实验结果表明,TRIG在姿态估计、度量深度预测和3D重建方面达到了最先进的性能。

🔬 方法详解

问题定义:本文旨在解决现有视觉几何模型在刚性多摄像头自主驾驶中的不足,尤其是相机姿态的纠缠表示限制了几何先验的有效利用。

核心思路:TRIG通过将相机姿态解耦为自我轨迹和相机刚性组件,分别建模自我运动和静态几何,从而提高度量一致性和模型的灵活性。

技术框架:TRIG的整体架构包括解耦的姿态编码、监督机制和稀疏的时空注意力模块,后者用于分离跨相机交互与时间聚合,降低全局注意力的计算成本。

关键创新:TRIG的主要创新在于解耦的姿态编码和监督方法,使得轨迹演变与刚性几何的学习过程相互独立,显著提高了模型的表现。

关键设计:在模型设计中,采用了特定的损失函数来分别约束轨迹和几何的学习,同时在网络结构中引入了稀疏时空注意力机制,以优化计算效率和保持几何推理能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在五个自主驾驶基准测试中,TRIG在姿态估计、度量深度预测和3D重建任务上均取得了最先进的性能,具体表现为在姿态估计上相较于基线方法提升了XX%,在深度预测和3D重建上也有显著的性能提升。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶汽车、智能交通系统以及机器人导航等。通过提高多摄像头系统的几何感知能力,TRIG能够为自主驾驶技术的安全性和可靠性提供支持,推动智能交通的进一步发展。

📄 摘要(原文)

Vision-centric autonomous driving requires accurate metric geometry and ego-motion estimation from synchronized multi-camera observations. Recent visual geometry models show strong performance in pose estimation, depth prediction, and 3D reconstruction, but are not tailored to rigid multi-camera driving systems. They often encode camera poses as entangled representations, in which time-varying ego-motion and static camera-rig geometry are jointly modeled, limiting the utilization of vehicle-side geometric priors. We propose Trajectory-Rig Decoupled Metric Geometry Learning (TRIG), a geometry perception framework for autonomous driving. TRIG factorizes camera poses into ego-trajectory and camera-rig components, enabling separate modeling of ego-motion and static multi-camera topology. We introduce decoupled pose encoding and supervision, which separately constrain trajectory evolution and rig geometry for metric-consistent learning. Moreover, sparse Temporal--Spatial attention separates cross-camera interaction from temporal aggregation, reducing global attention cost while preserving geometric reasoning. Experiments on five autonomous driving benchmarks show that TRIG achieves state-of-the-art performance in pose estimation, metric depth prediction, and 3D reconstruction.