Geometric Distillation from Rectified Stereo: Leveraging Epipolar Cues for Monocular Depth

📄 arXiv: 2607.15600 📥 PDF

作者: Jung-Hee Kim, Xiaoming Liu

分类: cs.CV

发布日期: 2026-07-20


💡 一句话要点

提出EpiDistill以解决单视图深度估计中的尺度模糊问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics) 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 单视图深度估计 几何蒸馏 尺度一致性 多视图模型 深度学习 计算机视觉 机器人导航

📋 核心要点

  1. 现有的单视图深度估计方法在多样化环境中存在尺度模糊性,导致深度预测不准确。
  2. 本文提出EpiDistill框架,通过校正立体视觉标记将多视图模型的几何先验转移到单视图模型中,增强几何一致性。
  3. 实验结果显示,该方法在ETH3D和DIODE等数据集上显著提升了深度估计性能,且对多种ViT模型均有效。

📝 摘要(中文)

单视图深度基础模型在多样化环境中展现了显著的泛化能力,但在度量深度估计方面仍面临挑战。这一局限性源于单视图推理的尺度模糊性,导致即使相对几何关系准确,尺度预测也可能不一致。为了解决这一问题,本文提出了一种新颖的框架,通过将多视图模型的尺度感知几何先验转移到单视图深度基础模型中,具体引入了利用校正立体视觉标记的Epipolar Distillation(EpiDistill)方法,使单视图预测模型能够保持几何一致性。实验结果表明,该方法在ETH3D和DIODE等具有挑战性的数据集上显著提高了零-shot度量深度估计的性能。

🔬 方法详解

问题定义:本文旨在解决单视图深度估计中的尺度模糊问题,现有方法在缺乏几何约束时性能下降,导致深度预测不一致。

核心思路:通过引入EpiDistill方法,利用校正立体视觉标记,将多视图模型的尺度感知几何先验转移到单视图模型中,从而在单图推理中保持几何一致性。

技术框架:该方法包括两个主要模块:首先是校正立体视觉标记的生成,其次是将这些标记用于单视图模型的训练和推理,确保模型在没有多视图输入的情况下仍能保持几何一致性。

关键创新:EpiDistill的核心创新在于通过校正立体视觉标记实现了多视图几何信息的有效转移,使得单视图模型能够在推理时保持几何一致性,这是与现有方法的本质区别。

关键设计:在网络结构上,采用了ViT架构,并设计了特定的损失函数以优化尺度一致性,同时在训练过程中引入了几何约束,确保模型能够有效学习到尺度感知的特征。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,EpiDistill方法在ETH3D和DIODE数据集上显著提高了零-shot度量深度估计的性能,尤其在尺度对齐至关重要的情况下,提升幅度达到XX%。该方法在多种ViT模型上均表现出一致的性能提升,验证了其模型无关性。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、机器人导航和增强现实等场景,能够为这些领域提供更为准确的深度信息,提升系统的环境感知能力。未来,该方法的推广可能会推动单视图深度估计技术的进一步发展,促进相关应用的广泛落地。

📄 摘要(原文)

Monocular depth foundation models have demonstrated remarkable generalization capabilities across diverse environments. However, they continue to struggle with metric depth estimation in diverse environments. This limitation stems from the inherent scale ambiguity of single-view inference, leading to misaligned scale predictions even when the relative geometry is accurate. Conversely, recent multi-view foundation models leverage cross-view cues to learn robust scene-level geometry and consistent scale. Yet, these benefits typically vanish during single-image inference, as the absence of explicit geometric constraints causes performance to degrade. To bridge this gap, we propose a novel framework that transfers the scale-aware geometric priors of multi-view models into monocular depth foundation models. Specifically, we introduce an Epipolar Distillation (EpiDistill), an approach utilizing Rectified Stereo Tokens, which enables the single-view prediction model to retain epipolar attention patterns and maintain geometric consistency without requiring multi-view inputs at inference. Experimental results demonstrate that our method significantly improves zero-shot metric depth estimation, particularly on challenging datasets like ETH3D and DIODE where scale alignment is critical. Furthermore, our approach is model-agnostic, consistently boosting the performance of state-of-the-art ViT-based models, including UniDepthV2 and DepthPro.