X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras

📄 arXiv: 2607.12993v1 📥 PDF

作者: Heng Zhou, Shuhong Liu, Yonghao He, Bohao Zhang, Fa Fu, Chenhui Hou, Xianbao Hou, Lijun Han, Wei Sui

分类: cs.CV

发布日期: 2026-07-14

备注: 24 pages


💡 一句话要点

提出X-Lens以解决异构相机的实时度量深度估计问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 度量深度估计 异构相机 实时感知 深度学习 计算机视觉 多模态融合

📋 核心要点

  1. 现有方法在异构相机系统中进行度量深度估计时,通常面临参数复杂、实时性差等挑战。
  2. X-Lens通过引入可学习的标定令牌和雅可比参数化畸变偏差,解决了鱼眼与针孔相机之间的对齐问题,支持实时深度估计。
  3. 实验结果显示,X-Lens在OmniScene-Full数据集上减少了25.4%的绝对相对误差,且参数量减少了88.9%,在传统设置中也表现出色。

📝 摘要(中文)

我们提出了X-Lens,一种紧凑的前馈模型,用于从可变数量的标定鱼眼和针孔视图中进行度量深度估计。为了支持实时下游感知,X-Lens围绕几何感知的异构相机模型构建,包含两个关键组件:可学习的标定令牌提供鱼眼和针孔投影空间之间的粗略对齐,而注入到交叉注意力模型中的雅可比参数化畸变偏差则局部化投影变化并促进跨相机一致性。该模型以仅0.04B的参数预测稠密深度和全局度量尺度,避免了增加计算和优化复杂度的辅助重建目标。X-Lens在多个公共数据集和我们新发布的大规模合成数据集OmniScene上进行训练,后者包含约266K个同步六视图帧、1.7M个单独图像和103个室内外场景。大量实验表明,该模型在异构相机度量深度准确性上表现优越,在OmniScene-Full上相较于最强基线减少了25.4%的绝对相对误差,同时使用了88.9%的更少参数,并在传统的仅鱼眼和仅针孔设置上表现出竞争力。

🔬 方法详解

问题定义:本论文旨在解决异构相机系统中的实时度量深度估计问题。现有方法通常需要复杂的参数设置,且在实时性和准确性上存在不足。

核心思路:X-Lens的核心思路是通过可学习的标定令牌和雅可比参数化畸变偏差来实现鱼眼和针孔相机之间的有效对齐,从而提高深度估计的准确性和实时性。

技术框架:X-Lens的整体架构包括两个主要模块:首先是可学习的标定令牌模块,用于粗略对齐不同相机的投影空间;其次是交叉注意力模型,注入雅可比参数化畸变偏差以增强跨相机的一致性。

关键创新:X-Lens的主要创新在于其引入的可学习标定令牌和雅可比参数化畸变偏差,这使得模型能够在仅使用0.04B参数的情况下实现高效的深度估计,显著减少了计算复杂度。

关键设计:在设计中,X-Lens采用了交叉注意力机制,并通过优化损失函数来提升模型的泛化能力。模型在多个公共数据集和新发布的OmniScene数据集上进行训练,以确保其在多种场景下的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,X-Lens在OmniScene-Full数据集上相较于最强基线减少了25.4%的绝对相对误差,同时使用了88.9%的更少参数。此外,模型在传统的仅鱼眼和仅针孔设置中也表现出竞争力,达到了41 FPS的实时性能。

🎯 应用场景

X-Lens在机器人导航、增强现实和自动驾驶等领域具有广泛的应用潜力。其高效的深度估计能力能够为实时环境感知提供支持,推动智能系统的进一步发展。未来,X-Lens还可以与其他传感器融合,提升多模态感知的准确性和鲁棒性。

📄 摘要(原文)

We present X-lens, a compact feed-forward model for metric depth estimation from a variable number of calibrated fisheye and pinhole views. To support real-time downstream perception, X-lens is built around a geometry-aware heterogeneous camera formulation with two key components. Learnable calibration tokens provide a coarse alignment between fisheye and pinhole projective spaces, while a Jacobian-parameterized distortion bias injected into cross-attention models local projection changes and promotes cross-camera consistency, enabling robust generalization with only 0.04B parameters and up to 41 FPS. The model predicts dense depth together with a global metric scale, avoiding auxiliary reconstruction targets that increase computation and optimization complexity. To learn such cross-camera generalization at scale and depth, X-lens is trained on multiple public datasets and OmniScene, our newly released large-scale synthetic dataset containing approximately 266K synchronized six-view frames, 1.7M individual images, and 103 indoor and outdoor scenes. Extensive experiments on both real-world and synthetic indoor and outdoor datasets demonstrate superior heterogeneous-camera metric depth accuracy, reducing AbsRel by 25.4\% on OmniScene-Full over the strongest baseline while using 88.9\% fewer parameters, with competitive performance on conventional fisheye-only and pinhole-only settings.