JustDepth: Real-Time Radar-Camera Depth Estimation with Single-Scan LiDAR Supervision

📄 arXiv: 2607.22172v1 📥 PDF

作者: Wooyung Yun, Dongwook Kim, Soomok Lee

分类: cs.CV, cs.RO

发布日期: 2026-07-24

备注: Project page: https://github.com/TPyun/JustDepth


💡 一句话要点

提出JustDepth以解决雷达-摄像头深度估计问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 深度估计 雷达-摄像头融合 图神经网络 实时处理 自动驾驶

📋 核心要点

  1. 现有的雷达-摄像头深度估计方法多为多阶段处理,导致延迟增加和可移植性差。
  2. JustDepth通过单阶段设计,利用雷达、摄像头和单次扫描LiDAR进行深度估计,简化了处理流程。
  3. 在nuScenes数据集上,JustDepth的推理时间减少了39.7倍,条纹伪影减少了66%,同时保持了准确性。

📝 摘要(中文)

准确且低延迟的深度估计对于自主系统中的雷达-摄像头感知至关重要。摄像头提供丰富的外观信息但缺乏度量尺度,而汽车雷达则提供度量范围但数据稀疏且噪声较大。现有的多阶段处理管道或依赖辅助注释,增加了延迟并限制了可移植性。本文提出的JustDepth是一种单阶段雷达-摄像头深度估计器,仅使用雷达、摄像头和单次扫描的LiDAR进行训练。所有雷达返回数据被聚合为固定宽度的1D表示,解耦了运行时间与点数的关系。高度融合模块融合了不同模态,轻量级图神经网络在全局传播深度,而仅在训练时使用的置信度解码器在测试时无额外成本地稳定学习。通过简单的增强方法减轻条纹伪影,并使用垂直-水平梯度比(VHGR)进行量化。在nuScenes数据集上,与最新的先进方法相比,JustDepth在保持准确性的同时将推理时间减少了39.7倍,条纹伪影减少了66%。

🔬 方法详解

问题定义:本文旨在解决雷达-摄像头深度估计中的高延迟和依赖多阶段处理的问题。现有方法往往需要额外的注释和复杂的处理流程,导致实时性差。

核心思路:JustDepth采用单阶段深度估计方法,利用雷达和摄像头数据的结合,简化了深度估计的流程。通过将所有雷达返回数据聚合为固定宽度的1D表示,解耦了运行时间与点数的关系。

技术框架:整体架构包括高度融合模块、轻量级图神经网络(GNN)和训练时的置信度解码器。高度融合模块负责不同模态数据的融合,GNN用于全局深度传播,而置信度解码器则在训练过程中稳定学习。

关键创新:最重要的创新在于将深度估计简化为单阶段处理,同时通过固定宽度的1D表示来降低计算复杂度。这与现有的多阶段方法形成了鲜明对比。

关键设计:在设计中,采用了简单的增强方法来减轻条纹伪影,并通过VHGR进行量化。此外,置信度解码器的设计确保了在测试时无额外成本。整体网络结构经过优化,以实现高效的深度估计。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

JustDepth在nuScenes数据集上的实验结果显示,推理时间减少了39.7倍,条纹伪影减少了66%,同时保持了与最新先进方法相当的准确性。这一显著的性能提升证明了其在实时深度估计中的有效性。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、机器人导航和智能交通系统等。通过提供实时且准确的深度信息,JustDepth能够显著提升自主系统的感知能力和决策效率,推动智能交通的发展。未来,随着技术的进一步成熟,可能会在更广泛的场景中得到应用。

📄 摘要(原文)

Accurate yet low-latency depth is essential for radar-camera perception in autonomous systems. Cameras provide rich appearance but lack metric scale, whereas automotive radar offers metric range but is sparse and noisy. Many pipelines are multi-stage or depend on auxiliary annotations, increasing latency and limiting portability. We introduce JustDepth, a single-stage radar-camera depth estimator trained only with radar, camera, and single-scan LiDAR. All radar returns are aggregated into a fixed-width 1D representation, decoupling runtime from point count. A Height Fusion Block fuses modalities, a lightweight GNN propagates depth globally, and a training-only confidence decoder stabilizes learning with zero test-time cost. We mitigate stripe artifacts via simple augmentations and quantify them using the Vertical-Horizontal Gradient Ratio (VHGR). On nuScenes, compared to recent state-of-the-art methods, JustDepth maintains accuracy while reducing inference time by 39.7x and stripe artifacts by 66% as measured by VHGR.