Metrically Scaled Monocular Depth Estimation through Sparse Priors for Underwater Robots
作者: Luca Ebner, Gideon Billings, Stefan Williams
分类: cs.CV, cs.RO
发布日期: 2023-10-25
备注: Submitted to ICRA 2024
🔗 代码/项目: GITHUB
💡 一句话要点
提出基于稀疏先验的单目深度估计方法以解决水下机器人深度预测问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 单目深度估计 水下机器人 深度学习 稀疏先验 实时性能 嵌入式系统 深度预测
📋 核心要点
- 现有方法在水下环境中进行单目深度估计时面临尺度模糊和深度预测精度不足的问题。
- 本研究提出了一种深度学习模型,通过融合稀疏深度测量来改善深度预测,并解决尺度模糊问题。
- 实验结果表明,该方法在FLSea数据集上显著提高了深度预测准确性,并在其他数据集上表现良好。
📝 摘要(中文)
本研究针对移动水下机器人从单目图像实时密集深度估计的问题,提出了一种深度学习模型,该模型融合了来自三角测量特征的稀疏深度测量,以提高深度预测精度并解决尺度模糊问题。为支持任意稀疏性的先验输入,采用了密集参数化方法。该模型扩展了近期在单目图像深度估计领域的先进方法,使用高效的编码器-解码器骨干网络和现代轻量化变换器优化阶段来编码全局上下文。通过在前视水下数据集FLSea上进行监督训练,评估结果显示,稀疏特征先验的融合显著提高了深度预测的准确性。此外,在未进行任何重新训练的情况下,该方法在我们使用潜水员操作的相机设备收集的向下观察数据集上也达到了类似的深度预测准确性。该方法在笔记本GPU上以160 FPS的速度运行,在单个CPU核心上以7 FPS的速度运行,适合直接部署在嵌入式系统上。
🔬 方法详解
问题定义:本论文旨在解决水下机器人在单目图像中进行实时密集深度估计时的尺度模糊和深度预测精度不足的问题。现有方法往往无法有效利用稀疏深度信息,导致预测结果不准确。
核心思路:论文提出的核心思路是通过融合来自三角测量特征的稀疏深度测量,利用深度学习模型来改善深度预测,并采用密集参数化方法以支持任意稀疏性的先验输入。
技术框架:整体架构包括一个高效的编码器-解码器骨干网络,结合现代轻量化变换器优化阶段,用于编码全局上下文信息。模型在前视水下数据集FLSea上进行监督训练,以提高深度预测的准确性。
关键创新:本研究的关键创新在于有效融合稀疏深度测量与深度学习模型,解决了传统方法中的尺度模糊问题,并实现了实时性能,适合嵌入式系统的部署。
关键设计:模型采用了特定的损失函数来优化深度预测,网络结构设计上注重轻量化,以确保在不同硬件平台上的高效运行。
🖼️ 关键图片
📊 实验亮点
实验结果显示,该方法在FLSea数据集上实现了显著的深度预测准确性提升,且在未重新训练的情况下,在向下观察数据集上也达到了类似的准确性。此外,该方法在笔记本GPU上以160 FPS的速度运行,展现出良好的实时性能。
🎯 应用场景
该研究的潜在应用领域包括水下机器人导航、海洋环境监测和水下考古等。通过提高水下深度估计的准确性,该方法能够为水下探测和数据采集提供更可靠的支持,推动相关领域的技术进步和应用发展。
📄 摘要(原文)
In this work, we address the problem of real-time dense depth estimation from monocular images for mobile underwater vehicles. We formulate a deep learning model that fuses sparse depth measurements from triangulated features to improve the depth predictions and solve the problem of scale ambiguity. To allow prior inputs of arbitrary sparsity, we apply a dense parameterization method. Our model extends recent state-of-the-art approaches to monocular image based depth estimation, using an efficient encoder-decoder backbone and modern lightweight transformer optimization stage to encode global context. The network is trained in a supervised fashion on the forward-looking underwater dataset, FLSea. Evaluation results on this dataset demonstrate significant improvement in depth prediction accuracy by the fusion of the sparse feature priors. In addition, without any retraining, our method achieves similar depth prediction accuracy on a downward looking dataset we collected with a diver operated camera rig, conducting a survey of a coral reef. The method achieves real-time performance, running at 160 FPS on a laptop GPU and 7 FPS on a single CPU core and is suitable for direct deployment on embedded systems. The implementation of this work is made publicly available at https://github.com/ebnerluca/uw_depth.