ZipDepth: Bringing Lightweight Zero-Shot Monocular Depth Anywhere, on Any Device
作者: Fabio Tosi, Luca Bartolomei, Matteo Poggi, Stefano Mattoccia
分类: cs.CV
发布日期: 2026-07-09
备注: ECCV 2026. Code: https://github.com/fabiotosi92/ZipDepth - Project page: https://zipdepth.github.io/
💡 一句话要点
提出ZipDepth以解决轻量级单目深度估计问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 单目深度估计 轻量级模型 知识蒸馏 多领域训练 实时推理
📋 核心要点
- 现有的单目深度估计方法在计算资源上要求较高,难以在移动和嵌入式设备上应用。
- ZipDepth通过高效的编码器-解码器结构与知识蒸馏相结合,提供了一种轻量级的解决方案。
- 在五个基准测试中,ZipDepth在零-shot准确性和部署效率之间取得了最佳平衡,显著提升了性能。
📝 摘要(中文)
单目深度估计在基础模型的推动下取得了显著进展,然而其计算需求使得在嵌入式和移动平台上难以实现。现有的轻量级替代方案多集中于单一领域的自监督学习,无法有效应对领域转移问题。本文提出了ZipDepth,一个紧凑的单目深度网络,通过结合高效的可重参数化编码器-解码器与来自基础模型的大规模知识蒸馏,成功填补了这一空白。ZipDepth仅包含6.1M参数,能够在从服务器GPU到功率受限设备的实时运行中实现最佳的零-shot准确性与部署效率的平衡,向基础模型的准确性迈出了重要一步。
🔬 方法详解
问题定义:本文旨在解决现有单目深度估计方法在计算资源上的高需求,导致其无法在移动和嵌入式设备上有效应用的问题。现有轻量级模型在领域转移时表现不佳,限制了其实际应用。
核心思路:ZipDepth的核心思路是结合高效的可重参数化编码器-解码器与大规模知识蒸馏技术,从而在保持轻量级的同时提升模型的准确性和泛化能力。通过这种设计,ZipDepth能够在多领域数据集上进行训练,增强了模型的适应性。
技术框架:ZipDepth的整体架构包括一个编码器-解码器模块,负责特征提取和深度图生成,同时引入知识蒸馏机制,从基础模型中提取知识以增强学习效果。该框架能够在不同设备上实现实时推理。
关键创新:ZipDepth的主要创新在于其轻量级设计与知识蒸馏的结合,使得模型在参数量仅为6.1M的情况下,仍能达到接近大型基础模型的准确性。这一设计显著提升了模型在多领域的适应能力。
关键设计:在网络结构上,ZipDepth采用了可重参数化的编码器-解码器架构,优化了参数设置以降低计算复杂度。同时,损失函数设计上结合了重建损失与蒸馏损失,确保了模型在训练过程中的有效性与稳定性。通过这些设计,ZipDepth在多个基准测试中表现出色。
🖼️ 关键图片
📊 实验亮点
在五个基准测试中,ZipDepth在零-shot准确性与部署效率之间实现了最佳平衡,显著优于其他轻量级模型。与参数量高达50倍的基础模型相比,ZipDepth在保持高准确度的同时,极大地降低了计算需求,展现出优越的性能表现。
🎯 应用场景
ZipDepth的研究成果在多个领域具有广泛的应用潜力,包括自动驾驶、机器人导航、增强现实等。其轻量级特性使得该模型能够在资源受限的设备上实时运行,推动了深度估计技术在实际场景中的应用,具有重要的实际价值和未来影响。
📄 摘要(原文)
Monocular depth estimation has seen remarkable progress through foundation models achieving robust zero-shot generalization, yet their computational demands place them far beyond the reach of embedded and mobile platforms. Lightweight alternatives exist, but have been developed almost exclusively within single-domain, self-supervised paradigms, failing silently under domain shift. We present ZipDepth, a compact monocular depth network that bridges this gap by combining an efficient reparameterizable encoder-decoder with large-scale knowledge distillation from a foundation model over a large multi-domain training set. Comprising just 6.1M parameters, ZipDepth runs at real-time rates from server GPUs to power-constrained devices, achieving the best trade-off between zero-shot accuracy and deployment efficiency among lightweight models across five benchmarks, taking a significant step towards the accuracy of foundation models with 50x more parameters.