GC-MVSNet: Multi-View, Multi-Scale, Geometrically-Consistent Multi-View Stereo

📄 arXiv: 2310.19583v4 📥 PDF

作者: Vibhas K. Vats, Sripad Joshi, David J. Crandall, Md. Alimoor Reza, Soon-heung Jung

分类: cs.CV, cs.LG

发布日期: 2023-10-30 (更新: 2025-08-14)

备注: Accepted in WACV 2024 Link: https://openaccess.thecvf.com/content/WACV2024/html/Vats_GC-MVSNet_Multi-View_Multi-Scale_Geometrically-Consistent_Multi-View_Stereo_WACV_2024_paper.html

期刊: Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2024

DOI: 10.1109/WACV57701.2024.00321


💡 一句话要点

提出GC-MVSNet以解决多视角立体视觉中的几何一致性问题

🎯 匹配领域: 支柱七:动作重定向 (Motion Retargeting)

关键词: 多视角立体视觉 几何一致性 深度学习 三维重建 计算机视觉 机器学习 图像处理

📋 核心要点

  1. 现有的多视角立体视觉方法在几何一致性检查上存在不足,通常仅在后处理阶段进行,导致效率低下。
  2. 本文提出GC-MVSNet,通过在学习过程中显式引入几何一致性损失,鼓励不同视图间的深度图一致性。
  3. 实验结果显示,GC-MVSNet在DTU和BlendedMVS数据集上取得了新的最优性能,训练效率显著提升。

📝 摘要(中文)

传统的多视角立体视觉(MVS)方法在很大程度上依赖于光度和几何一致性约束,而新兴的基于机器学习的MVS方法仅在后处理步骤中检查几何一致性。本文提出了一种新颖的方法,在学习过程中显式地鼓励不同尺度下的参考视图深度图在多个源视图之间的几何一致性。我们发现,增加几何一致性损失显著加速了学习过程,通过明确惩罚几何不一致的像素,将训练迭代次数减少到其他MVS方法的近一半。大量实验表明,我们的方法在DTU和BlendedMVS数据集上达到了新的最先进水平,并在Tanks and Temples基准上取得了竞争性结果。GC-MVSNet是首次在学习过程中强制执行多视角、多尺度几何一致性的尝试。

🔬 方法详解

问题定义:本文旨在解决传统多视角立体视觉方法在几何一致性检查上的不足,现有方法通常在后处理阶段进行,导致效率低下和准确性不足。

核心思路:GC-MVSNet通过在学习过程中引入几何一致性损失,鼓励参考视图深度图在多个源视图之间的一致性,从而提高学习效率和准确性。

技术框架:该方法的整体架构包括多个阶段,首先通过深度学习网络生成初步的深度图,然后在不同尺度下计算几何一致性损失,最终优化网络参数以提高深度图的准确性。

关键创新:GC-MVSNet的核心创新在于首次在学习过程中强制执行多视角、多尺度的几何一致性,这与传统方法的后处理步骤形成鲜明对比。

关键设计:在损失函数中,增加了几何一致性损失项,明确惩罚几何不一致的像素,同时采用了多尺度特征提取网络结构,以增强模型对不同尺度信息的学习能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

GC-MVSNet在DTU和BlendedMVS数据集上达到了新的最先进水平,训练迭代次数减少至其他MVS方法的近一半,显示出显著的学习加速效果。在Tanks and Temples基准上也取得了竞争性结果,验证了其有效性。

🎯 应用场景

GC-MVSNet在计算机视觉领域具有广泛的应用潜力,尤其是在三维重建、虚拟现实和增强现实等场景中。通过提高多视角立体视觉的准确性和效率,该方法能够为自动驾驶、机器人导航以及文化遗产保护等领域提供更为精确的三维模型,具有重要的实际价值和未来影响。

📄 摘要(原文)

Traditional multi-view stereo (MVS) methods rely heavily on photometric and geometric consistency constraints, but newer machine learning-based MVS methods check geometric consistency across multiple source views only as a post-processing step. In this paper, we present a novel approach that explicitly encourages geometric consistency of reference view depth maps across multiple source views at different scales during learning (see Fig. 1). We find that adding this geometric consistency loss significantly accelerates learning by explicitly penalizing geometrically inconsistent pixels, reducing the training iteration requirements to nearly half that of other MVS methods. Our extensive experiments show that our approach achieves a new state-of-the-art on the DTU and BlendedMVS datasets, and competitive results on the Tanks and Temples benchmark. To the best of our knowledge, GC-MVSNet is the first attempt to enforce multi-view, multi-scale geometric consistency during learning.