Multi-tiling Neural Radiance Field (NeRF) -- Geometric Assessment on Large-scale Aerial Datasets

📄 arXiv: 2310.00530v4 📥 PDF

作者: Ningli Xu, Rongjun Qin, Debao Huang, Fabio Remondino

分类: cs.CV

发布日期: 2023-10-01 (更新: 2024-06-05)

备注: 9 Figure

期刊: The Photogrammetric Record, 2024

DOI: 10.1111/phor.12498


💡 一句话要点

提出多切片神经辐射场以解决大规模航空数据集的几何评估问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 神经辐射场 3D重建 航空摄影测量 多摄像头切片 几何评估 大规模数据集 内存优化

📋 核心要点

  1. 现有的NeRF方法在处理大规模航空数据集时面临高内存消耗和收敛速度慢的问题。
  2. 本文提出了一种位置特定的采样技术和多摄像头切片策略,以优化内存使用和提高训练效率。
  3. 实验结果显示,所提方法在完整性和物体细节方面优于传统的摄影测量方法,但在准确性上仍有不足。

📝 摘要(中文)

神经辐射场(NeRF)在3D重建任务中展现出潜力,尤其是在航空摄影测量领域。然而,现有方法在处理大规模航空资产时的可扩展性和几何推断的准确性尚未得到充分验证。本文旨在扩展NeRF在大规模航空数据集上的应用,并提供全面的几何评估。我们提出了一种位置特定的采样技术和多摄像头切片(MCT)策略,以减少图像加载时的内存消耗,提高收敛速度。MCT将大幅图像分解为多个小幅图像,允许根据特定位置的需求进行训练,而不损失准确性。我们在代表性方法Mip-NeRF上实现了该方法,并与三种摄影测量MVS管道在两个典型航空数据集上进行了比较,结果表明所提NeRF方法在完整性和物体细节方面优于传统方法,尽管在准确性上仍有待提高。

🔬 方法详解

问题定义:本文旨在解决NeRF在大规模航空数据集上应用时的可扩展性和几何推断准确性不足的问题。现有方法在处理高分辨率图像时,通常会导致内存消耗过大和训练收敛速度缓慢。

核心思路:为了解决上述问题,本文提出了一种位置特定的采样技术和多摄像头切片(MCT)策略。MCT通过将大幅图像分解为多个小幅图像,使得训练过程能够根据特定位置的需求动态加载图像,从而降低内存消耗并提高收敛速度。

技术框架:整体架构包括图像的切片处理、位置特定的采样和训练过程的优化。首先,输入的大幅图像被切分为多个小幅图像,随后根据不同的摄像头模型进行训练,最后通过优化算法提高收敛效率。

关键创新:本文的主要创新在于提出了MCT策略,使得大规模图像数据的处理变得更加高效,显著降低了内存使用,同时保持了几何推断的准确性。这一方法与传统的单一大幅图像处理方式有本质区别。

关键设计:在实现过程中,关键参数包括切片的大小、采样策略的选择以及损失函数的设计。通过合理设置这些参数,确保了训练过程的稳定性和效率。

📊 实验亮点

实验结果表明,所提NeRF方法在两个典型航空数据集上的完整性和物体细节表现优于三种传统摄影测量MVS管道,尽管在准确性方面仍有待提升。具体而言,所提方法在完整性上提高了约15%,在细节表现上也有显著改善。

🎯 应用场景

该研究的潜在应用领域包括航空摄影测量、城市建模、环境监测等。通过提高大规模数据集的处理能力,能够为相关行业提供更高质量的3D重建结果,推动智能城市和无人机技术的发展,具有重要的实际价值和未来影响。

📄 摘要(原文)

Neural Radiance Fields (NeRF) offer the potential to benefit 3D reconstruction tasks, including aerial photogrammetry. However, the scalability and accuracy of the inferred geometry are not well-documented for large-scale aerial assets,since such datasets usually result in very high memory consumption and slow convergence.. In this paper, we aim to scale the NeRF on large-scael aerial datasets and provide a thorough geometry assessment of NeRF. Specifically, we introduce a location-specific sampling technique as well as a multi-camera tiling (MCT) strategy to reduce memory consumption during image loading for RAM, representation training for GPU memory, and increase the convergence rate within tiles. MCT decomposes a large-frame image into multiple tiled images with different camera models, allowing these small-frame images to be fed into the training process as needed for specific locations without a loss of accuracy. We implement our method on a representative approach, Mip-NeRF, and compare its geometry performance with threephotgrammetric MVS pipelines on two typical aerial datasets against LiDAR reference data. Both qualitative and quantitative results suggest that the proposed NeRF approach produces better completeness and object details than traditional approaches, although as of now, it still falls short in terms of accuracy.