S4C: Self-Supervised Semantic Scene Completion with Neural Fields

📄 arXiv: 2310.07522v2 📥 PDF

作者: Adrian Hayler, Felix Wimbauer, Dominik Muhle, Christian Rupprecht, Daniel Cremers

分类: cs.CV

发布日期: 2023-10-11 (更新: 2023-10-12)


💡 一句话要点

提出S4C以解决自监督语义场景补全问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 自监督学习 语义场景补全 隐式语义场 计算机视觉 机器人导航 增强现实 图像分割

📋 核心要点

  1. 现有的语义场景补全方法依赖于昂贵的3D真实数据,难以扩展且成本高昂。
  2. 本文提出了一种自监督的方法S4C,通过视频和伪分割数据进行训练,避免了对3D真实数据的依赖。
  3. 实验结果表明,S4C在性能上接近完全监督的方法,并且在远视点的分割图合成上表现优异。

📝 摘要(中文)

3D语义场景理解是计算机视觉中的一项基本挑战,它使移动代理能够自主规划和导航任意环境。语义场景补全(SSC)将这一挑战形式化为从稀疏观测中联合估计密集几何和语义信息。现有方法通常依赖于基于聚合LiDAR扫描的3D真实数据进行训练,这一过程依赖于昂贵的特殊传感器和人工标注,难以扩展。为了解决这一问题,本文提出了首个自监督的SSC方法S4C,该方法不依赖于3D真实数据。我们的方法可以从单幅图像重建场景,并在训练过程中仅依赖于视频和通过现成图像分割网络生成的伪分割真实数据。与现有使用离散体素网格的方法不同,我们将场景表示为隐式语义场。该方法通过基于渲染的自监督损失进行训练,且在性能上接近完全监督的最先进方法。此外,我们的方法展示了强大的泛化能力,能够为远处视点合成准确的分割图。

🔬 方法详解

问题定义:本文旨在解决自监督语义场景补全(SSC)的问题,现有方法依赖于昂贵的3D真实数据,限制了其应用和扩展性。

核心思路:S4C方法通过利用视频和伪分割数据进行训练,避免了对3D真实数据的依赖,采用隐式语义场表示场景,允许在相机视锥内查询任意点的占用和语义类别。

技术框架:该方法的整体架构包括视频输入、伪分割生成、隐式场表示和基于渲染的自监督损失。主要模块包括图像分割网络和隐式场网络。

关键创新:S4C的主要创新在于首次提出不依赖于3D真实数据的自监督SSC方法,并使用隐式语义场表示场景,显著区别于传统的离散体素网格方法。

关键设计:在网络结构上,采用了图像分割网络生成伪分割数据,并通过渲染损失进行训练,确保了模型的有效性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,S4C在语义场景补全任务中表现出色,其性能接近完全监督的最先进方法,且在远视点的分割图合成上具有显著的准确性提升,展示了强大的泛化能力。

🎯 应用场景

该研究在自动驾驶、机器人导航和增强现实等领域具有广泛的应用潜力。通过实现自监督的语义场景补全,能够降低对昂贵传感器和人工标注的依赖,从而提高系统的可扩展性和实用性。

📄 摘要(原文)

3D semantic scene understanding is a fundamental challenge in computer vision. It enables mobile agents to autonomously plan and navigate arbitrary environments. SSC formalizes this challenge as jointly estimating dense geometry and semantic information from sparse observations of a scene. Current methods for SSC are generally trained on 3D ground truth based on aggregated LiDAR scans. This process relies on special sensors and annotation by hand which are costly and do not scale well. To overcome this issue, our work presents the first self-supervised approach to SSC called S4C that does not rely on 3D ground truth data. Our proposed method can reconstruct a scene from a single image and only relies on videos and pseudo segmentation ground truth generated from off-the-shelf image segmentation network during training. Unlike existing methods, which use discrete voxel grids, we represent scenes as implicit semantic fields. This formulation allows querying any point within the camera frustum for occupancy and semantic class. Our architecture is trained through rendering-based self-supervised losses. Nonetheless, our method achieves performance close to fully supervised state-of-the-art methods. Additionally, our method demonstrates strong generalization capabilities and can synthesize accurate segmentation maps for far away viewpoints.