VoxelFix: Post-Hoc Semantic Correction of Completed 3D Voxel Maps
作者: Sunesh Praveen Raja Sundarasami, Taehyoung Kim, Johannes Scherer, Tomaž Cotič, Sivasubiramaniam Subbiah, Andreas Greiner, Paul Spannaus, Sebastian Houben
分类: cs.CV
发布日期: 2026-09-04
💡 一句话要点
提出VoxelFix以解决3D体素地图语义修正问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 3D语义地图 后处理修正 体素标签 图模型 自动驾驶 航空机器人 语义分割
📋 核心要点
- 现有的3D语义地图优化方法在处理感知和映射错误时存在局限性,导致生成的地图不够可靠。
- 本文提出VoxelFix,通过后处理的方式直接从已完成的3D体素地图中修正语义标签,保持几何形状不变。
- 实验结果显示,VoxelFix在多个语义类别上提升了4.23至5.00个百分点,尤其在树木、屋顶和墙壁类别上效果显著。
📝 摘要(中文)
随着自动化技术的发展,语义3D地图在航空机器人领域的构建越来越普遍。然而,现有的感知和映射流程中可能存在错误,导致生成的地图在下游自主任务中可靠性降低。现有的3D语义地图优化方法通常依赖于原始观测,或将占用信息视为预测问题的一部分,或对已完成的地图应用非学习的局部正则化。本文提出了一种后处理语义修正方法VoxelFix,旨在在保持几何形状和占用信息不变的情况下,从已完成的地图中恢复语义准确性。我们引入了一种基于图的模型,通过局部几何和邻近语义信息来修正体素标签。实验结果表明,VoxelFix在多个语义类别上均显著提升了mIoU,尤其在树木、屋顶和墙壁类别上表现突出。
🔬 方法详解
问题定义:本文旨在解决现有3D语义地图中由于感知和映射错误导致的语义不准确问题。现有方法依赖于原始观测或局部正则化,无法有效修正已完成地图中的语义标签。
核心思路:VoxelFix的核心思路是通过后处理方式,利用已完成地图的几何信息和邻近语义信息来修正体素标签,而不改变地图的几何形状和占用信息。
技术框架:VoxelFix的整体架构包括数据预处理、图模型构建、语义标签修正和结果输出四个主要模块。首先,通过对已标注的OccuFly地图进行区域腐蚀,生成训练对。然后,构建图模型以捕捉局部几何和邻近语义信息,最后进行标签修正。
关键创新:VoxelFix的主要创新在于其后处理语义修正方法,区别于现有方法的依赖于原始观测或局部正则化,能够在保持几何和占用信息的情况下直接修正语义标签。
关键设计:在训练过程中,采用了针对类混淆的区域腐蚀策略来生成训练对,损失函数设计上注重语义准确性,网络结构则基于图模型以有效整合局部几何和邻近信息。
🖼️ 关键图片
📊 实验亮点
在实验中,VoxelFix在多个语义类别上均实现了4.23至5.00个百分点的mIoU提升,尤其在树木、屋顶和墙壁类别上表现突出。这些结果表明,VoxelFix能够有效提升语义地图的准确性,并且在独立重建的分布外场景中也显示出良好的迁移能力。
🎯 应用场景
VoxelFix的研究成果在航空机器人、自动驾驶和智能城市等领域具有广泛的应用潜力。通过提高3D语义地图的准确性,可以增强机器人在复杂环境中的导航和决策能力,进而推动自主系统的智能化发展。未来,该方法还可能扩展到其他类型的3D数据处理和分析任务中。
📄 摘要(原文)
Semantic 3D maps are increasingly constructed automatically for aerial robotics by integrating learned semantic predictions into 3D representations. While this avoids costly manual 3D annotation, errors in the perception and mapping pipeline can persist in the resulting map, reducing its reliability for downstream autonomous tasks. Existing 3D semantic map refinement methods either rely on the original observations, treat occupancy as part of the prediction problem, or apply non-learned local regularization to completed maps. Instead, we study post-hoc semantic correction, asking whether semantic accuracy can be recovered directly from the completed map while keeping its geometry and occupancy fixed. We introduce \method, a graph-based model that corrects voxel labels based on local geometry and neighboring semantic information. To obtain training pairs, we corrupt contiguous regions of annotated OccuFly maps according to class confusions observed in upstream maps. We evaluate \method on completed OccuFly maps generated from predictions of four independently trained 2D segmentation models. \method consistently improves mIoU by 4.23--5.00 percentage points, with gains broadly distributed across the evaluated semantic classes and particularly strong improvements for tree, roof, and wall. Results on an independently reconstructed out-of-distribution aerial scene further suggest that the learned correction can transfer beyond the environments seen during training.