LetOccVote: Learning Weakly Supervised 3D Occupancy through Consensus
作者: Chi Zhang, Qi Song, Feifei Li, Jie Li, Rui Huang
分类: cs.CV
发布日期: 2026-09-04
💡 一句话要点
提出LetOccVote以解决弱监督3D占用预测问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 弱监督学习 3D占用预测 跨帧投票 伪标签 几何一致性 语义监督 自动驾驶 机器人导航
📋 核心要点
- 现有方法在使用不完美的2D伪标签作为监督时,容易受到几何和语义错误的影响,导致占用预测不准确。
- LetOccVote通过跨帧投票机制,利用观察一致性来提高伪标签的几何和语义监督,增强了模型的鲁棒性。
- 在Occ3D-nuScenes数据集上,LetOccVote实现了53.27的IoU和20.39的mIoU,显著提升了性能,超越了现有方法。
📝 摘要(中文)
弱监督3D占用预测通过利用视觉基础模型生成的2D伪标签,减少对昂贵3D标注的依赖。然而,现有方法通常直接使用这些不完美的伪标签作为监督,导致占用学习容易受到错误几何和语义目标的影响。我们观察到重复观察之间的一致性提供了评估伪标签可靠性的廉价且可靠的线索。基于此观察,我们提出了LetOccVote,一个基于高斯的弱监督占用框架,通过跨帧投票来改善几何和语义监督。在Occ3D-nuScenes数据集上,LetOccVote达到了53.27的IoU和20.39的mIoU,建立了在2D伪标签监督下的最先进性能。
🔬 方法详解
问题定义:论文旨在解决弱监督3D占用预测中对不完美2D伪标签的依赖问题,现有方法直接使用这些伪标签作为监督,导致学习过程受到错误目标的影响。
核心思路:LetOccVote的核心思路是通过跨帧投票机制来评估伪标签的可靠性,从而改善几何和语义监督的质量。通过利用观察之间的一致性,模型能够更好地过滤掉不可靠的伪标签。
技术框架:整体架构包括两个主要模块:Depth Vote和Semantic Vote。Depth Vote通过跨帧几何一致性来精炼伪深度,并在体积提升和深度监督之前拒绝矛盾的估计;Semantic Vote则在共享的3D空间中聚合伪语义观察,以识别可靠和有争议的证据。
关键创新:最重要的技术创新在于引入了跨帧投票机制,利用观察一致性来增强伪标签的可靠性,这与现有方法直接使用伪标签的方式有本质区别。
关键设计:在模型设计中,采用了高斯模型来处理投票过程,并设计了相应的损失函数以优化几何和语义监督的质量,确保模型在没有3D占用标注的情况下进行有效训练。
🖼️ 关键图片
📊 实验亮点
LetOccVote在Occ3D-nuScenes数据集上取得了53.27的IoU和20.39的mIoU,显著优于现有的2D伪标签监督方法,展示了其在弱监督学习中的有效性和潜力。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶、机器人导航和增强现实等场景。在这些领域中,准确的3D占用预测对于环境理解和决策制定至关重要。通过减少对昂贵3D标注的依赖,LetOccVote能够降低成本并提高模型的适应性,推动相关技术的发展。
📄 摘要(原文)
Weakly supervised 3D occupancy prediction reduces the reliance on costly 3D annotations by learning from 2D pseudo-labels generated by vision foundation models. However, existing methods typically use these imperfect pseudo-labels directly as supervision, making occupancy learning vulnerable to erroneous geometric and semantic targets. We observe that agreement across repeated observations provides an inexpensive and reliable cue for assessing pseudo-label reliability. Based on this observation, we propose \textbf{LetOccVote}, a weakly supervised Gaussian-based occupancy framework that leverages cross-frame voting to improve both geometric and semantic supervision. For geometry, Depth Vote exploits cross-frame geometric agreement to refine supported pseudo depth and reject contradictory estimates before volumetric lifting and depth supervision. For semantics, Semantic Vote aggregates pseudo-semantic observations in a shared 3D space to identify reliable and contested evidence, strengthening reliable semantic supervision while filtering unreliable pseudo-label segments. The entire framework is trained solely with 2D pseudo-label supervision without requiring 3D occupancy annotations. On Occ3D-nuScenes, LetOccVote achieves 53.27 IoU and 20.39 mIoU, establishing state-of-the-art performance among methods with 2D pseudo-label supervision.