RayOcc: Occlusion-Aware Ray Occupancy Estimation via Gaussian Mixture Intensity

📄 arXiv: 2607.17660v1 📥 PDF

作者: Junho Kim, Seongwon Lee

分类: cs.CV

发布日期: 2026-07-20

备注: Accepted to IROS 2026


💡 一句话要点

提出RayOcc以解决相机3D语义占用预测中的遮挡问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 3D语义占用预测 遮挡感知 高斯混合模型 深度学习 自动驾驶

📋 核心要点

  1. 现有方法通常假设每条光线只有一个主导深度,无法有效处理复杂遮挡场景。
  2. RayOcc通过将光线建模视为多标签存在预测,允许多个占用假设共存,克服了单一深度假设的限制。
  3. 在nuScenes基准测试中,RayOcc在IoU和mIoU指标上均超过了其他高斯占用方法,显示出显著的性能提升。

📝 摘要(中文)

基于相机的3D语义占用预测旨在从多视角图像中推断体素级场景语义,但由于深度模糊和遮挡问题,这一任务依然具有挑战性。沿着单个相机光线,多个空间上分离的表面可能共存,使得占用问题本质上是一个多标签存在问题,而非单一深度估计任务。为了解决这一限制,本文提出了RayOcc,一个遮挡感知的光线占用框架,将光线建模重新定义为多标签存在预测。RayOcc通过沿每条光线估计非归一化的高斯混合强度,并通过泊松事件公式将其转换为区间占用概率,从而允许多个占用假设共存,而不强制深度之间的相互竞争。实验结果表明,RayOcc在nuScenes基准测试中实现了与现有高斯占用方法相比的最先进的整体IoU和mIoU。

🔬 方法详解

问题定义:本文旨在解决相机仅依赖的3D语义占用预测中的深度模糊和遮挡问题。现有方法通常假设每条光线只有一个主导深度,无法有效建模复杂场景中的多重占用情况。

核心思路:RayOcc的核心思想是将光线建模重新定义为多标签存在预测,而非单一深度估计。通过估计高斯混合强度,RayOcc能够同时处理多个占用假设,避免了深度之间的相互竞争。

技术框架:RayOcc的整体架构包括光线建模、非归一化高斯混合强度估计、泊松事件公式转换为占用概率、以及稀疏3D高斯原语的初始化与细化。每个模块协同工作,实现了高效的语义占用预测。

关键创新:RayOcc的主要创新在于其高斯混合强度的估计方法,使得多个占用假设能够共存。这一设计与传统方法的单一深度假设形成了鲜明对比,极大地提升了对复杂场景的建模能力。

关键设计:在技术细节上,RayOcc采用了非归一化的高斯混合模型,并通过泊松事件公式进行概率转换。损失函数设计上,重点考虑了多标签存在的特性,以确保模型能够有效学习到多个占用假设。网络结构上,采用了适应性强的深度学习框架,以支持复杂场景的处理。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

RayOcc在nuScenes基准测试中表现出色,整体IoU和mIoU指标均达到了最先进水平,超越了其他高斯占用方法。这表明RayOcc在处理复杂遮挡场景时具有显著的性能优势,提升幅度明显,展示了其在实际应用中的潜力。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、机器人导航和增强现实等。通过提高3D语义占用预测的准确性,RayOcc能够在复杂环境中提供更可靠的场景理解,进而提升智能系统的决策能力和安全性。未来,该方法可能会在更多实际应用中发挥重要作用,推动相关技术的发展。

📄 摘要(原文)

Camera-only 3D semantic occupancy prediction aims to infer voxel-wise scene semantics from multi-view images, yet remains fundamentally challenging due to depth ambiguity and occlusion. Along a single camera ray, multiple spatially separated surfaces may coexist, making occupancy inherently a multi-label existence problem rather than a single-depth estimation task. However, most existing approaches favor a single dominant depth hypothesis per ray, limiting their ability to model volumetric scenes under complex occlusion. To address this limitation, we introduce RayOcc, an occlusion-aware ray occupancy framework that reformulates ray modeling as multi-label existence prediction. Instead of predicting a categorical depth distribution, RayOcc estimates a non-normalized Gaussian mixture intensity along each ray and converts it into interval-wise occupancy probabilities via a Poisson event formulation, allowing multiple occupied hypotheses to coexist without enforcing mutual competition across depth. The predicted mixture components are interpreted as occupancy hypotheses to initialize sparse 3D Gaussian primitives, which are refined and rasterized for semantic occupancy prediction. Experiments on the nuScenes benchmark show that RayOcc achieves state-of-the-art overall IoU and mIoU among the compared Gaussian-based occupancy methods.