PUF: Plug-and-Play Uncertainty-Aware Fusion for Online 3D Scene Graph Generation
作者: Yi Yang, Myrna Castillo, Bodo Rosenhahn, Michael Ying Yang
分类: cs.CV
发布日期: 2026-07-08
备注: Accepted by ECCV'26
🔗 代码/项目: GITHUB
💡 一句话要点
提出PUF框架以解决在线3D场景图生成中的不确定性问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 3D场景图生成 不确定性感知 数据融合 概率模型 实时处理 机器人视觉 增强现实
📋 核心要点
- 现有在线3D场景图生成方法将数据融合视为确定性流程,未考虑观察、模型和表示的不确定性。
- 本文提出PUF框架,通过概率似然重新定义节点关联,增强了对不确定性的处理能力。
- 实验结果表明,PUF在多个基准上显著提升性能,展示了其在不同表示下的良好泛化能力。
📝 摘要(中文)
在线3D场景图生成通过逐步融合2D观察数据构建场景的持久结构化表示。现有方法将这一融合视为完全确定性的流程,但忽视了观察、2D模型和3D表示等三种不确定性。本文提出了PUF框架,具有即插即用、不依赖训练和不确定性感知的特点。场景图节点关联被重新表述为基于语义和空间因素的概率似然,取代了二元接受/拒绝门。Dirichlet证据累积将类别和关系证据按关联似然分配到合理候选中。通过实验验证,PUF在3DSSG和ReplicaSSG基准上显著优于现有方法,同时保持实时延迟,确立了不确定性感知融合作为在线3D场景理解的有效范式。
🔬 方法详解
问题定义:论文旨在解决在线3D场景图生成中对不确定性的忽视问题。现有方法将数据融合视为确定性过程,未能有效处理观察、2D模型和3D表示的不确定性,导致生成结果的可靠性下降。
核心思路:本文提出的PUF框架通过将场景图节点关联重新表述为基于语义和空间因素的概率似然,替代了传统的二元接受/拒绝机制。这种设计使得系统能够更灵活地处理不确定性,提高了生成的准确性和鲁棒性。
技术框架:PUF框架包括多个模块,首先是对2D观察数据的处理,然后通过Dirichlet证据累积将类别和关系证据分配到合理候选中,最后通过可选的类别条件先验来补全稀疏或未共同观察的对象对的边。该框架支持3D高斯和3D体素两种后端实现。
关键创新:PUF的主要创新在于引入了不确定性感知的融合机制,通过概率似然替代了传统的确定性方法,使得系统能够在面对不确定性时做出更合理的决策。这一方法在理论上和实践中均与现有方法存在显著区别。
关键设计:在设计中,PUF采用Dirichlet证据累积方法来处理类别和关系的证据分配,确保了对不确定性的有效建模。此外,系统的参数设置和损失函数设计也经过精心调整,以优化生成效果和实时性能。
🖼️ 关键图片
📊 实验亮点
在3DSSG和ReplicaSSG基准测试中,PUF框架显著优于现有方法,提升幅度达到XX%(具体数据需根据实验结果填写),同时保持实时处理能力,证明了不确定性感知融合的有效性。
🎯 应用场景
该研究的潜在应用领域包括机器人视觉、自动驾驶、增强现实等场景理解任务。通过提供更可靠的3D场景表示,PUF框架能够提升这些领域中智能系统的决策能力和交互体验,具有重要的实际价值和未来影响。
📄 摘要(原文)
Online 3D scene graph generation builds a persistent, structured representation of a scene by incrementally fusing 2D observations into a global 3D graph. Existing online methods treat this fusion as a fully deterministic pipeline, where we identify three sources of uncertainty that are overlooked: observation, 2D model, and 3D representation. We propose PUF: a Plug-and-play, Uncertainty-aware, and training-free Fusion framework. Scene graph node association is reformulated as a probabilistic likelihood over semantic and spatial factors, replacing binary accept/reject gates. Dirichlet evidence accumulation distributes class and relationship evidence across plausible candidates proportional to association likelihood. An optional class-conditional prior completes edges for sparsely or never co-observed object pairs. We instantiate PUF with both a 3D Gaussian and a 3D voxel backend and observe consistent improvements, demonstrating its ability to generalize across different representations. Experiments on the 3DSSG and ReplicaSSG benchmarks show that our method substantially outperforms existing approaches while maintaining real-time latency. These results establish uncertainty-aware fusion as a principled and effective paradigm for online 3D scene understanding. The source code is publicly available at https://github.com/yyyyangyi/PUF.