WorldSculpt: Generating Compositional Worlds from Grounded Videos
作者: Muyao Niu, Jixuan He, Ruihan Yu, Lian Fu, Yonghao Yu, Zheng-Hui Huang, Yifan Zhan, Fengbo Lan, Yongtao Ge, Yinqiang Zheng, Kaipeng Zhang, Zhixiang Wang
分类: cs.CV
发布日期: 2026-09-04
备注: Homepage: https://alaya-lab.github.io/WorldSculpt/; Github: https://github.com/AlayaLab/WorldSculpt
💡 一句话要点
提出WorldSculpt以解决复杂场景生成问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 3D场景生成 组合生成 多视角观察 对象网格 光照真实基准 复杂场景 遮挡处理
📋 核心要点
- 现有几何方法在处理复杂场景时,往往无法有效重建被遮挡区域的几何信息,导致场景表示不完整。
- 本研究提出了一种新的组合生成方法,通过将单对象3D生成先验适应于多视角观察,解决了复杂场景生成的问题。
- 实验结果表明,所提出的方法在多个基准测试中均优于现有方法,尤其在场景复杂性和遮挡程度增加时,性能提升显著。
📝 摘要(中文)
本研究探讨了从包含数百个对象的杂乱场景中生成组合3D表示的问题。目标是将场景表示为放置在共享世界框架中的单个对象网格,这对于游戏、增强现实/虚拟现实、仿真和机器人等下游应用至关重要。现有的几何方法通常将场景重建为单一表示,导致被遮挡区域的几何信息不完整,而现有的组合方法在复杂场景中表现有限。我们展示了通过将强大的单对象3D生成先验适应于多视角观察,可以生成复杂场景。我们使用Pixal3D实例化这一范式,并扩展了多视角条件路径,使对象生成基于多个姿态观察。尽管模型完全在典型空间中的单个对象上进行微调,但它在没有任何场景级训练的情况下,能够推广到严重遮挡的大场景,展示了这一范式的可行性和可扩展性。我们还引入了UE-MeshyScene,一个包含数百个对象的密集杂乱场景的光照真实基准,提供每个对象的注释和真实网格。在单对象、受控多对象和UE-MeshyScene评估中,我们的方法始终优于先前的方法,随着场景复杂性和遮挡的增加,性能提升更为显著。最后,我们通过将生成的3DGS世界(如Marble和HY-World 2.0)转换为组合网格场景,展示了更广泛的适用性。
🔬 方法详解
问题定义:本论文旨在解决从杂乱场景中生成组合3D表示的问题,现有方法在处理复杂场景时,往往无法有效重建被遮挡区域的几何信息,导致场景表示不完整。
核心思路:论文提出了一种新的组合生成方法,通过将强大的单对象3D生成先验适应于多视角观察,能够有效生成复杂场景。这样的设计使得模型能够利用多个视角的信息,克服了遮挡带来的挑战。
技术框架:整体架构包括多个主要模块:首先是多视角条件路径,用于从不同视角获取对象信息;其次是基于Pixal3D的生成网络,负责生成对象的3D网格;最后是后处理模块,用于优化生成结果并确保几何的一致性。
关键创新:最重要的技术创新点在于将单对象生成先验扩展到多视角观察,允许模型在没有场景级训练的情况下,处理复杂的遮挡场景。这一方法与现有方法的本质区别在于其组合生成的能力和对复杂场景的适应性。
关键设计:在模型设计中,采用了特定的损失函数来平衡生成质量与几何一致性,同时在网络结构上进行了优化,以提高对多视角信息的利用效率。
🖼️ 关键图片
📊 实验亮点
实验结果显示,所提出的方法在单对象、受控多对象和UE-MeshyScene评估中均优于现有方法,尤其在场景复杂性和遮挡程度增加时,性能提升显著,具体表现为在复杂场景中生成的3D网格质量更高,遮挡处理能力更强。
🎯 应用场景
该研究的潜在应用领域包括游戏开发、增强现实和虚拟现实场景构建、机器人导航与仿真等。通过生成高质量的3D场景表示,能够显著提升这些领域的用户体验和系统性能,具有重要的实际价值和未来影响。
📄 摘要(原文)
We study the problem of generating a compositional 3D representation of a cluttered scene containing hundreds of objects. The goal is to represent the scene as a collection of individual object meshes placed in a shared world frame, as required by downstream applications such as gaming, AR/VR, simulation, and robotics. This task is challenging in densely cluttered scenes, where objects heavily occlude one another and each view reveals only a fraction of their geometry. Geometry-based approaches typically reconstruct the scene as a single representation and leave incomplete geometry in occluded regions, while existing compositional methods with generative priors are largely limited to relatively simple scenes. We show that complex scenes with hundreds of objects can instead be generated compositionally by adapting a strong single-object 3D generative prior to multi-view observations. We instantiate this paradigm with Pixal3D, extending it with a multi-view conditioning pathway that grounds object generation in multiple posed observations. Although the model is finetuned entirely on single objects in canonical space, it generalizes to large scenes with severe occlusion without any scene-level training, demonstrating the feasibility and scalability of this paradigm. We further introduce UE-MeshyScene, a photorealistic benchmark of densely cluttered scenes with hundreds of objects, per-object annotations, and ground-truth meshes. Across single-object, controlled multi-object, and UE-MeshyScene evaluations, our method consistently outperforms prior approaches, with larger gains as scene complexity and occlusion increase. Finally, we demonstrate broader applicability by converting generated 3DGS worlds, such as Marble and HY-World 2.0, into compositional mesh scenes.