MSVS-VAE: Multi-Scale Anchored VecSet for High-Fidelity 3D Reconstruction
作者: Dehao Hao, Kaiyi Zhang, Tanghui Jia, Xiangjun Gao, Dongyu Yan, Weikai Chen, Zeyu Hu, Lingting Zhu, Yingda Yin, Runze Zhang, Li Yuan, Xin Wang, Long Quan
分类: cs.CV
发布日期: 2026-07-27
💡 一句话要点
提出MSVS-VAE以解决高保真3D重建中的重构质量瓶颈问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 3D重建 变分自编码器 潜在扩散 几何建模 深度学习
📋 核心要点
- 现有的3D重建方法在重构质量上存在显著瓶颈,尤其是在潜在扩散范式下。
- MSVS-VAE通过分层点洗牌上采样逐步密集化潜变量,提升了几何建模的精细度。
- 实验结果表明,MSVS-VAE在多个基准测试中均优于先前方法,解码速度和紧凑性显著提升。
📝 摘要(中文)
高保真3D生成建模越来越依赖潜在扩散范式,其中基础3D变分自编码器的重构质量成为主要瓶颈。现有方法主要遵循两种范式:稀疏体素表示实现了强大的重构质量,但带来了显著的内存和计算开销;而基于集合的表示则紧凑且连续,但由于潜在稀疏性和过度的全局平滑性,通常在保真度上滞后。我们提出了MSVS-VAE,这是一种分层集合基础的变分自编码器,能够在不牺牲紧凑性的情况下缩小这一保真度差距。我们的关键思想是通过分层点洗牌上采样逐步密集化锚定的VecSet潜变量,从而增加细粒度几何建模的空间容量。通过引入多尺度查询解码,我们的模型在Objaverse、ABO和野外基准测试中表现出色,解码速度比先前的集合基础方法快约10倍,且比体素基础基线高出约10倍的紧凑性。
🔬 方法详解
问题定义:本论文旨在解决高保真3D重建中的重构质量瓶颈,现有方法在稀疏体素表示和集合表示之间存在权衡,导致重构质量和计算效率的矛盾。
核心思路:我们提出MSVS-VAE,通过分层点洗牌上采样逐步密集化锚定的VecSet潜变量,增加空间容量以支持细粒度几何建模,同时引入AVS-Conv替代全局交叉注意力,提升解码效率。
技术框架:MSVS-VAE的整体架构包括分层潜变量密集化、AVS-Conv局部聚合、以及多尺度查询解码三个主要模块。分层结构允许从粗到细逐步解码,增强了模型的几何表达能力。
关键创新:最重要的创新在于引入了AVS-Conv这一几何感知的局部聚合算子,能够在局部邻域内进行有效的信息聚合,避免了全局计算的高开销。
关键设计:在模型设计中,我们设置了多尺度查询解码机制,粗尺度提供稳定的全局上下文,而细尺度则用于精细化局部几何,减少了因过于局部的感受野带来的伪影。我们还优化了损失函数以平衡重构质量与计算效率。
🖼️ 关键图片
📊 实验亮点
实验结果显示,MSVS-VAE在Objaverse、ABO和野外基准测试中均表现优异,解码速度比先前的集合基础方法快约10倍,同时在紧凑性上比体素基础基线高出约10倍,展现了显著的性能提升。
🎯 应用场景
该研究的潜在应用领域包括虚拟现实、游戏开发、建筑设计等需要高保真3D重建的场景。通过提升3D重建的效率和质量,MSVS-VAE能够为相关行业提供更为精确的模型支持,推动相关技术的发展和应用。未来,该技术可能在自动驾驶、机器人导航等领域发挥重要作用。
📄 摘要(原文)
High-fidelity 3D generative modeling increasingly relies on the latent diffusion paradigm, where the reconstruction quality of the underlying 3D VAE becomes a primary bottleneck. Existing approaches largely follow two paradigms: sparse voxel-based representations achieve strong reconstruction quality but incur significant memory and computational overhead, while set-based representations are compact and continuous yet typically lag in fidelity due to latent sparsity and excessive global smoothness. We propose MSVS-VAE, a hierarchical set-based VAE that closes this fidelity gap without sacrificing compactness. Our key idea is to progressively densify anchored VecSet latents via hierarchical point-shuffle upsampling, increasing spatial capacity for fine-grained geometry modeling. To efficiently decode from the densified hierarchy, we replace global cross-attention with AVS-Conv, a geometry-aware local aggregation operator operating within local neighborhoods rather than the exhaustive latent set. We further introduce multi-scale query decoding to fuse coarse-to-fine latent features, where coarse scales provide stable global context, and fine scales refine localized geometry, reducing artifacts from overly local receptive fields. Extensive experiments on Objaverse, ABO, and in-the-wild benchmarks demonstrate that MSVS-VAE consistently outperforms prior set-based and voxel-based VAEs, delivering approximately 10x faster decoding than prior set-based methods and approximately 10x higher compactness than voxel-based baselines.