GaussFusion: Towards Multimodal 3D Gaussian Pretraining
作者: Zhixuan You, Jihua Zhu, Yiding Sun, Zihao Guo, Haozhe Cheng, Dongxu Zhang, Lin Chen, Hainan Luo
分类: cs.CV
发布日期: 2026-07-07
备注: 32 pages, 6 figures, 6 tables
💡 一句话要点
提出GaussFusion以解决3D高斯表示的多模态预训练问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 3D高斯表示 多模态预训练 语义对齐 掩蔽建模 高斯显著性 深度学习 计算机视觉
📋 核心要点
- 现有的高斯表示预训练方法主要关注局部结构,缺乏有效的语义监督,限制了模型的表现力。
- GaussFusion通过跨模态语义对齐,将图像和文本信息整合到掩蔽高斯建模中,增强了模型的语义理解能力。
- 实验结果显示,GaussFusion在多个下游任务上显著提升了高斯表示的迁移能力,超越了现有基线方法。
📝 摘要(中文)
3D高斯点云表示提供了一种显式的几何和外观建模方式,是3D表示学习的可扩展基础。现有的高斯表示预训练方法,如掩蔽高斯重建,主要捕捉局部结构,但语义监督有限。本文提出GaussFusion,一个多模态预训练框架,通过跨模态语义对齐,将图像和文本监督整合到掩蔽高斯建模中,使高斯编码器在预训练过程中学习视觉和语言层面的语义信息。此外,提出的高斯显著性引导多尺度孔掩蔽(GSHM)方法,基于高斯显著性构建空间连续的掩蔽区域,鼓励编码器捕捉细粒度局部模式和更广泛的结构依赖。大量实验表明,GaussFusion提高了高斯表示的可迁移性,尤其在ModelNet40和ScanObjectNN(PB-T50-RS)上分别超越Gaussian-MAE 0.61%和3.85%。
🔬 方法详解
问题定义:本文旨在解决现有高斯表示预训练方法在语义监督不足和局部结构捕捉能力有限的问题。现有方法如掩蔽高斯重建未能有效利用图像和文本信息,导致模型的表现受到限制。
核心思路:GaussFusion的核心思想是通过跨模态语义对齐,将图像和文本监督融入掩蔽高斯建模中,使高斯编码器能够在预训练过程中同时学习视觉和语言层面的语义信息。
技术框架:GaussFusion的整体架构包括高斯编码器和多模态监督模块。首先,图像和文本信息通过语义对齐进行融合,然后在掩蔽高斯建模过程中应用高斯显著性引导多尺度孔掩蔽(GSHM),以增强模型对不同尺度特征的捕捉能力。
关键创新:本文的主要创新在于提出了GSHM方法,该方法通过构建基于高斯显著性的空间连续掩蔽区域,鼓励编码器捕捉细粒度局部模式和更广泛的结构依赖。这一设计显著提升了模型的学习效果。
关键设计:在GSHM中,掩蔽区域的构建考虑了高斯原语的非均匀分布,通过多尺度掩蔽策略,确保编码器能够有效学习不同层次的特征。此外,损失函数设计上也进行了优化,以适应多模态输入的特性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,GaussFusion在ModelNet40和ScanObjectNN(PB-T50-RS)数据集上分别超越Gaussian-MAE 0.61%和3.85%。这一显著提升证明了多模态预训练在提高高斯表示迁移能力方面的有效性,展现了该方法在实际应用中的潜力。
🎯 应用场景
GaussFusion的研究成果在多个领域具有广泛的应用潜力,包括自动驾驶、机器人视觉、增强现实等。通过提升3D表示的语义理解能力,该方法能够为复杂场景的理解和交互提供更为准确和丰富的信息,推动相关技术的发展和应用。未来,GaussFusion有望在更大规模的3D数据集上进行验证,进一步提升其实际应用价值。
📄 摘要(原文)
3D Gaussian Splatting provides an explicit representation that jointly models geometry and appearance, serving as a scalable foundation for 3D representation learning. Existing pre-training methods for Gaussian representations, such as masked Gaussian reconstruction, primarily capture local structures but offer limited semantic supervision. In this paper, we propose GaussFusion, a multimodal pre-training framework for 3D Gaussian representations. GaussFusion integrates image and text supervision into masked Gaussian modeling through cross-modal semantic alignment, enabling the Gaussian encoder to learn both visual and language-level semantic information during pre-training. To better adapt masked modeling to the non-uniform distribution of Gaussian primitives, we further propose Gaussian Salience-guided Multi-scale Hole Masking (GSHM). GSHM constructs spatially continuous masked regions based on Gaussian salience. By applying hole masks at multiple scales, GSHM encourages the encoder to capture both fine-grained local patterns and broader structural dependencies. Extensive experiments on downstream tasks demonstrate that GaussFusion improves the transferability of Gaussian representations. Notably, GaussFusion outperforms Gaussian-MAE on ModelNet40 and ScanObjectNN (PB-T50-RS) by 0.61\% and 3.85\%, respectively.