GHOST: Geometry-Guided Hallucination of Opaque Surface Textures

📄 arXiv: 2607.11118v1 📥 PDF

作者: Langxu Zhao, Zuan Gu, Tianhan Gao

分类: cs.CV

发布日期: 2026-07-13


💡 一句话要点

提出GHOST框架以解决透明物体深度估计问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 透明物体 深度估计 三维重建 几何引导 视觉基础模型 多模态融合 图像合成

📋 核心要点

  1. 透明物体的深度估计和三维重建面临严重挑战,现有方法在处理透明区域时效果不佳。
  2. 本文提出的GHOST框架通过几何引导的方式,将透明区域转化为结构一致的不透明表示,避免了下游模型的重新训练。
  3. 实验结果显示,GHOST方法在透明物体的深度估计和重建上显著提升了准确性,恢复了重要的光度线索。

📝 摘要(中文)

透明物体在深度估计和三维重建中面临基本挑战,因为它们违反了朗伯假设,导致下游任务中的几何退化。为了解决这一问题,本文提出了一种新颖的几何引导预处理框架GHOST,该框架利用视觉基础模型将透明区域转化为不透明且结构一致的表示,而无需对下游模型进行重新训练。具体而言,本文的方法利用TransDINO和TransDecomp来解耦掩膜和透明物理属性,同时DAF-Net恢复表面法线先验以编码几何曲率。随后,GeoSemTransNet整合这些多模态线索,合成一个富有纹理的不透明RGB图像,保留透明物体的三维结构。大量实验表明,该方法显著提高了现有深度估计和重建模型在透明物体上的准确性。

🔬 方法详解

问题定义:本文旨在解决透明物体在深度估计和三维重建中的几何退化问题。现有方法由于透明性导致的光学特性变化,无法有效处理透明区域,影响了最终的重建效果。

核心思路:GHOST框架通过几何引导的预处理,将透明区域转化为不透明且结构一致的表示,利用视觉基础模型进行处理,从而避免了对下游模型的重新训练。

技术框架:GHOST框架包含多个模块:首先,TransDINO和TransDecomp用于解耦掩膜和透明物理属性;接着,DAF-Net恢复表面法线先验以编码几何曲率;最后,GeoSemTransNet整合多模态线索,合成纹理丰富的不透明RGB图像。

关键创新:GHOST的主要创新在于其几何引导的处理方式,能够在不需要重新训练下游模型的情况下,显著改善透明物体的深度估计和重建效果。这一方法与传统的处理方式有本质区别。

关键设计:在设计中,采用了多种网络结构和损失函数,以确保透明物体的几何信息和光度信息能够被有效恢复,具体参数设置和网络结构细节在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,GHOST方法在透明物体的深度估计和重建上,相较于现有最先进模型,准确性提升了显著的百分比,具体性能数据在实验部分详细列出,展示了其优越性。

🎯 应用场景

该研究的潜在应用领域包括增强现实、虚拟现实以及机器人视觉等场景,能够有效提升透明物体的识别和重建精度,具有重要的实际价值。未来,该方法可能在自动驾驶、智能监控等领域发挥更大作用。

📄 摘要(原文)

Transparent objects pose a fundamental challenge for depth estimation and 3D reconstruction due to their violation of Lambertian assumptions, leading to severe geometry degradation in downstream tasks. To address this, we propose a novel geometry-guided preprocessing framework \textbf{GHOST} that leverages visual foundation models to transform transparent regions into opaque, structurally consistent representations without requiring downstream model retraining. Specifically, our pipeline utilizes (1) \textbf{TransDINO} and (2) \textbf{TransDecomp} to disentangle masks and transparency physical properties, while (3) \textbf{DAF-Net} recovers surface normal priors to encode geometric curvature. Subsequently, (4) \textbf{GeoSemTransNet} integrates these multi-modal cues to synthesize a texture-rich opaque RGB image that preserves the transparent object's 3D structure. Extensive experiments demonstrate that our method significantly enhances the accuracy of state-of-the-art depth estimation and reconstruction models on transparent objects by restoring essential photometric cues.