SceneHI: High-Resolution 3D-Consistent Scene Texturing with Controllable Illumination
作者: Athanasios Tragakis, Marco Aversa, Daniela Ivanova, Chaitanya Kaul, Roderick Murray-Smith, Daniele Faccio, Paul Henderson
分类: cs.CV, cs.GR
发布日期: 2026-09-09
备注: ECCV 2026
💡 一句话要点
提出SceneHI框架以解决高分辨率3D纹理合成问题
🎯 匹配领域: 支柱四:生成式动作 (Generative Motion)
关键词: 3D纹理合成 高分辨率生成 光照感知 扩散模型 几何一致性 虚拟现实 游戏开发
📋 核心要点
- 现有方法在生成高分辨率3D纹理时面临模型微调和优化的挑战,限制了其应用。
- 论文提出的SceneHI框架通过引入高分辨率潜在纹理和精确的像素映射,解决了3D纹理合成中的一致性问题。
- 实验结果表明,SceneHI在视觉保真度上表现优异,并且生成时间比现有场景级方法减少了80%。
📝 摘要(中文)
SceneHI是一个框架,通过从2D扩散模型中提取高分辨率、光照感知的先验知识,实现3D纹理合成。该框架首次展示了高分辨率纹理可以直接在3D物体上生成,而无需模型微调或优化。SceneHI专为复杂的多物体环境设计,独特地将3D一致性、高分辨率保真度和物理上合理的阴影整合在一个生成管道中。为确保严格的几何一致性,论文引入了一种精确的像素到纹理单元映射,能够在多个视角间对齐扩散轨迹。最终,SceneHI在视觉保真度上取得了显著提升,并将生成时间减少了80%。
🔬 方法详解
问题定义:本论文旨在解决高分辨率3D纹理合成中的一致性和生成效率问题。现有方法通常需要复杂的模型微调和优化,导致生成时间长且效果不稳定。
核心思路:SceneHI框架的核心思想是将高分辨率、光照感知的2D扩散模型先验知识提升至3D纹理合成中,确保在多个视角下的几何一致性。
技术框架:该框架包括多个主要模块:首先,通过高分辨率潜在纹理(HRLTs)作为基础画布进行逐步去噪;其次,利用相机视角在潜在像素空间中执行去噪步骤;最后,进行光照感知的生成过程,将几何一致的阴影嵌入到纹理图集中。
关键创新:最重要的技术创新在于引入了一种精确的像素到纹理单元映射方法,能够在多个视角之间对齐扩散轨迹,从而实现严格的几何一致性。
关键设计:在技术细节上,论文设计了特定的损失函数以优化去噪过程,并确保在多视角下的纹理一致性,同时采用了高效的网络结构以提高生成速度。
🖼️ 关键图片
📊 实验亮点
实验结果显示,SceneHI在视觉保真度上达到了显著提升,同时生成时间比现有场景级方法减少了80%。这一性能提升使得SceneHI在实际应用中更具竞争力,能够满足高质量3D内容生成的需求。
🎯 应用场景
SceneHI框架在虚拟现实、游戏开发及电影制作等领域具有广泛的应用潜力。其高效的3D纹理合成能力能够显著提升场景的视觉质量,缩短制作周期,推动相关行业的创新与发展。
📄 摘要(原文)
SceneHI is a framework that lifts high-resolution, illumination-aware priors from 2D diffusion models to perform 3D texture synthesis. It is the first to demonstrate that high-resolution textures, previously limited to 2D synthesis, can be generated directly on 3D objects without model fine-tuning or optimization. Designed for complex, multi-object environments, SceneHI uniquely combines 3D-consistency, high-resolution fidelity, and physically plausible baked shadows within a single generative pipeline. To enforce strict geometric coherence, we introduce an exact analytical pixel-to-texel mapping that aligns diffusion trajectories across multiple viewpoints. We utilize High-Resolution Latent Textures (HRLTs) as a persistent canvas for gradually denoised textures, while camera views perform the denoising steps in latent pixel space. This ensures a shared base texture that can be subsequently refined to high resolution without compromising multi-view consistency. Finally, a light-aware generative pass embeds realistic geometry-consistent shadows directly into the atlases, bridging the gap to production workflows. SceneHI achieves high visual fidelity while reducing generation time by 80% compared to existing scene-level methods.