UMI3D: Robust 3D Generation on Unconstrained Multi-Image Inputs via Simultaneous Focus Cross-Attention Routing

📄 arXiv: 2607.24298v1 📥 PDF

作者: Zefan Qu, Zhenwei Wang, Gerhard Petrus Hancke, Rynson W. H. Lau

分类: cs.CV

发布日期: 2026-07-27

备注: Project Page: https://umi3d-project.github.io/


💡 一句话要点

提出UMI3D以解决多图像输入下3D生成质量下降问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 3D生成 多图像输入 交叉注意力 体素参考分数 虚拟现实 建筑可视化

📋 核心要点

  1. 现有的3D生成模型在处理多图像输入时,常常出现几何失真和纹理平滑等问题,导致生成质量下降。
  2. UMI3D通过同时聚焦交叉注意力机制,允许每个体素选择最相关的图像,从而提升多图像输入下的生成效果。
  3. 实验结果显示,UMI3D在多种任务上显著提高了生成质量,充分发挥了单图像3D生成模型的潜力。

📝 摘要(中文)

近年来的3D基础模型能够从单幅图像生成高质量的资产,但在处理不受约束的多图像输入时表现显著下降,常常导致几何形状失真、纹理过于平滑和颜色混乱。我们认为这种失败并非源于模型能力的限制,而是单图像交叉注意力与多图像设置之间的不匹配:现有模型缺乏在每个去噪步骤中决定每个3D体素应信任哪个图像的原则性方法。基于这一观察,我们提出了UMI3D,一个无需训练的即插即用框架,通过重构交叉注意力来实现不受约束的多图像3D生成。其核心是同时聚焦交叉注意力(SFC-Attn),在每个去噪步骤中激活所有条件图像,同时允许每个体素专注于最佳解释其内容的单幅图像。我们还推导了体素参考分数(VRS),这是一个无需外部匹配、分割或对应模型的体素-图像亲和度的模型内在度量。大量实验表明,UMI3D能够充分发挥单图像3D生成框架在多图像输入下的潜力。

🔬 方法详解

问题定义:论文要解决的问题是现有3D生成模型在处理不受约束的多图像输入时,生成质量显著下降的问题。现有方法在每个去噪步骤中缺乏有效的机制来决定每个3D体素应信任哪个图像,导致生成的几何形状和纹理出现失真。

核心思路:论文的核心思路是通过同时聚焦交叉注意力机制(SFC-Attn),在每个去噪步骤中激活所有条件图像,同时允许每个体素选择最能解释其内容的单幅图像。这样设计的目的是为了更好地处理多图像输入的不一致性。

技术框架:UMI3D的整体架构包括多个模块,核心模块为SFC-Attn,此外还引入了体素参考分数(VRS)来评估体素与图像之间的亲和度。整个流程包括输入多幅图像、计算VRS、执行去噪和生成3D模型等步骤。

关键创新:UMI3D的最重要技术创新在于引入了VRS作为体素-图像亲和度的度量,这一创新使得模型能够在多图像输入下有效选择最相关的图像,从而显著提升生成质量。这与现有方法的本质区别在于,现有方法通常依赖于外部匹配或分割模型,而UMI3D则完全依赖于模型内部的度量。

关键设计:在关键设计方面,UMI3D的VRS计算不需要外部匹配或分割,简化了模型的复杂性。此外,SFC-Attn的设计允许在每个去噪步骤中同时考虑所有图像,增强了模型的灵活性和适应性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,UMI3D在多图像输入下的生成质量显著提升,相较于基线模型,几何形状的准确性提高了XX%,纹理细节的保留率提升了YY%。这些结果表明UMI3D能够有效地解锁单图像3D生成框架在多图像输入下的潜力。

🎯 应用场景

该研究的潜在应用领域包括虚拟现实、游戏开发、建筑可视化等,能够为这些领域提供高质量的3D资产生成解决方案。UMI3D的创新框架不仅提升了多图像输入下的生成效果,还为未来的3D生成模型设计提供了新的思路,具有重要的实际价值和影响。

📄 摘要(原文)

Recent 3D foundation models can generate high-quality assets from a single image, but degrade markedly on unconstrained multi-image inputs, often producing distorted geometry, over-smoothed textures, and chaotic colors. We argue that this failure stems not from limited model capacity, but from a mismatch between single-image cross-attention and the multi-image setting: existing models lack a principled way to decide which image each 3D voxel should trust at each denoising step. Revisiting recent single-image 3D foundation models, we show that explicitly routing each voxel to its most informative image is sufficient to unlock strong performance on inconsistent multi-image inputs. Based on this observation, we propose UMI3D, a training-free and plug-and-play framework that restructures cross-attention for unconstrained multi-image 3D generation. Its core, Simultaneous Focus Cross-Attention (SFC-Attn), activates all conditioning images at each denoising step while allowing each voxel to focus on the single image that best explains it. To enable this routing, we derive the Voxel Reference Score (VRS), a model-intrinsic metric for voxel--image affinity that requires no external matching, segmentation, or correspondence models. Extensive experiments show that UMI3D unlocks the multi-image potential of single-image 3D generation frameworks across diverse tasks. Project Page: UMI3D-Project.github.io.