ELSA3D: Elastic Semantic Anchoring for Unified 3D Understanding and Generation

📄 arXiv: 2607.06565v1 📥 PDF

作者: Tianjiao Yu, Xinzhuo Li, Yifan Shen, Onkar Susladkar, Yuanzhe Liu, Xiaona Zhou, Ismini Lourentzou

分类: cs.CV, cs.AI, cs.LG

发布日期: 2026-07-07


💡 一句话要点

提出ELSA3D以解决3D理解与生成中的文本-3D交互问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 统一3D模型 弹性语义锚定 跨模态学习 几何推理 文本生成 3D生成 计算效率

📋 核心要点

  1. 现有的统一3D模型在文本与3D交互上存在隐式性,导致信息整合不充分。
  2. ELSA3D通过弹性语义锚定,结合语言和几何推理,提升了文本与3D的交互效果。
  3. 该模型在多个任务上表现优异,性能超越最强的基线,同时显著降低计算复杂度。

📝 摘要(中文)

统一的3D基础模型旨在通过单一骨干网络生成3D资产并进行语言推理,但其文本与3D的交互仍然较为隐式。现有方法将文本和3D标记连接成平面序列,依赖自注意力机制,导致粗略结构线索与细致几何细节混合为一个不区分的表示。我们提出ELSA3D,通过弹性语义锚定,沿匹配的抽象尺度共同构建语言和几何推理。ELSA3D使用尺度感知的八叉树标记器表示几何,并引入锚标记,作为稀疏跨模态单元选择语义线索,将其路由到最相关的3D尺度,检索特定尺度的几何证据,并将融合信号写回统一表示,保持交互稀疏而精确。ELSA3D在图像到3D生成、文本到3D生成和3D描述生成等任务上实现了最先进的性能,相较于非弹性版本,FLOPs和推理延迟大约减少了一半。

🔬 方法详解

问题定义:论文旨在解决统一3D模型中文本与3D交互的隐式性问题,现有方法将文本和3D信息混合,导致信息整合不充分。

核心思路:ELSA3D通过弹性语义锚定,将语言和几何推理沿匹配的抽象尺度进行结构化,确保信息的稀疏而精确的交互。

技术框架:ELSA3D的整体架构包括尺度感知的八叉树标记器和锚标记模块,锚标记作为稀疏跨模态单元,选择和路由语义线索,检索特定尺度的几何证据。

关键创新:ELSA3D的主要创新在于引入了弹性语义锚定和锚标记,使得文本与3D信息的交互更加精准和高效,解决了现有方法中信息混合的问题。

关键设计:模型设计中,采用了轻量级的每块路由器,能够灵活选择文本标记在不同几何尺度上的实例化,优化了计算和推理效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

ELSA3D在图像到3D生成、文本到3D生成和3D描述生成等任务上实现了最先进的性能,超越了最强的统一基线,同时FLOPs和推理延迟减少约50%,显示出显著的效率提升。

🎯 应用场景

ELSA3D的研究成果在多个领域具有广泛的应用潜力,包括虚拟现实、游戏开发、建筑设计和自动驾驶等。通过提升3D生成与理解的能力,该模型能够为相关行业提供更高效的工具,推动技术进步与创新。

📄 摘要(原文)

Unified 3D foundation models aspire to generate 3D assets and reason about them in language within a single backbone, but their text-3D interaction remains largely implicit. Existing methods concatenate text and 3D tokens into a flat sequence and rely on self-attention, collapsing coarse structural cues and fine geometric details into one undifferentiated representation. We introduce ELSA3D, a unified 3D model that addresses this with elastic semantic anchoring, structuring language and geometric reasoning jointly along matched abstraction scales. ELSA3D represents geometry with a scale-aware octree tokenizer and introduces Anchor Tokens, sparse cross-modal units that select semantic cues, route them to the most relevant 3D scale, retrieve scale-specific geometric evidence, and write the fused signal back into the unified representation, keeping interaction sparse yet precise. A lightweight per-block router makes both computation and reasoning elastic, choosing which text tokens instantiate anchors at which geometric scale so that cross-modal capacity concentrates where alignment is most needed. ELSA3D achieves state-of-the-art performance across image-to-3D generation, text-to-3D generation, and 3D captioning, outperforming the strongest unified baseline while roughly halving FLOPs and inference latency relative to the non-elastic version of the same model.