EmbodiedGen V2: An Agentic, Simulation-Ready 3D World Engine for Embodied AI

📄 arXiv: 2607.07459v1 📥 PDF

作者: Xinjie Wang, Liu Liu, Taojun Ding, Andrew Choi, Chaodong Huang, Mengao Zhao, Ziang Li, Jackson Jiang, Chunlei Yu, Shengxiang Liu, Wei Xu, Zhizhong Su

分类: cs.RO, cs.CV

发布日期: 2026-07-08


💡 一句话要点

提出EmbodiedGen V2以解决可执行仿真环境构建问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 生成式3D引擎 仿真环境 具身智能 在线强化学习 任务驱动世界 多房间场景 跨仿真器部署

📋 核心要点

  1. 现有的3D资产生成虽然快速发展,但将这些资产组装成可执行的任务环境仍然依赖人工,限制了闭环学习的可扩展性。
  2. EmbodiedGen V2提出了一种统一的仿真准备表示,连接多种资产和任务驱动的环境,形成一个可生成和重用的仿真管道。
  3. 实验结果显示,生成环境的使用使得仿真成功率显著提升,且在真实机器人上的任务成功率也有显著提高。

📝 摘要(中文)

我们提出了EmbodiedGen V2,这是一个用于构建可执行仿真环境的生成式3D世界引擎,旨在为具身智能提供支持。尽管仿真准备的3D资产生成已经取得了快速进展,但将这些资产组装成政策准备的任务环境仍然主要依赖人工,限制了可扩展的闭环学习。EmbodiedGen V2通过统一的仿真准备表示,连接跨仿真器资产、交互可用性、任务驱动的世界、大规模多房间场景和状态化的Vibe编码,形成一个生成、可编辑和可重用的仿真管道。生成的环境支持操控、导航、移动操控、跨仿真器部署和具身政策训练。评估结果显示,资产管道实现了96.5%的人工接受率和98.6%的碰撞成功率,83.3%的任务驱动世界可以直接用于下游仿真而无需人工修改。使用生成环境的在线强化学习进一步将仿真成功率从9.7%提升至79.8%,并在真实机器人上转移时任务成功率从21.7%提升至75.0%。这些结果确立了EmbodiedGen V2作为可扩展的仿真基础设施,用于训练、评估和部署具身政策。

🔬 方法详解

问题定义:论文要解决的问题是如何高效构建可执行的仿真环境,以支持具身智能的训练和评估。现有方法在资产组装上依赖人工,导致效率低下和可扩展性不足。

核心思路:EmbodiedGen V2的核心思路是通过统一的仿真准备表示,将不同的3D资产、交互可用性和任务驱动的环境连接起来,形成一个可生成和重用的仿真管道,从而简化环境构建过程。

技术框架:整体架构包括多个模块:跨仿真器资产生成、交互可用性定义、任务驱动环境构建、大规模多房间场景生成和状态化的Vibe编码。这些模块协同工作,形成一个完整的仿真环境生成流程。

关键创新:最重要的技术创新在于提出了统一的仿真准备表示,能够有效连接不同类型的资产和环境,解决了现有方法中资产组装的手动性问题。

关键设计:在设计中,采用了多种参数设置和损失函数,以优化生成环境的质量和可用性。同时,网络结构经过精心设计,以支持高效的3D资产生成和环境构建。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,EmbodiedGen V2的资产管道实现了96.5%的人工接受率和98.6%的碰撞成功率,83.3%的任务驱动世界无需人工修改即可直接使用。在线强化学习的应用使得仿真成功率从9.7%提升至79.8%,在真实机器人上的任务成功率从21.7%提升至75.0%。

🎯 应用场景

该研究的潜在应用领域包括机器人训练、虚拟现实、游戏开发等。EmbodiedGen V2能够为这些领域提供高效的仿真环境构建工具,提升智能体的训练效率和效果,具有重要的实际价值和广泛的未来影响。

📄 摘要(原文)

We present EmbodiedGen V2, a generative 3D world engine for building executable sim-ready environments for embodied intelligence. Sim-ready 3D asset generation has advanced rapidly, yet assembling such assets into policy-ready task environments remains largely manual, limiting scalable closed-loop learning. EmbodiedGen V2 addresses this gap through a unified sim-ready representation that connects cross-simulator assets, interaction affordances, task-driven worlds, large-scale multi-room scenes, and stateful Vibe Coding into a generative, editable, and reusable simulation pipeline. The generated environments support manipulation, navigation, mobile manipulation, cross-simulator deployment, and embodied policy training. In evaluation, the asset pipeline achieves 96.5% human acceptance and 98.6% collision success, and 83.3% of task-driven worlds are directly usable for downstream simulation without manual modification. Online reinforcement learning with generated environments further improves simulation success from 9.7% to 79.8%, and transfers to real robots with task success increasing from 21.7% to 75.0%. These results establish EmbodiedGen V2 as scalable simulation infrastructure for training, evaluating, and deploying embodied policies.