Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents

📄 arXiv: 2607.19190v1 📥 PDF

作者: Guanxiong Chen, Qianjun Xia, Jiawei Peng, Heng Zhang, Bole Ma, Justin Qian, Ziyi Jiao, Bingyang Zhou, Luoxin Ye, Kaifeng Zhang, Kunyi Wang, Weijia Zeng, Yunuo Chen, Pengzhi Yang, Ziqiu Zeng, Huamin Wang, Chao Liu, Alan Yuille, Fan Shi, Changxi Zheng, Yunzhu Li, Chenfanfu Jiang, Peter Yichen Chen

分类: cs.RO, cs.AI

发布日期: 2026-07-21

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出Agentic Real2Sim以解决机器人与物体交互的真实到仿真转换问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 真实到仿真 机器人交互 视觉-语言模型 物理仿真 自动化转换

📋 核心要点

  1. 现有的真实到仿真转换方法依赖于手动调节视觉基础模型,工作流程脆弱,效率低下。
  2. Agentic Real2Sim框架通过视觉-语言代理实现了真实世界记录的自动化转换,简化了仿真准备过程。
  3. 在多个领域的实验中,该框架展示了较高的转换成功率,且成本显著低于现有方法。

📝 摘要(中文)

机器人与物体交互的真实到仿真转换仍然是一个劳动密集型的过程,涉及场景几何和物体状态的恢复、物理参数的推断等。本文提出了Agentic Real2Sim框架,通过视觉-语言代理将真实世界的记录转换为可模拟的情节双胞胎,保留观察、几何、机器人交互和物体状态。该框架在刚性物体操控、可变形物体交互和类人动作场景上进行了评估,标志着可扩展转换的第一步。Agentic Real2Sim的决策由开放权重的视觉语言模型驱动,成本远低于前沿模型,同时实现了可比的转换成功率。

🔬 方法详解

问题定义:本文旨在解决机器人与物体交互的真实到仿真转换过程中的高劳动强度和低效率问题。现有方法需要手动调节和复杂的工作流程,导致转换过程繁琐且不稳定。

核心思路:Agentic Real2Sim框架利用视觉-语言代理自动化处理真实世界的记录,生成可模拟的情节双胞胎,保留重要的场景信息和物理交互。通过这种方式,减少了人工干预,提高了转换效率。

技术框架:该框架包括多个模块,首先是数据采集模块,获取真实世界的交互记录;接着是视觉-语言模型模块,负责解析和理解场景信息;最后是物理仿真模块,将解析结果转化为可运行的仿真环境。

关键创新:最重要的创新在于引入了开放权重的视觉-语言模型,显著降低了转换成本,同时保持了与前沿模型相当的转换成功率。这一设计使得框架更具可扩展性和实用性。

关键设计:在设计中,采用了特定的损失函数来优化场景几何和物体状态的恢复,网络结构则结合了视觉和语言信息的融合,以提高模型的理解能力和转换精度。具体参数设置和网络架构细节在论文中进行了详细描述。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

在实验中,Agentic Real2Sim在刚性物体操控和可变形物体交互场景中表现出色,转换成功率与现有方法相当,但成本仅为前沿模型的一小部分。这一成果标志着真实到仿真转换的一个重要进展。

🎯 应用场景

Agentic Real2Sim框架在机器人领域具有广泛的应用潜力,特别是在政策学习和评估等任务中。通过生成与真实世界对齐的仿真双胞胎,研究人员可以更高效地进行机器人训练和测试,推动智能机器人技术的发展。

📄 摘要(原文)

Real-to-sim conversion for robotic interaction with objects remains labor-intensive because it requires more than visual reconstruction: a streamlined real2sim process must recover scene geometries and object states, infer physical parameters, and assemble actors, objects, cameras, poses, and trajectories into a runnable physical simulation. Today this process still depends on manual tuning of visual foundation models, mesh cleanup, coordinate-frame alignment, and brittle workflow glue across visual perception tools and simulators. We introduce \textit{Agentic Real2Sim}, a framework for generalized physical world modeling with vision-language agents, converting a real-world recording of object-robot interaction into a simulatable episodic twin which preserves observations, geometries, robot interactions, and object states. We evaluate Agentic Real2Sim on rigid-object manipulation, deformable-object interaction, and humanoid motion scenes, spanning domains that are usually handled by separate Real2Sim pipelines, marking a first step toward scalable conversion. The framework's agentic decisions can be driven by an open-weight VLM backend at a small fraction of the cost of frontier models, while attaining comparable conversion success rate. We aim to use the resulting real-world-aligned twins for downstream robotics tasks, specifically policy learning and evaluation. The project site is available at https://ericchen321.github.io/agentic_real2sim.github.io/.