KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding
作者: Zeyu Liu, Zhangzhe Zhu, Yang Zhang, Chenyou Fan, Chenjia Bai, Xuelong Li
分类: cs.RO, cs.CV
发布日期: 2026-07-22
备注: Accept to ECCV2026
💡 一句话要点
提出KineBench以解决现有EWMs评估中的IDM依赖问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 具身世界模型 运动学评估 逆动力学模型 闭环验证 机器人操作 物理模拟 视频生成 任务复杂性
📋 核心要点
- 现有的评估框架几乎完全依赖于逆动力学模型(IDMs),导致在新场景下的动作提取不可靠。
- KineBench通过显式的运动学基础管道,直接从生成的视频中提取6D末端执行器姿态,避免了IDM的使用。
- 在20个多样化的操作任务上进行评估,KineBench展示了任务复杂性与生成视频的非线性关系,为未来的数据扩展策略提供了经验指导。
📝 摘要(中文)
评估具身世界模型(EWMs)的物理一致性是一个重要的开放挑战。现有的闭环评估方法依赖于逆动力学模型(IDMs)进行动作提取,但IDMs在处理新对象和场景时可能表现不稳定,导致动作提取不可靠。为减少这种模糊性,本文提出了KineBench,一个无IDM的闭环基准,基于显式的运动学基础管道,直接从生成的视频中提取6D末端执行器姿态,并在物理模拟器中进行验证。KineBench不仅关注任务成功率,还引入了经典的3D运动学指标来评估轨迹的平滑性和运动学可行性。
🔬 方法详解
问题定义:本文旨在解决现有具身世界模型(EWMs)评估中对逆动力学模型(IDMs)的依赖问题。IDMs在处理新对象和场景时可能导致动作提取不可靠,从而造成模型不准确与提取错误之间的归因模糊。
核心思路:KineBench的核心思路是通过显式的运动学基础管道,直接从生成的视频中提取6D末端执行器姿态,避免了IDMs的使用,从而减少归因模糊。
技术框架:KineBench的整体架构包括多个模块:首先,使用级联的视觉基础模型从视频帧中提取6D姿态;其次,将提取的姿态在物理模拟器中执行以进行闭环验证;最后,结合经典的3D运动学指标评估轨迹的平滑性和可行性。
关键创新:KineBench的主要创新在于其无IDM的闭环评估框架,直接从视频中提取动作,避免了IDMs的脆弱性。这一设计使得评估过程更加可靠。
关键设计:在技术细节上,KineBench采用了级联的视觉基础模型进行姿态提取,并结合了光谱弧长(SPARC)和Maruyama可操作性指数等经典指标来评估运动学特性。
🖼️ 关键图片
📊 实验亮点
KineBench在20个多样化的操作任务上进行了评估,结果显示其在任务复杂性与生成视频之间存在非线性关系。这一发现为未来的数据扩展策略提供了重要的经验指导,具有显著的实用价值。
🎯 应用场景
KineBench的研究成果在机器人操作、自动化制造和虚拟现实等领域具有广泛的应用潜力。通过提供更可靠的评估框架,KineBench可以帮助研究人员和工程师更好地理解和改进具身世界模型的性能,从而推动相关技术的发展和应用。
📄 摘要(原文)
Evaluating the physical consistency of embodied world models(EWMs) is a critical open challenge. While closed-loop evaluation via simulator rollouts offers a more faithful assessment of physical plausibility than open-loop alternatives, existing frameworks almost exclusively rely on Inverse Dynamics Models(IDMs) for action extraction. Due to the intricate mapping from 2D pixel space to 3D kinematic space, the learned IDMs can be brittle to data outside their training distribution, resulting in unreliable action extraction from the generated videos with novel objects and scenarios. This creates an unavoidable attribution ambiguity between world model inaccuracies and extractor errors. To reduce this ambiguity, we present KineBench, an IDM-free closed-loop benchmark for EWMs, built upon an explicit kinematic grounding pipeline. Given a generated video, KineBench employs cascaded visual foundation models to directly extract 6D end-effector poses from individual frames, which are then executed in a physics simulator for closed-loop validation. Beyond execution-based task success, KineBench incorporates two classical 3D kinematic metrics--Spectral Arc Length (SPARC) and the Maruyama Manipulability Index--to characterize trajectory smoothness and kinematic feasibility from a robot-centric perspective. Built on 20 diverse manipulation tasks in ManiSkill3, KineBench evaluates EWMs across four progressive suites: basic execution, task transfer, visual out-of-distribution generalization, and complexity-conditioned scaling. Evaluation across frontier models reveals task-complexity-bounded nonlinear scaling in embodied video generation, providing empirical guidance for future data-scaling strategies.