RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?

📄 arXiv: 2609.05324v1 📥 PDF

作者: Zhenxuan Fan, Bo Zhang, Yutong Lin, Yuqian Yuan, Juekai Lin, Liang Liang, Zhuoyi Huang, Wenqiao Zhang, Juncheng Li, Siliang Tang, Jun Xiao, Yueting Zhuang

分类: cs.RO, cs.AI, cs.CV

发布日期: 2026-09-04

备注: Accepted at the EMNLP 2026 Main Conference

🔗 代码/项目: GITHUB


💡 一句话要点

提出RoboSPA以解决VLA模型在复杂场景中的推理问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉-语言-行动 机器人操作 空间推理 程序规划 数据集 评估基准 智能代理

📋 核心要点

  1. 现有的VLA模型在处理复杂空间关系和长时间程序规划时表现不佳,限制了其在真实场景中的应用。
  2. RoboSPA通过引入细粒度空间推理和长时间程序规划的评估,提供了一个全面的基准和数据集,以促进VLA模型的推理能力提升。
  3. 实验结果显示,当前VLA模型在复杂任务中仍面临挑战,RoboSPA为未来的研究提供了新的方向和标准。

📝 摘要(中文)

视觉-语言-行动(VLA)模型在语言条件下的机器人操作中取得了显著进展。然而,现有的数据集和基准主要在预定义设置下评估任务完成情况,无法深入了解模型在空间和程序复杂性增加下的推理能力。为此,我们提出了RoboSPA(机器人空间-程序评估),这是一个大规模的机器人操作数据集和基准,旨在诊断VLA模型的具身推理能力。RoboSPA关注两个核心维度:细粒度空间推理和长时间程序规划,涵盖10个任务类别和56个基础任务。每个任务在五个难度级别上实例化,产生280个变体,具有逐渐增加的空间模糊性和程序复杂性。我们收集了527K个轨迹,跨越多个具身体和多样场景。除了二元成功率,RoboSPA还引入了诊断指标以进行更详细的评估。实验结果表明,当前系统在复杂空间关系、精确低级执行和内存密集型规划方面仍然存在困难。这些结果确立了RoboSPA作为一个具有挑战性的诊断基准,以开发更强大、可靠和可泛化的具身代理。

🔬 方法详解

问题定义:本论文旨在解决现有VLA模型在复杂场景和长时间任务中的推理能力不足的问题。现有方法主要依赖于简单场景和短期任务,无法有效评估模型的空间和程序推理能力。

核心思路:论文提出RoboSPA数据集,专注于细粒度空间推理和长时间程序规划,通过多样化的任务和难度设置,全面评估VLA模型的推理能力。

技术框架:RoboSPA的整体架构包括任务设计、数据收集和评估指标三个主要模块。任务设计涵盖10个类别和56个基础任务,数据收集涉及527K个轨迹,评估指标则引入了新的诊断标准。

关键创新:RoboSPA的最大创新在于其多维度的评估框架,能够深入分析模型在复杂空间关系和程序规划中的表现,与现有的单一成功率评估方法形成鲜明对比。

关键设计:在数据集设计中,任务的难度分为五个级别,确保了逐渐增加的空间模糊性和程序复杂性。此外,诊断指标的引入使得评估更加全面,能够揭示模型的具体弱点。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,当前VLA模型在处理复杂空间关系和长时间程序规划时的表现仍然不足,成功率显著低于预期。通过RoboSPA的评估,模型在细粒度空间推理和程序规划方面的不足得到了明确的量化,为后续改进提供了方向。

🎯 应用场景

RoboSPA的研究成果可广泛应用于机器人操作、智能家居、自动驾驶等领域,帮助提升机器人在复杂环境中的自主决策和执行能力。未来,RoboSPA有望成为VLA模型研究的标准基准,推动智能代理的可靠性和泛化能力的发展。

📄 摘要(原文)

Vision-Language-Action (VLA) models have shown promising progress in language-conditioned robotic manipulation. However, existing datasets and benchmarks mainly evaluate task completion under predefined settings, offering limited insight into model reasoning under increasing spatial and procedural complexity. We introduce \textbf{RoboSPA} (\textbf{Robo}t \textbf{S}patial-\textbf{P}rocedural \textbf{A}ssessment), a large-scale robotic manipulation dataset and benchmark for diagnosing embodied reasoning in VLA models. \texttt{RoboSPA} focuses on two core dimensions, Fine-Grained Spatial Reasoning and Long-Horizon Procedural Planning, covering 10 task categories and 56 base tasks. Each task is instantiated across five difficulty levels, yielding 280 variants with increasing spatial ambiguity and procedural complexity. We collect 527K trajectories across multiple embodiments and diverse scenes. Beyond binary success rate, \texttt{RoboSPA} introduces diagnostic metrics for more detailed evaluation. Experiments on representative VLA models show that current systems still struggle with complex spatial relations, precise low-level execution, and memory-intensive planning. These results establish \texttt{RoboSPA} as a challenging diagnostic benchmark for developing more capable, reliable, and generalizable embodied agents. Our data and code are available at https://github.com/fanzhenxuan/RoboSPA.