ArmnetBench v0.1: Parallel Real-World Evaluation of Manipulation Policies on a Low-Cost Arm Farm

📄 arXiv: 2607.24481v1 📥 PDF

作者: Praveen Selvaraj, Lorenzo Uttini, Ville Kuosmanen

分类: cs.RO

发布日期: 2026-07-27

备注: 11 pages, 6 tables, 3 figures. data available at https://huggingface.co/collections/armnet/armnetbench-v01


💡 一句话要点

提出ArmnetBench v0.1以解决机器人操作策略评估瓶颈问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 机器人操作 策略评估 基准测试 低成本机械臂 并行评估 质量标签 下游学习

📋 核心要点

  1. 现有的机器人操作策略评估方法依赖于物理硬件,导致评估过程繁琐且效率低下。
  2. ArmnetBench v0.1通过在低成本机械臂群上进行并行评估,简化了操作策略的验证过程。
  3. 该基准测试比较了7种策略在12个任务中的表现,提供了丰富的评估数据和质量标签,支持后续学习。

📝 摘要(中文)

现实世界的评估是开发通用机器人操作策略的瓶颈。每次评估都需要物理硬件和操作员进行设置、重置和评分。我们介绍了ArmnetBench v0.1,这是一个在低成本SO-101机械臂群上运行的基准测试,经过轻度现场监督。v0.1验证了这一机械臂农场的端到端性能,并在12个任务中比较了7种策略,包括单臂和双臂配置。每种策略在每个任务上经过50次演示的训练或微调,基准测试包含2,518次策略评估和600次参考演示。所有3,118个实验均带有三种标签(成功、次优或失败)。策略评估由人工评分,而演示则是通过构建保证成功的。除了评估,其质量标记的轨迹支持下游学习,包括奖励和预测世界模型,以及在混合质量数据上训练的策略。我们发布了3,118个核心实验,格式为LeRobot v3.0和RoboMeter。

🔬 方法详解

问题定义:本论文旨在解决机器人操作策略在现实世界中评估效率低下的问题。现有方法需要大量的物理硬件和人工干预,导致评估过程繁琐且耗时。

核心思路:论文提出ArmnetBench v0.1基准测试,通过在低成本SO-101机械臂群上进行并行评估,减少了对人工干预的依赖,从而提高评估效率。

技术框架:该框架包括多个模块:首先是策略训练和微调,使用50次演示进行;其次是策略评估,包含2,518次策略评估和600次参考演示;最后是结果分析和质量标签的生成。

关键创新:最重要的创新在于通过低成本机械臂群的并行评估,显著提高了评估的效率和可重复性,与传统方法相比,减少了对人工操作的需求。

关键设计:在实验设计中,每个策略的训练使用50次演示,评估结果通过人工评分,并且所有实验均带有三种标签(成功、次优、失败),确保了评估的全面性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,ArmnetBench v0.1成功比较了7种策略在12个任务中的表现,提供了2,518次策略评估和600次参考演示,所有实验均带有质量标签。这种方法显著提高了评估效率,为后续学习提供了丰富的数据支持。

🎯 应用场景

该研究的潜在应用领域包括机器人操作策略的开发与优化,尤其是在制造、物流和服务等行业。通过提供高效的评估工具,ArmnetBench v0.1可以帮助研究人员和工程师快速验证和改进其操作策略,推动机器人技术的实际应用和发展。

📄 摘要(原文)

Real-world evaluation is a bottleneck in developing generalist robot manipulation policies. Each rollout requires physical hardware and an operator to set up, reset, and score it. We introduce ArmnetBench v0.1, a benchmark run on a fleet of low-cost SO-101 cells under light on-site supervision. v0.1 validates this arm farm end to end and compares 7 policies across 12 tasks with both single-arm and bimanual configurations. Each policy is trained or fine-tuned on 50 demonstrations per task; the benchmark contains 2,518 policy rollouts and 600 reference demonstrations. All 3,118 episodes carry a three-way label (successful, suboptimal, or failure). Policy rollouts are human-scored, while demonstrations are successful by construction. Beyond evaluation, its quality-labelled trajectories support downstream learning, from reward and predictive world models to policies trained on mixed-quality data. The leaderboard is an initial comparison under this shared budget. We release the 3,118 core episodes in LeRobot v3.0 and RoboMeter formats.