AXIS: A Growable Community-Driven Data Engine for Scalable Robot Manipulation

📄 arXiv: 2607.21588v1 📥 PDF

作者: Mengfei Zhao, Dihong Huang, Yikai Tang, Peihao Li, Mingxuan Yan, Ruiqi Zhuang, Yanjia Huang, Jie Wang, Hai Zhai, Tony Zhou, Rui Zhang, Zhexi Luo, Yuchen Huang, Jianfei Yang, Jiachen Li

分类: cs.RO

发布日期: 2026-07-23

备注: Project Website: https://axisaiorg.github.io/AXIS-V1/


💡 一句话要点

提出AXIS以解决机器人操作数据收集与处理的可扩展性问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 机器人操作 数据收集 社区驱动 自动化任务生成 可扩展性 演示验证 机器学习

📋 核心要点

  1. 现有的机器人操作数据收集方法难以扩展,通常依赖于专用硬件和集中式操作,限制了多样化演示的获取。
  2. AXIS通过社区驱动的方式,提供了一个可扩展的数据引擎,支持浏览器远程操作和自动化任务生成,简化了数据收集和处理流程。
  3. 在AXIS上进行的持续预训练显著提高了成功率,$π_{0.5}$提升了5.8%,并在与RoboCasa365的对比中表现出37.3%的优势,显示出数据量增加带来的持续改进。

📝 摘要(中文)

学习有效的机器人操作策略需要多样化且高质量的演示数据,但现有的数据管道往往难以扩展,因为它们依赖于专用硬件、集中式操作或固定任务套件。本文提出AXIS,一个可扩展的社区驱动数据引擎和基准,支持基于浏览器的远程操作以进行大规模演示收集,自动生成和验证新的操作任务,并通过自动成功检查、质量过滤、轨迹平滑以及视觉和物理增强将社区收集的演示转化为训练准备好的数据。AXIS数据集目前包含207个多样化任务和超过5万条轨迹,同时将数据组织为任务快照,并通过系统的保留协议评估策略。

🔬 方法详解

问题定义:本文旨在解决现有机器人操作数据收集方法的可扩展性问题,现有方法通常依赖于专用硬件和集中式操作,限制了多样化演示的获取和使用。

核心思路:AXIS通过社区驱动的方式,提供了一个可扩展的数据引擎,支持浏览器远程操作和自动化任务生成,简化了数据收集和处理流程,使得用户能够更方便地贡献和使用操作演示。

技术框架:AXIS的整体架构包括数据收集、任务生成、演示验证和数据处理四个主要模块。用户可以通过浏览器进行远程操作,系统自动生成新的操作任务,并对收集的演示数据进行质量检查和增强处理。

关键创新:AXIS的主要创新在于其社区驱动的数据收集和处理机制,以及自动化的任务生成和验证流程。这与传统方法的集中式操作形成鲜明对比,极大地提高了数据的多样性和质量。

关键设计:AXIS采用了一系列关键设计,包括自动成功检查、质量过滤、轨迹平滑和视觉与物理增强等技术细节,以确保收集到的数据能够有效用于训练和评估机器人操作策略。具体的参数设置和损失函数设计在论文中有详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在AXIS上进行的实验表明,持续预训练显著提高了成功率,$π_{0.5}$提升了5.8%。与RoboCasa365的模型相比,AXIS的表现提升了37.3%,并且在数据量增加的情况下,成功率持续改善,尤其在布局、传感器噪声和摄像头扰动等条件下表现出显著的优势。

🎯 应用场景

AXIS的研究成果在多个领域具有广泛的应用潜力,包括机器人操作、自动化制造、智能家居等。通过提供一个可扩展的数据引擎,AXIS能够支持更大规模的机器人学习和操作策略开发,推动相关技术的进步和应用落地。

📄 摘要(原文)

Learning effective robot manipulation policies requires diverse, high-quality demonstrations, yet existing data pipelines are often difficult to scale because they rely on specialized hardware, centralized operators, or fixed task suites. We present AXIS, a growable community-driven data engine and benchmark for scalable robot learning, which enables browser-based teleoperation for large-scale demonstration collection, automatically generates and validates new manipulation tasks, and transforms community-collected demonstrations into training-ready data through automated success checking, quality filtering, trajectory smoothing, and visual and physics-based augmentation. The AXIS dataset currently contains 207 diverse tasks and 50K+ trajectories. Meanwhile, AXIS organizes data into task snapshots and evaluates policies with a systematic held-out protocol. We compare vision-language-action (VLA) policies under a unified AXIS evaluation suite and analyze scaling behavior across different data volumes. Continual pretraining on AXIS substantially improves the overall success rate of $π_{0.5}$ by 5.8%, outperforms the model pretrained on RoboCasa365 by 37.3%, and exhibits consistent scaling with increasing data volume, with the largest gains observed under layout, sensor-noise, and camera perturbations.