Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids

📄 arXiv: 2607.20345v1 📥 PDF

作者: Roger Sala Sisó, Tiago Silvério, Jakob Sand, Tran Nguyen Le

分类: cs.RO, cs.AI

发布日期: 2026-07-22

备注: 8 pages. This work has been submitted to the IEEE for possible publication


💡 一句话要点

提出DEED框架以解决零售人形机器人实验室与实际应用之间的差距

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉-语言-动作 人形机器人 数据高效学习 后训练 经验驱动学习 系统集成 潜在空间分析

📋 核心要点

  1. 现有的VLA人形机器人在处理执行错误和环境变化时,往往无法在实际应用中保持可靠的性能。
  2. 本文提出的DEED框架通过数据高效的后训练和经验驱动的学习,旨在提升机器人在真实环境中的表现。
  3. 实验结果显示,经过精心设计的数据和后训练,能够将原本在简单微调下失效的策略转变为有效的实际系统。

📝 摘要(中文)

在视觉-语言-动作(VLA)人形机器人领域,实验室性能与实际操作之间的差距仍然是一个核心挑战。本文提出了DEED(数据高效的后训练和经验驱动学习)框架,旨在通过系统级的方法来解决这一问题。该框架在超市补货任务中进行了评估,使用了Unitree G1-Edu人形机器人和GR00T N1.6基础模型。DEED包括三个关键组件:数据高效的后训练流程、基于经验的优化研究以及潜在空间分析工具。研究结果表明,弥合实验室与实际应用之间的差距主要是系统集成的挑战,而非架构问题。

🔬 方法详解

问题定义:本文旨在解决VLA人形机器人在实验室与实际应用之间的性能差距,现有方法在面对执行错误和环境变化时表现不佳。

核心思路:DEED框架通过数据高效的后训练和经验驱动的学习,强调系统集成的重要性,而非单纯依赖模型架构的改进。

技术框架:DEED框架由三个主要模块组成:数据高效的后训练流程、经验驱动的优化研究和潜在空间分析工具,整体流程旨在提升机器人在真实环境中的适应能力。

关键创新:DEED的创新在于其系统级的整合方法,通过优化数据设计和后训练策略,显著提升了机器人在实际任务中的表现。

关键设计:在后训练过程中,采用了控制频率对齐、数据筛选和任务相关的视觉突出等技术细节,以减少对VLA的依赖,并增强策略的适应性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,DEED框架在超市补货任务中显著提升了机器人的操作能力,使用单个GPU的情况下,成功将原本在简单微调下失效的策略转变为有效的实际系统,展示了系统集成的重要性。

🎯 应用场景

该研究的潜在应用领域包括零售、仓储和服务行业,能够显著提升人形机器人在动态环境中的操作能力。通过优化后训练和经验学习,未来的机器人将更好地适应复杂的实际场景,推动智能自动化的发展。

📄 摘要(原文)

Closing the gap between benchmark performance and reliable real-world operation remains a central challenge for Vision-Language-Action (VLA) humanoid robots, which must handle execution errors, distribution shifts, and environmental variability. This paper presents DEED (Data-Efficient Post-Training and Experience-Driven Learning), a systems-level approach evaluated on a supermarket chip-restocking task using a Unitree G1-Edu humanoid robot and the GR00T N1.6 foundation model. DEED comprises three key components: (1) a data-efficient post-training pipeline with control-frequency alignment, data curation, task-relevant visual highlighting, and reduced VLA dependence; (2) a real-world study of experience-driven refinement, adapted from RECAP via a text-based advantage prefix and a vision-language value function; and (3) a latent-space analysis tool for studying in- and out-of-distribution behavior. Our results suggest that bridging the lab-to-store gap is primarily a systems integration challenge rather than an architectural one: careful data design and targeted post-training can transform a policy that fails under naive fine-tuning into a competent real-world system using only a single GPU.