CASD: Chunk-Aligned Semantic Distillation for Multi-StageRobot Manipulation

📄 arXiv: 2609.08638v1 📥 PDF

作者: Tinghe Ding, Jiahao Li, He Wang

分类: cs.RO, cs.AI

发布日期: 2026-09-08


💡 一句话要点

提出CASD以解决多阶段机器人操作中的语义目标预测问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 多阶段操作 语义蒸馏 机器人学习 视觉-语言模型 策略训练

📋 核心要点

  1. 现有方法在多阶段机器人操作中,无法有效捕捉动作块的整体语义目标,导致性能不足。
  2. CASD通过离线模型分段演示,生成加权语义目标,并训练策略以提高多阶段操作的成功率。
  3. 实验结果显示,使用CASD的模型在多个基准测试中成功率显著提升,尤其在LIBERO和RoboTwin 2.0上表现突出。

📝 摘要(中文)

动作块可以跨越多个操作阶段,但其首步的标签仅描述当前阶段。本文提出了Chunk-Aligned Semantic Distillation(CASD),为整个动作块推导语义目标。通过离线视觉-语言模型将演示分段,确定每个动作块内的占用情况,从而生成加权语义目标,包括阶段间的过渡。CASD生成器学习从当前观察、机器人状态和任务指令中预测该目标。随后,我们冻结生成器并训练一个基于其预测的策略。实验结果表明,CASD在多个基准测试中表现优异,尤其在LIBERO和RoboTwin 2.0上显著提升了成功率。

🔬 方法详解

问题定义:本文旨在解决多阶段机器人操作中,现有方法无法有效捕捉和预测动作块的整体语义目标这一问题。传统方法通常仅关注当前阶段,忽视了阶段间的过渡信息,导致操作成功率降低。

核心思路:CASD的核心思想是通过离线视觉-语言模型对演示进行分段,生成包含阶段间过渡的加权语义目标。通过这种方式,模型能够更全面地理解和预测整个动作块的语义,从而提高操作的成功率。

技术框架:CASD的整体架构包括三个主要模块:离线视觉-语言模型用于分段演示,CASD生成器用于预测语义目标,以及基于生成器预测的策略训练模块。生成器在每次策略查询时运行一次,避免了在线调用视觉-语言模型的需求。

关键创新:CASD的主要创新在于其能够为整个动作块生成加权语义目标,并有效捕捉阶段间的过渡信息。这一方法与传统的单阶段标签方法形成鲜明对比,显著提升了多阶段操作的理解能力。

关键设计:在设计上,CASD生成器的损失函数考虑了阶段间的过渡信息,确保模型能够学习到更丰富的语义特征。此外,模型的训练过程中采用了注释的LIBERO训练集进行教师匹配,以提高预测的准确性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,使用CASD的IDM模型在LIBERO上达到了98.9%的平均成功率,相较于98.0%的基线有显著提升;Joint+CASD在RoboTwin 2.0上达到了93.0%,而DreamZero+CASD在MolmoSpaces操作中达到了47.9%的平均成功率,均优于对比基线。

🎯 应用场景

该研究在机器人操作、自动化制造和人机交互等领域具有广泛的应用潜力。通过提高多阶段操作的成功率,CASD可以帮助机器人更好地执行复杂任务,提升生产效率和安全性。未来,CASD的理念也可扩展到其他需要理解长时序动作的智能系统中。

📄 摘要(原文)

An action chunk can span several stages of a manipulation task, yet a label for its first step describes only the current stage. We introduce Chunk-Aligned Semantic Distillation (CASD), which derives semantic targets for entire action chunks. An offline vision--language model segments demonstrations into described stages. Their occupancy within each action chunk determines a weighted semantic target, including transitions between stages. A CASD generator learns to predict this target from the current observation, robot state, and task instruction. We then freeze the generator and train a policy conditioned on its predictions. The semantic branch runs once per policy query, without online VLM calls or reasoning-trace decoding. Teacher matching on annotated LIBERO training episodes is above chance for both single-stage and boundary-crossing chunks. We evaluate three Fast-WAM variants and a DreamZero integration across four benchmarks, including distribution shifts on LIBERO-Plus. Compared with published references, IDM+CASD reaches 98.9\% versus 98.0\% average success on LIBERO, while Uncond falls below its reference. Joint+CASD reaches 93.0\% versus 90.6\% on RoboTwin 2.0, and DreamZero+CASD reaches a 47.9\% four-category MolmoSpaces manipulation average versus 40.7\%. Performance varies across backbone integrations.