An Empirical Study on Stage-Information Interfaces for VLA Fine-Tuning
作者: Yingwei Ji
分类: cs.RO
发布日期: 2026-07-15
备注: 5 pages, 2 figures, 4 tables
💡 一句话要点
提出阶段信息接口以优化VLA微调过程
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 长时间操作 阶段信息 VLA微调 机器人策略 动作注释
📋 核心要点
- 现有方法在长时间操作中未能有效利用阶段信息,导致策略成功率不理想。
- 本文提出通过分段动作注释和进度模块来跟踪活动阶段,以优化VLA的动作策略。
- 实验结果表明,在继续微调中,序数阶段状态的成功率在所有对比中表现最佳,显示出阶段信息的潜在价值。
📝 摘要(中文)
在长时间操作中,一个高层指令可以涵盖多个动作阶段。本文使用分段动作注释作为全任务指令与VLA动作块之间的中间表示。进度模块跟踪当前活动阶段,而动作策略接收当前阶段文本或归一化的序数阶段索引作为机器人状态信息。我们在LIBERO-10上比较了这些接口与GR00T N1.6在直接微调和从全任务指令基线继续微调下的表现。结果显示,显式阶段信息并未自动改善策略的成功率,尽管在继续微调中,序数阶段状态在所有三次配对运行中均超越了其他两种选择。
🔬 方法详解
问题定义:本文旨在解决长时间操作中高层指令与具体动作之间的有效映射问题。现有方法未能充分利用阶段信息,导致策略成功率不高。
核心思路:通过引入分段动作注释和进度模块,本文设计了一种新的接口,使得动作策略能够接收当前阶段信息,从而更好地指导机器人执行任务。
技术框架:整体架构包括分段动作注释、进度模块和动作策略三个主要模块。进度模块负责跟踪当前活动阶段,而动作策略则根据接收到的阶段信息进行决策。
关键创新:最重要的创新在于引入了序数阶段状态作为一种新的阶段信息表示形式,能够更有效地指导动作策略的决策过程,与传统方法相比具有显著的优势。
关键设计:在实验中,采用了不同的阶段信息表示形式,包括当前阶段文本和序数阶段索引,并对其进行了比较。损失函数和网络结构的设计也针对不同的阶段信息进行了优化。
🖼️ 关键图片
📊 实验亮点
实验结果显示,在直接微调中,使用全任务指令、当前阶段文本和序数阶段状态的成功率分别为57.45%、50.24%和54.36%。在继续微调中,序数阶段状态在所有三次配对运行中均超越其他两种选择,显示出其在策略优化中的重要性。
🎯 应用场景
该研究的潜在应用领域包括机器人操作、自动化制造和人机协作等。通过优化微调过程,能够提升机器人在复杂任务中的表现,进而推动智能机器人在实际场景中的应用和普及。
📄 摘要(原文)
One high-level instruction in long-horizon manipulation can cover several action stages. We use segmented action annotations as an intermediate representation between the full-task instruction and VLA action chunks. A progress module tracks the active stage, while the action policy receives stage information either as current-stage text or as a normalized ordinal stage index in robot state. We compare these interfaces with GR00T N1.6 on LIBERO-10 under direct fine-tuning and continuation fine-tuning from a full-task instruction baseline. Under direct fine-tuning, full-task instruction, current-stage text, and Ordinal Stage-State achieve mean success rates of 57.45%, 50.24%, and 54.36%, respectively, showing that explicit stage information does not automatically improve the policy. Under continuation, the corresponding means are 49.07%, 50.00%, and 53.75%, with Ordinal Stage-State exceeding both alternatives in all three paired runs. The observed benefit differs across interface representations and training arrangements.