Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

📄 arXiv: 2607.13429v1 📥 PDF

作者: Dwip Dalal, Shivansh Patel, Chahit Jain, Jeonghwan Kim, Utkarsh Mishra, Alex Baratian, Hyeonjeong Ha, Heng Ji, Svetlana Lazebnik, Unnat Jain

分类: cs.RO, cs.CV

发布日期: 2026-07-15

备注: Code: https://github.com/dwipddalal/Anchor-Align


💡 一句话要点

提出Anchor-Align以解决VLA策略中的表示漂移问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉-语言模型 行为克隆 机器人学习 多模态对齐 表示学习

📋 核心要点

  1. 现有的行为克隆微调方法在训练过程中会逐渐覆盖预训练的表示,导致视觉和语义的泛化能力下降。
  2. 本文提出的Anchor-Align方法通过视觉-语言锚定和语言-动作对齐来增强行为克隆,防止表示漂移并提高训练效果。
  3. 在物理机器人实验中,Anchor-Align在两个VLA架构上成功率分别提升了28%到54%和37%到60%,显示出显著的改进。

📝 摘要(中文)

在机器人演示中,通过行为克隆(BC)对预训练的视觉-语言模型(VLM)进行微调已成为视觉-语言-动作(VLA)策略的标准方法。然而,BC微调逐渐覆盖了支持视觉和语义泛化的预训练表示。共同训练网络图像-文本数据的常见补救措施并未能解决此问题,导致语言和动作之间的错位。本文提出Anchor-Align,通过视觉-语言锚定和语言-动作对齐两个目标增强BC,防止表示漂移,并在相同的机器人观察上联合训练语言和动作预测。在物理xArm7机器人上,Anchor-Align在两个广泛使用的VLA架构上均显著提高了成功率,表明保持预训练表示与有效的动作学习并不矛盾。

🔬 方法详解

问题定义:本文旨在解决在机器人演示中微调预训练视觉-语言模型时,行为克隆导致的表示漂移问题。现有方法在训练过程中未能有效保持预训练表示的泛化能力,导致语言和动作之间的错位。

核心思路:Anchor-Align的核心思想是通过视觉-语言锚定和语言-动作对齐两个目标来增强行为克隆。视觉-语言锚定从冻结的VLM副本中提取层级表示,以防止表示漂移,而语言-动作对齐则将每个动作目标转换为离散的运动方向标签,并在同一观察上联合训练语言和动作预测。

技术框架:Anchor-Align的整体架构包括两个主要模块:视觉-语言锚定模块和语言-动作对齐模块。前者负责提取和保持预训练表示,后者则确保语言和动作之间的一致性。

关键创新:最重要的技术创新在于引入了视觉-语言锚定和语言-动作对齐两个目标,使得在微调过程中能够有效保持预训练表示的同时,提升动作学习的效果。这与传统的行为克隆方法形成了本质区别。

关键设计:在关键设计上,Anchor-Align采用了层级表示提取和离散运动方向标签的方式,确保了语言和动作预测的联合训练。此外,损失函数的设计也考虑了语言和动作之间的对齐性,以提高训练的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在物理xArm7机器人上,Anchor-Align在两个广泛使用的VLA架构上分别将成功率从28%提升至54%和从37%提升至60%。在大规模仿真中,Anchor-Align在OOD扰动、感知鲁棒性和长时间控制方面也表现出一致的改进,显示出其在多种任务中的有效性。

🎯 应用场景

该研究的潜在应用领域包括机器人操作、自动化制造和人机交互等场景。通过提高机器人在复杂环境中的操作能力,Anchor-Align有助于推动智能机器人在实际应用中的广泛部署,提升其自主学习和适应能力,未来可能对智能制造和服务机器人领域产生深远影响。

📄 摘要(原文)

Finetuning a pretrained vision-language model (VLM) on robot demonstrations via behavior cloning (BC) has become the standard recipe for vision-language-action (VLA) policies. However, BC finetuning progressively overwrites the pretrained representations that support visual and semantic generalization. Co-training on web image-text data, a common remedy, does not prevent this; it applies language and action losses to separate observations, leaving VLAs with language-action misalignment that standard manipulation benchmarks do not expose. We propose Anchor-Align, which augments BC with two objectives: Vision-Language Anchoring distills layer-wise representations from a frozen VLM copy to prevent this drift, while Language-Action Alignment converts each action target into a discrete motion-direction label and jointly trains language and action prediction on the same robot observation. On a physical xArm7 robot, across two widely used VLA architectures, Anchor-Align improves real-robot success on both (28% to 54% and 37% to 60%). At scale in simulation, we demonstrate consistent improvements on OOD perturbations, perceptual robustness, and long-horizon control across LIBERO-PRO, LIBERO-Plus, and CALVIN, respectively, suggesting that preserving pretrained representations and effective action learning are not fundamentally at odds. Project page: anchoralignvla.github.io