Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models

📄 arXiv: 2607.14635v1 📥 PDF

作者: Yufeng Ji, Wenhao Tang, Haoyi Niu, Koushil Sreenath, Yi Wu, Zhongyu Li

分类: cs.AI, cs.CV, cs.RO

发布日期: 2026-07-16


💡 一句话要点

提出Action QFormer以优化视觉-语言-动作模型中的动作监督问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉-语言-动作 动作监督 多模态表示 查询机制 机器人导航 自动驾驶 人机交互

📋 核心要点

  1. 现有的视觉-语言-动作模型在动作监督方面存在不平衡,可能导致多模态表示的不稳定性。
  2. 本文提出Action QFormer,通过指令条件查询重新组织多模态信息,优化动作生成过程。
  3. 实验结果显示,Action QFormer显著提升了任务成功率和动作生成的准确性,几乎消除了分布外指令生成。

📝 摘要(中文)

在视觉-语言-动作(VLA)模型中,动作监督通常被视为学习动作预测的下游目标。本文将其视为塑造继承多模态表示的力量,展示了这种塑造的双重效应:它有助于形成与动作兼容的表示,但过于直接的应用可能会破坏语言处理和物体定位的支持。为了解决这一矛盾,本文提出了Action QFormer,这是一种基于查询的动作接口,通过指令条件查询重新组织继承的多模态信息,生成面向动作的表示。实验结果表明,Action QFormer在零-shot模拟到真实导航中,任务成功率从18.8%提升至56.3%,固定指令的动作生成正确率从22.5%提升至75.5%。

🔬 方法详解

问题定义:本文解决的是在视觉-语言-动作模型中,动作监督对多模态表示的影响,现有方法可能导致表示的不稳定性和信息的广泛重写。

核心思路:Action QFormer通过引入查询机制,利用指令条件查询来重新组织多模态信息,从而形成更为稳定和有效的动作表示。这样的设计旨在平衡动作监督与语言处理之间的关系。

技术框架:整体架构包括一个查询接口,该接口在动作生成之前对继承的多模态信息进行重组,确保生成的表示能够有效支持后续的动作生成任务。

关键创新:最重要的创新在于引入了查询机制,使得动作监督能够更有针对性地塑造多模态表示,而不是简单地应用于整个路径,从而避免了不必要的干扰。

关键设计:在模型设计中,采用了指令条件查询的方式,设置了特定的损失函数以优化动作生成的准确性,并确保了多模态信息的有效整合。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,Action QFormer在零-shot模拟到真实导航任务中,成功率从18.8%提升至56.3%,固定指令的动作生成正确率从22.5%提升至75.5%,并几乎消除了分布外指令生成,展现了显著的性能提升。

🎯 应用场景

该研究的潜在应用领域包括机器人导航、自动驾驶和人机交互等场景。通过优化视觉-语言-动作模型的表现,Action QFormer能够提升系统在复杂环境中的决策能力,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Action supervision in vision-language-action (VLA) models is often treated as a downstream objective for learning action prediction. In this paper, we study it instead as a force that shapes inherited multimodal representations. We show that this shaping has a dual effect: it is necessary for forming action-compatible representations, but when action supervision is applied too directly to the inherited multimodal pathway, it can also destabilize representations that support language-side processing and object grounding. To address this tension, we introduce Action QFormer, a query-based action-facing interface that uses instruction-conditioned queries to reorganize inherited multimodal information into action-facing representations before downstream action generation. In zero-shot sim-to-real navigation, Action QFormer improves average closed-loop task success from 18.8% to 56.3%, raises fixed-instruction action-generation correctness from 22.5% to 75.5%, and nearly eliminates out-of-distribution instruction generations. Further analyses show that Action QFormer changes how action supervision shapes inherited multimodal representations, reducing broad upstream rewriting while preserving targeted and sometimes constructive action-supervised adaptation. These results suggest that improving VLA performance requires not only stronger pretrained backbones, but also better ways of selecting and organizing inherited multimodal information while controlling how it is shaped under action supervision.