Frequency-Conditioned Flow Matching for Vision-Language-Action Models

📄 arXiv: 2609.10405v1 📥 PDF

作者: Haochen Niu, Shengye Dong, Hao Liu, Peiwen Lin, Wang Chuang

分类: cs.RO

发布日期: 2026-09-09


💡 一句话要点

提出FreqFM框架以解决VLA模型频率异质性问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 频率条件 流匹配 视觉-语言-动作 机器人控制 多模态学习

📋 核心要点

  1. 现有的VLA模型在生成动作时未能有效利用频率异质性,导致性能不足。
  2. FreqFM框架通过将动作频率作为显式条件,提升了流匹配模型的生成能力。
  3. 在多个基准测试中,FreqFM显著提高了模型性能,尤其在LIBERO-Plus上获得了9.3点的提升。

📝 摘要(中文)

机器人动作是时间上相关的轨迹,其频率成分编码了不同尺度的运动,并具有高度不均匀的能量分布。然而,基于流匹配的视觉-语言-动作(VLA)模型通常在时间坐标中生成动作,而未明确建模或系统性利用这种频率异质性。本文提出了FreqFM,一个频率条件的流匹配框架,将动作频率从隐式轨迹属性提升为贯穿整个生成流程的显式条件维度。具体而言,在DCT频率坐标中,FreqFM构建了谱匹配源分布,自适应平衡各频率的目标,并使用相应的参考传输尺度约束每个频率的引导残差。FreqFM能够无缝集成到现有的流匹配动作专家中,而无需改变VLA骨干网络。在LIBERO、LIBERO-Plus和VLA-Arena上,FreqFM始终提高了性能,包括LIBERO-Plus上9.3点的提升,并进一步在六个真实机器人任务中展示了其有效性。

🔬 方法详解

问题定义:本文旨在解决现有基于流匹配的视觉-语言-动作模型未能有效利用频率异质性的问题。现有方法在时间坐标中生成动作,未能明确建模频率成分,导致性能不足。

核心思路:FreqFM框架的核心思想是将动作频率从隐式属性提升为显式条件,贯穿整个生成流程,从而更好地捕捉动作的频率特征。

技术框架:FreqFM在DCT频率坐标中构建谱匹配源分布,包含自适应平衡目标和频率引导残差约束等模块,能够与现有流匹配动作专家无缝集成。

关键创新:FreqFM的主要创新在于将频率条件引入流匹配框架,使得模型能够在生成过程中显式考虑频率异质性,这与传统方法的隐式处理方式形成了鲜明对比。

关键设计:在设计上,FreqFM采用了DCT变换来处理频率信息,并通过自适应平衡损失函数来优化不同频率的生成效果,同时引入参考传输尺度来约束频率引导残差。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,FreqFM在LIBERO-Plus上实现了9.3点的性能提升,并在LIBERO和VLA-Arena等多个基准测试中均表现出显著的改进,展示了其在真实机器人任务中的有效性。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、智能家居、自动驾驶等,能够提升机器人在复杂环境中的动作生成能力,具有重要的实际价值。未来,FreqFM框架有望推动多模态交互和人机协作的发展。

📄 摘要(原文)

Robot actions are temporally correlated trajectories whose frequency components encode motion at different scales with highly non-uniform energy distributions. Yet Flow Matching--based vision-language-action (VLA) models typically generate actions in temporal coordinates, without explicitly modeling or systematically leveraging this frequency heterogeneity. We introduce \emph{FreqFM}, a frequency-conditioned Flow Matching framework for VLA models. It raises action frequency from an implicit trajectory property to an explicit conditioning dimension that spans the entire generation pipeline. Concretely, in DCT frequency coordinates, FreqFM constructs a spectrum-matched source distribution, adaptively balances the objective across frequencies, and constrains per-frequency guidance residuals using the corresponding reference transport scales. FreqFM integrates into existing Flow Matching action experts without changing the VLA backbone. Across LIBERO, LIBERO-Plus, and VLA-Arena, FreqFM consistently improves performance, including a 9.3-point gain on LIBERO-Plus, and further demonstrates its effectiveness on six real-robot tasks.