FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation
作者: Ruicheng Li, Qixiu Li, Ruichun Ma, Yu Deng, Lin Luo, Zhiying Du, Jianfeng Xiang, Huizhi Liang, Ruicheng Wang, Jiaolong Yang, Baining Guo
分类: cs.RO
发布日期: 2026-07-20
🔗 代码/项目: PROJECT_PAGE
💡 一句话要点
提出FM-VLA以解决接触丰富操作中的时间上下文推理问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉-语言-行动 机器人操作 基于力的记忆 非马尔可夫推理 变分自编码器 接触丰富操作 时间上下文推理
📋 核心要点
- 现有的视觉-语言-行动模型在处理接触丰富的操作时,面临计算成本高和时间事件模糊的问题。
- FM-VLA通过引入基于力的记忆机制,利用力历史进行时间上下文推理,从而克服了传统方法的限制。
- 在三个依赖记忆的任务中,FM-VLA的成功率超过80%,且推理开销极小,显著优于现有基线方法。
📝 摘要(中文)
视觉-语言-行动(VLA)模型在机器人操作中取得了显著的泛化能力,近期的记忆增强VLA通过对过去图像或语言摘要的条件化放宽了马尔可夫假设。然而,基于视觉的记忆方法在处理视觉模糊的时间事件时计算成本高且存在根本限制。为此,本文提出FM-VLA,一种基于力的记忆VLA模型,能够实现非马尔可夫的接触丰富操作的时间上下文推理。我们将力历史编码为紧凑的力记忆标记,并利用变分自编码器(VAE)进行预训练。通过将力潜在表示和短期状态历史作为附加条件标记投影到动作专家模块中,FM-VLA能够利用累积的接触事件历史来指导操作。我们在三个依赖记忆的任务上评估FM-VLA,结果显示其轻量级的力记忆在推理开销最小的情况下成功率超过80%,显著优于基线方法。
🔬 方法详解
问题定义:本文旨在解决在接触丰富的操作中,现有视觉-语言-行动模型在处理时间上下文时的局限性,尤其是当时间事件视觉上模糊时,传统方法的计算成本高且效果不佳。
核心思路:FM-VLA通过引入基于力的记忆机制,利用变分自编码器(VAE)将力历史编码为紧凑的记忆标记,从而实现对时间上下文的有效推理。这样的设计使得模型能够在操作过程中更好地利用历史接触事件信息。
技术框架:FM-VLA的整体架构包括力记忆模块和动作专家模块。力记忆模块负责将力时间序列转换为记忆标记,而动作专家模块则利用这些标记和短期状态历史进行决策。
关键创新:FM-VLA的主要创新在于其基于力的记忆机制,允许模型在非马尔可夫环境中进行时间上下文推理,这与传统的基于视觉的记忆方法形成了鲜明对比。
关键设计:在技术细节上,VAE的预训练过程专注于力时间序列重建,确保记忆标记的有效性。此外,模型的参数设置和损失函数设计经过精心调整,以优化记忆的存储和检索效率。
🖼️ 关键图片
📊 实验亮点
FM-VLA在三个依赖记忆的任务中表现出色,成功率超过80%,而且推理开销极小,显著优于基线方法。这一结果表明,基于力的记忆机制在复杂操作中的有效性和实用性。
🎯 应用场景
FM-VLA的研究成果在机器人操作、自动化制造和人机交互等领域具有广泛的应用潜力。通过提高机器人在复杂环境中的操作能力,该模型能够推动智能机器人在实际应用中的普及与发展,提升其自主性和灵活性。
📄 摘要(原文)
Vision-language-action (VLA) models have achieved impressive generalization in robotic manipulation, and recent memory-augmented VLAs have relaxed the Markovian assumption by conditioning on past images or language summaries. Vision-based memory approaches address this by conditioning on sampled past image frames, but they are computationally expensive and fundamentally limited when temporal events are visually ambiguous, e.g., pushing a button multiple times with small movements. We propose FM-VLA, a VLA model with force-based memory, enabling temporal context reasoning for non-Markovian, contact-rich manipulation. We encode force histories into compact force memory tokens with a variational autoencoder (VAE) pretrained with force time series reconstruction. By projecting force latent representations and short state history as additional conditioning tokens to the action expert module, we enable VLAs to leverage accumulated contact event history to guide manipulation. We evaluate FM-VLA on three memory-dependent tasks, including finding a hidden block, pressing a button, and wiping a dish for a specific number of times. Our lightweight force memory achieves over 80% success rate with minimal inference overhead, significantly outperforming baseline approaches. Project page: https://qft-333.github.io/FM-VLA-Page/