FARM: Reading Failure Signals from the Internal Predictive States of a Frozen Robotic World Model
作者: Haoran Pei, Mingrui Luo, Senbao Wang, Haoran Lv, Jie Guo, Sheng Zhong, Ruixi Ci
分类: cs.RO
发布日期: 2026-09-10
💡 一句话要点
提出FARM以解决机器人在线故障监测问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 机器人故障监测 预训练模型 因果推断 实时监测 低延迟执行 监督学习 转移学习
📋 核心要点
- 现有的机器人故障监测方法主要依赖代理信号或专用监测组件,缺乏直接从模型内部获取故障信息的能力。
- FARM方法通过训练一个小型的监督读出网络,从冻结的预训练世界模型的内部状态中提取故障信息,提供实时监测能力。
- 在多个任务上,FARM方法在故障检测性能上超过了15个基线方法,显示出其在实际应用中的有效性和优势。
📝 摘要(中文)
可靠的机器人部署需要在线故障监测,但现有监测方法主要依赖代理信号或训练专用监测组件。本文探讨了冻结的预训练机器人世界模型的内部预测状态是否包含可直接解码的故障信息。FARM方法仅在冻结的VLA-JEPA预测状态上训练了一个33,985参数的监督读出,生成逐步故障评分和因果轨迹风险。在七个源任务上进行的五折交叉验证中,FARM达到了85.68/88.59的AUROC/AUPRC,并在10任务基准测试中在15个匹配基线中表现最佳。该方法在PIPER X、SO-101和Franka的四个真实机器人群体上进行了固定读出转移和读出适应测试,未更新预测骨干。FARM还能够从部分因果历史中区分故障,且在冻结状态可用时仅增加0.2256毫秒的CUDA延迟。这些结果支持将冻结的预测世界模型状态作为因果、可转移和低开销的执行监测的可重用特征。
🔬 方法详解
问题定义:本文旨在解决现有机器人故障监测方法依赖代理信号或专用组件的问题,缺乏直接从模型内部获取故障信息的能力。
核心思路:FARM方法的核心思想是利用冻结的预训练机器人世界模型的内部预测状态,训练一个小型的监督读出网络,从中提取可解码的故障信息,以实现实时监测。
技术框架:FARM的整体架构包括三个主要模块:冻结的VLA-JEPA预测状态、监督读出网络和故障评分生成模块。通过对冻结状态的读出,系统能够实时评估故障风险。
关键创新:FARM的主要创新在于使用冻结的预测状态作为可重用特征,避免了对预测骨干的更新,同时实现了低延迟的故障监测。这与现有方法的依赖于动态更新的策略形成了鲜明对比。
关键设计:FARM使用了33,985个参数的监督读出网络,设计了适应于冻结状态的损失函数,确保了故障评分的准确性和实时性。
🖼️ 关键图片
📊 实验亮点
FARM在七个源任务上进行的五折交叉验证中达到了85.68/88.59的AUROC/AUPRC,且在10任务基准测试中表现优于15个匹配基线,显示出其在故障监测中的卓越性能。此外,FARM在真实机器人群体上的适应性测试也表明其有效性,且仅增加0.2256毫秒的CUDA延迟。
🎯 应用场景
该研究的潜在应用领域包括工业机器人、自动驾驶车辆和服务机器人等需要高可靠性的场景。通过实时监测故障,FARM能够显著提高机器人系统的安全性和稳定性,降低维护成本,并为未来的智能机器人系统提供重要的技术支持。
📄 摘要(原文)
Reliable robot deployment requires online failure monitoring, yet existing monitors mainly derive risk from proxy signals or train dedicated monitoring components. We ask whether the internal predictive states of a frozen pretrained robotic world model already contain directly decodable failure information. Failure-Aware Readout from World Models (FARM) trains only a 33,985-parameter supervised readout over frozen VLA-JEPA predictive states, producing step-wise failure scores and causal trajectory risk. Five-fold out-of-fold evaluation across seven source tasks reaches 85.68/88.59 pooled AUROC/AUPRC, and FARM gives the best Seen performance among 15 matched baselines on the 10-task benchmark. Across four real-robot populations on PIPER X, SO-101, and Franka, fixed-readout transfer and readout-only adaptation test deployment shifts without updating the predictive backbone. FARM also discriminates failures from partial causal histories and adds 0.2256 ms mean CUDA latency once the frozen state is available. These results support frozen predictive world-model states as reusable features for causal, transferable, and low-overhead execution monitoring.