ActSafeGuard: Differentiable and Training-Aligned Constraint Enforcement for Flow-Matching Policies
作者: Jianming Ma, Rongjun Jin, Xiaxi Si, Yang Zhang, Yiheng Li, Yue Gao
分类: cs.RO, cs.AI
发布日期: 2026-09-10
备注: 8 pages, 4 figures
💡 一句话要点
提出ActSafeGuard以解决机器人操作中的安全性问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 机器人操作 安全性 流匹配策略 可微分模型 物理约束 智能制造 具身AI
📋 核心要点
- 现有的机器人操作方法在安全性上存在不足,生成的动作可能违反物理约束,导致不安全的执行。
- ActSafeGuard通过引入可微分的安全保护层,将硬性动作可行性集成到策略学习中,解决了训练与执行之间的不匹配问题。
- 实验结果显示,ActSafeGuard在多个任务上实现了$100\%$的步骤安全率,同时保持或提升了任务成功率,展现出其有效性。
📝 摘要(中文)
视觉-语言-动作(VLA)和世界-动作模型(WAMs)在通用机器人操作中表现出强大的能力,但其生成的动作可能违反硬性物理约束,从而导致不安全或不可行的部署。现有的安全性方法要么在统计安全目标上进行优化而没有逐步的确定性保证,要么仅在推理阶段修正不安全的动作,造成策略训练与执行之间的不匹配。我们提出了ActSafeGuard,这是一种可微分且与训练对齐的安全保护层,旨在流匹配策略中集成硬性动作可行性。通过分析光线缩放算子的设计,ActSafeGuard能够引导模型自然学习受约束的流形。大量在多个标准基础模型(如$π_{0.5}$和Fast-WAM)上的实验表明,ActSafeGuard在保持或提升任务成功率的同时,始终实现$100\%$的步骤安全率,为安全的具身AI部署提供了一种可扩展且最小侵入的解决方案。
🔬 方法详解
问题定义:本论文旨在解决机器人操作中生成的动作可能违反物理约束的问题。现有方法在安全性保障上存在不足,无法在训练阶段有效地考虑安全性,导致在执行时可能出现不安全的动作。
核心思路:论文提出的ActSafeGuard通过引入可微分的安全保护层,将安全性作为策略学习的一部分,而非仅在推理时进行修正。这种设计使得模型能够在训练阶段就考虑到动作的可行性,从而提高安全性。
技术框架:ActSafeGuard的整体架构包括一个流匹配策略和一个集成的安全保护层。安全保护层通过分析光线缩放算子,生成边界感知的梯度,指导模型学习受约束的流形。
关键创新:ActSafeGuard的核心创新在于将安全性集成到策略学习中,使得模型在训练时就能考虑到动作的可行性。这与现有方法在推理阶段修正不安全动作的做法形成了本质区别。
关键设计:在设计中,ActSafeGuard使用了特定的损失函数来平衡任务成功率与安全性,同时采用了边界感知的梯度更新机制,以确保模型能够有效学习受约束的动作空间。具体的参数设置和网络结构细节在实验部分进行了详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果表明,ActSafeGuard在多个标准基础模型上实现了$100\%$的步骤安全率,同时在任务成功率上保持或提升了性能,相较于基线方法展现出显著的安全性提升,证明了其有效性和可行性。
🎯 应用场景
该研究的潜在应用领域包括机器人操作、自动驾驶、智能制造等需要高安全性和高可靠性的场景。通过确保机器人在执行任务时遵循物理约束,ActSafeGuard能够显著提升机器人系统的安全性和实用性,推动具身AI的安全部署与应用。
📄 摘要(原文)
Vision-Language-Action (VLA) and World-Action Models (WAMs) have demonstrated strong capabilities in general-purpose robotic manipulation, yet their generated actions may violate hard physical constraints and therefore be unsafe or infeasible for deployment. Existing safety approaches either optimize statistical safety objectives without deterministic per-step guarantees or correct unsafe actions only during inference, creating a mismatch between policy training and execution. We introduce ActSafeGuard, a differentiable and training-aligned safeguard layer for flow-matching based policies. ActSafeGuard integrates hard action feasibility into policy learning, not merely treating safety as an inference-time external component. Through an analytical ray-scaling operator design, ActSafeGuard enables boundary-aware gradients to guide the model to naturally learn constrained manifolds. Extensive experiments on multiple standard foundation backbones ($π_{0.5}$ and Fast-WAM) across various tasks demonstrate that ActSafeGuard consistently achieves a $100\%$ step safety rate while fully preserving or even boosting task success rates, providing a scalable and minimally invasive solution for safe embodied AI deployment.