Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control
作者: Jihoon Hong, Julian Skifstad, Qiyue Dai, Alice Chan, Glen Chou
分类: cs.RO, cs.AI, cs.LG, eess.SY, math.OC
发布日期: 2026-07-16
💡 一句话要点
通过机械解释性和最优控制提升世界行动模型的鲁棒性
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 世界行动模型 鲁棒性 机械解释性 最优控制 线性二次调节器 对比激活方向 动态系统
📋 核心要点
- 现有的世界行动模型在面对分布转移时表现出脆弱性,难以保持鲁棒性。
- 本文通过机械解释性分析WAM激活空间中的鲁棒性相关特征,并提出无训练的对比激活方向引导方法。
- 实验结果表明,WA-LQR在新任务上具有良好的泛化能力,并在多种扰动下显著提高了鲁棒性。
📝 摘要(中文)
世界行动模型(WAMs)能够实现语义和物理驱动的控制,但在分布转移下表现脆弱。本文利用机械解释性研究鲁棒性相关扰动在WAM激活空间中的表现。通过比较成功与失败的执行结果,我们发现某些WAM架构在鲁棒性关键特征上展现出低维线性可分性,而其他架构则不然。这促使我们使用对比激活方向进行无训练的WAM引导。我们还展示了WAM激活动态中的局部线性使得通过基于模型的最优控制实现高效反馈引导成为可能,提出了世界行动线性二次调节器(WA-LQR),这是一种最小侵入的降阶LQR控制器。通过机械评估,我们预测Cosmos-Policy和DiT4DiT模型具有强引导性,而LingBot-VA则较弱,这与引导干预结果一致。在Cosmos-Policy和DiT4DiT上,WA-LQR将对比方向推广到新任务,并在相机、抓手和视觉噪声扰动下提高了鲁棒性,相较于未引导和提示引导基线有显著改善。
🔬 方法详解
问题定义:本文旨在解决世界行动模型在分布转移下的鲁棒性不足问题。现有方法在面对环境变化时表现脆弱,难以保持稳定的控制性能。
核心思路:通过机械解释性分析WAM的激活空间,识别出与鲁棒性相关的特征,并利用对比激活方向进行无训练的引导,从而提升模型的鲁棒性。
技术框架:整体框架包括对WAM激活空间的分析、对比激活方向的生成以及基于模型的最优控制(WA-LQR)的实现。主要模块包括激活特征提取、对比方向生成和控制器设计。
关键创新:最重要的技术创新在于引入了对比激活方向进行无训练的引导,解决了传统方法在鲁棒性特征提取上的不足,提升了模型的适应性。
关键设计:在设计中,采用了局部线性假设来简化激活动态,并通过最小侵入的方式实现降阶LQR控制器的设计,确保了控制器的高效性与鲁棒性。具体参数设置和损失函数设计未详细披露,属于未知领域。
🖼️ 关键图片
📊 实验亮点
实验结果显示,WA-LQR在Cosmos-Policy和DiT4DiT模型上成功推广对比方向至新任务,并在相机、抓手和视觉噪声扰动下,相较于未引导和提示引导基线,鲁棒性显著提高,具体提升幅度未详细披露,属于未知领域。
🎯 应用场景
该研究的潜在应用领域包括机器人控制、自动驾驶和智能制造等,能够在动态和不确定环境中提升系统的鲁棒性和适应性。未来,基于此研究的技术可以广泛应用于需要高可靠性的自动化系统中,推动智能系统的进一步发展。
📄 摘要(原文)
World Action Models (WAMs) enable semantically- and physically-informed control but are brittle under distribution shift. In this work, we use mechanistic interpretability to study how robustness-relevant perturbations are represented in WAM activation space. Comparing activations across successful and unsuccessful rollouts, we find some WAM architectures exhibit low-dimensional linear separability for robustness-critical features, while others do not. This motivates the use of contrastive activation directions for training-free WAM steering. We also show that local linearity in WAM activation dynamics enables efficient feedback steering via model-based optimal control, yielding World-Action Linear Quadratic Regulator (WA-LQR), a minimally-invasive reduced-order LQR controller. Via mechanistic evaluations, we predict strong steerability in the Cosmos-Policy and DiT4DiT models but weak steerability in LingBot-VA, consistent with steering intervention results. On Cosmos-Policy and DiT4DiT, WA-LQR generalizes contrastive directions to new tasks and improves robustness to camera, gripper, and visual-noise perturbations over unsteered and prompt steering baselines.