PAC-ACT: Post-training Actor-Critic for Action Chunking Transformers
作者: Yujie Pang, Zudong Li
分类: cs.RO, cs.AI
发布日期: 2026-07-10
💡 一句话要点
提出PAC-ACT以解决工业接触操作中的高延迟和分布偏移问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 工业机器人 强化学习 动作分块 接触操作 行为先验约束
📋 核心要点
- 现有的视觉-语言-动作模型在工业接触操作中存在高推理延迟和GPU内存消耗的问题,限制了其实时应用。
- PAC-ACT通过在分块级别优化策略,构建了一个新的演员-评论家架构,并引入行为先验约束来解决分布偏移问题。
- 实验结果显示,PAC-ACT在接触任务中显著提高了成功率和接触稳定性,且在Contour任务中将峰值接触力降低了46倍。
📝 摘要(中文)
精确的工业接触操作需要在姿态扰动和接触力约束下可靠的机器人策略。尽管视觉-语言-动作模型具有广泛的泛化能力,但通常会引入高推理延迟和GPU内存成本,而视觉-动作分块策略更适合实时工业控制。然而,这些策略通常通过行为克隆训练,容易受到接触丰富任务中的分布偏移影响。本文提出PAC-ACT,一个针对预训练动作分块变换器策略的强化学习后训练框架。PAC-ACT在分块级别重新定义策略优化,构建了一个ACT转移的演员-评论家架构,并引入混合行为先验约束,以在在线微调过程中保持预训练动作分布。实验结果表明,PAC-ACT在工业精确接触基准上提高了任务成功率、接触稳定性和力安全性,同时保持低延迟和低GPU内存使用。
🔬 方法详解
问题定义:本文旨在解决工业接触操作中机器人策略的高延迟和分布偏移问题。现有的视觉-语言-动作模型虽然具有广泛的泛化能力,但在实时控制中表现不佳,尤其是在接触丰富的任务中,容易受到分布偏移的影响。
核心思路:PAC-ACT的核心思路是通过强化学习后训练框架,在分块级别重新定义策略优化。该方法旨在保持预训练模型的动作分布,同时提高策略在实际应用中的稳定性和安全性。
技术框架:PAC-ACT的整体架构包括一个基于动作分块变换器的演员-评论家模型。该框架首先进行预训练,然后通过在线微调引入混合行为先验约束,以确保策略在接触任务中的有效性。
关键创新:PAC-ACT的主要创新在于其混合行为先验约束的引入,这一设计使得在在线微调过程中能够有效保持预训练的动作分布,从而减少分布偏移的影响。与传统的行为克隆方法相比,PAC-ACT在策略优化上具有更高的灵活性和适应性。
关键设计:在PAC-ACT中,关键的参数设置包括混合行为先验的权重调整,以及损失函数的设计,确保在微调过程中既能保持预训练的优势,又能适应新的任务需求。网络结构上,采用了改进的演员-评论家架构,以增强策略的学习能力和稳定性。
🖼️ 关键图片
📊 实验亮点
在实验中,PAC-ACT在工业精确接触基准上表现出色,特别是在Contour任务中,显著降低了峰值接触力,并将超过60 N的力读数比例减少了46倍,显示出其在接触稳定性和安全性方面的显著提升。
🎯 应用场景
PAC-ACT的研究成果具有广泛的应用潜力,尤其是在工业自动化、机器人操作和智能制造等领域。通过提高机器人在复杂接触任务中的表现,PAC-ACT能够显著提升生产效率和安全性,未来可能推动更多高精度、高可靠性的机器人应用场景。
📄 摘要(原文)
Precision industrial contact manipulation requires reliable robot policies under pose perturbations and contact-force constraints. Vision-language-action models offer broad generalization but often introduce high inference latency and GPU-memory cost, while vision-action chunking policies are more suitable for real-time industrial control. However, these policies are usually trained by behavior cloning and suffer from distribution shift in contact-rich tasks. This paper proposes PAC-ACT, a reinforcement-learning post-training framework for pretrained Action Chunking Transformer policies. PAC-ACT reformulates policy optimization at the chunk level, constructs an ACT-transferred actor-critic architecture, and introduces a hybrid behavior-prior constraint to preserve the pretrained action distribution during online fine-tuning. Experiments on industrial precision-contact benchmarks show that PAC-ACT improves task success, contact stability, and force safety while retaining low latency and low GPU-memory usage. On the Contour task, PAC-ACT significantly reduces peak contact force and decreases the proportion of force readings above 60 N by 46 times. Sparse-reward ablations further show that the proposed behavior-prior constraint enables effective exploration under randomized initial poses.