Policy Iteration for Domain Randomized Linear Quadratic Systems

📄 arXiv: 2609.04794v1 📥 PDF

作者: Abbas Pasdar, Farnaz Adib Yaghmaie

分类: math.OC, eess.SY

发布日期: 2026-09-04

备注: 8 pages, 2 figures, accepted for CDC 2026 | Honolulu, Hawaii, USA


💡 一句话要点

提出一种策略迭代算法以优化随机化线性二次控制问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control)

关键词: 线性二次控制 策略迭代 领域随机化 不确定动态 稳定性分析 收敛性 控制系统 优化算法

📋 核心要点

  1. 现有方法在处理具有不确定动态的线性二次控制问题时,往往难以保证稳定性和收敛性。
  2. 论文提出了一种新的策略迭代算法,采用步长规则以确保在每次迭代中保持系统的稳定性。
  3. 实验结果表明,该方法在样本平均目标上实现了单调改善,并且在特定条件下达到了全局线性收敛速率。

📝 摘要(中文)

本研究探讨了在领域随机化下的策略优化,重点是学习一个单一的状态反馈控制器,以最小化具有不确定动态的系统的平均成本。我们提出了一种策略迭代算法,采用稳定性保持的步长规则,确保每次迭代在所有采样系统中保持稳定性。研究表明,该方法能够单调改善样本平均目标,并且总存在一个稳定的步长。在标准光滑性假设下,迭代序列逐步收敛到驻点;在梯度主导条件下,我们获得了全局线性收敛速率。

🔬 方法详解

问题定义:本论文旨在解决在领域随机化下的线性二次控制问题,现有方法在面对不确定动态时,往往无法保证控制器的稳定性和收敛性。

核心思路:提出的策略迭代算法通过引入步长规则,确保在每次迭代中控制器的稳定性,从而有效优化平均成本。

技术框架:该方法的整体架构包括策略迭代的核心模块、步长调整机制以及收敛性分析,确保在不同系统动态下的稳定性。

关键创新:最重要的技术创新在于步长规则的设计,该规则能够在所有采样系统中保持稳定性,与现有方法相比,显著提高了收敛性和稳定性。

关键设计:在算法实现中,采用了标准的光滑性假设,并在梯度主导条件下进行了收敛性分析,确保了算法的有效性和可靠性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,所提出的策略迭代算法在样本平均目标上实现了单调改善,且在特定条件下达到了全局线性收敛速率,显著优于传统方法,展示了良好的稳定性和收敛性。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、机器人控制和智能制造等,能够为复杂动态环境下的控制系统提供有效的解决方案,提升系统的稳定性和性能。未来,该方法可能在更多不确定性较高的控制任务中发挥重要作用。

📄 摘要(原文)

In this work, we study policy optimization under domain randomization for linear quadratic control, focusing on learning a single state-feedback controller that minimizes the average cost across systems with uncertain dynamics. We propose a policy iteration algorithm with a step-size rule that preserves stability across all sampled systems at each iteration. We show that the method yields monotonic improvement of the sample-average objective and that a stabilizing step size always exists. Under standard smoothness assumptions, the iterates converge subsequentially to stationary points, and under a gradient-dominance condition, we obtain a global linear convergence rate.