A Human-AI Teaming Framework for Deep Reinforcement Learning-Based Voltage Regulation in Distribution Networks

📄 arXiv: 2607.19667v1 📥 PDF

作者: Mahmuda Akter, Hamidreza Nazaripouya

分类: eess.SY

发布日期: 2026-07-22

备注: 10 pages, 3 figures


💡 一句话要点

提出人机交互强化学习框架以解决配电网电压调节问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱四:生成式动作 (Generative Motion)

关键词: 深度强化学习 电压调节 人机交互 自适应约束 配电网 智能电网 可再生能源

📋 核心要点

  1. 现有的深度强化学习方法在电压调节中表现出不安全的探索行为,收敛速度慢且可靠性有限,难以满足安全关键的电力系统需求。
  2. 本文提出了一种人机交互的强化学习框架,通过结合SAC代理和自适应拉格朗日约束机制,增强电压调节的安全性和鲁棒性。
  3. 实验结果显示,HI-LSAC在电压违规严重性和电力损耗方面显著低于其他基线方法,验证了其有效性和优越性。

📝 摘要(中文)

随着分布式能源资源(DERs)的日益普及,配电网的运行变异性增加,使得电压调节变得愈加复杂。传统的深度强化学习(DRL)方法在安全探索行为、收敛速度和可靠性方面存在不足,限制了其在安全关键电力系统中的应用。本文提出了一种人机交互强化学习框架,增强了自主电压调节的安全性和鲁棒性。该方法将软演员-评论家(SAC)代理与自适应拉格朗日约束机制相结合,以强制执行电压限制,同时通过协调电容器组和电池储能系统(BESS)调度提供基于灵敏度的修正。这些修正被纳入人机正则化演员损失中,使得策略能够内化安全且可解释的控制行为。仿真结果表明,提出的人机交互拉格朗日SAC(HI-LSAC)在电压违规严重性和电力损耗方面显著优于其他基线方法。

🔬 方法详解

问题定义:本文旨在解决配电网中电压调节的挑战,现有的DRL方法在安全性和可靠性方面存在不足,导致其在实际应用中的局限性。

核心思路:提出的人机交互强化学习框架通过引入人类指导模块和自适应约束机制,增强了电压调节的安全性和可解释性,确保了控制策略的有效性。

技术框架:该框架包括三个主要模块:SAC代理用于电压调节,拉格朗日约束机制用于强制执行电压限制,以及人类指导模块用于提供灵敏度基础的修正。

关键创新:最重要的创新在于将人机交互与强化学习相结合,通过人类反馈优化控制策略,使得电压调节更加安全和可靠。

关键设计:在设计中,采用了自适应拉格朗日约束来动态调整电压限制,并通过人机正则化损失函数来整合人类反馈,确保策略的安全性和可解释性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,HI-LSAC在电压违规严重性方面显著降低,电力损耗也得到了有效减少,相较于其他基线方法,性能提升幅度明显,验证了该框架的有效性。

🎯 应用场景

该研究的潜在应用领域包括智能电网、可再生能源集成和电力系统自动化等。通过提高电压调节的安全性和可靠性,该框架可以有效支持未来电力系统的稳定运行,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

The growing penetration of distributed energy resources (DERs) has increased the operational variability of distribution networks, making voltage regulation increasingly challenging. Conventional deep reinforcement learning (DRL) methods exhibit unsafe exploration behavior, slow convergence, and limited reliability, which restrict their applicability in safety-critical power system settings. This paper presents a human-interactive reinforcement learning framework that enhances the safety and robustness of autonomous voltage regulation. The proposed approach integrates a Soft Actor-Critic (SAC) agent with an adaptive Lagrange constraint mechanism to enforce voltage limits, while a human-guidance module provides sensitivity-based corrections through coordinated capacitor-bank and Battery Energy Storage System (BESS) dispatch. These corrections are incorporated into a human-regularized actor loss, enabling the policy to internalize safe and interpretable control behavior. The framework is implemented in the PowerGym-OpenDSS environment using the IEEE 13-node feeder. Simulation results show that the proposed Human-Interactive Lagrangian SAC (HI-LSAC) achieves significantly lower voltage-violation severity and reduced power losses compared with the other baseline methods.