Digital Twin Assisted Deep Reinforcement Learning for Online Admission Control in Sliced Network

📄 arXiv: 2310.09299v3 📥 PDF

作者: Zhenyu Tao, Wei Xu, Xiaohu You

分类: cs.LG, eess.SP, eess.SY

发布日期: 2023-10-07 (更新: 2023-11-21)

备注: 13 pages, 8 figures, in IEEE Transactions on Communications

DOI: 10.1109/TCOMM.2024.3476430


💡 一句话要点

提出数字双胞胎加速深度强化学习以解决切片网络的在线接纳控制问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 数字双胞胎 深度强化学习 接纳控制 网络切片 马尔可夫决策过程 资源优化 5G网络 服务质量

📋 核心要点

  1. 现有的深度强化学习方法在接纳控制中存在初始不稳定性和收敛延迟过长的问题,限制了其在实际网络中的应用。
  2. 本文提出了一种数字双胞胎加速的深度强化学习方案,通过将接纳决策过程形式化为马尔可夫决策过程来简化问题。
  3. 实验结果显示,DT加速的DRL在资源利用率上比传统的对抗深度Q学习模型提高了超过40%,同时优化了长期奖励。

📝 摘要(中文)

随着5G及未来网络中多样化无线服务的涌现,网络切片技术应运而生,其中接纳控制在实现服务导向的优化目标中发挥着关键作用。尽管深度强化学习(DRL)在许多接纳控制方法中因其有效性和灵活性而成为基础,但DRL模型的初始不稳定性和过长的收敛延迟限制了其在实际网络中的应用。为此,本文提出了一种数字双胞胎(DT)加速的DRL解决方案。具体而言,我们首先将接纳决策过程形式化为半马尔可夫决策过程,并简化为等效的离散时间马尔可夫决策过程,以便于DRL方法的实施。通过监督学习训练的基于神经网络的DT被建立,并用于辅助DRL模型的训练阶段。大量仿真表明,DT加速的DRL相比于直接训练的最先进的对抗深度Q学习模型,资源利用率提高了40%以上,同时保持了优化接纳过程长期奖励的能力。

🔬 方法详解

问题定义:本文旨在解决在切片网络中接纳控制的效率问题,现有的深度强化学习方法由于初始不稳定性和收敛延迟过长,难以在实际应用中发挥作用。

核心思路:论文提出通过数字双胞胎技术加速深度强化学习的训练过程,利用数字双胞胎模拟环境来提高模型的收敛速度和稳定性。

技术框架:整体架构包括将接纳决策过程建模为半马尔可夫决策过程,并简化为离散时间马尔可夫决策过程。建立一个基于神经网络的数字双胞胎,经过监督学习训练后,辅助DRL模型的训练。

关键创新:最重要的创新在于引入数字双胞胎技术来加速深度强化学习的训练过程,这一方法显著提高了资源利用率,并解决了传统DRL模型的收敛问题。

关键设计:在数字双胞胎的设计中,采用了定制的输出层以适应排队系统的需求,并通过监督学习进行训练,确保其能够有效辅助DRL模型的训练阶段。该方法的参数设置和损失函数设计均经过精心调整,以优化训练效果。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,数字双胞胎加速的深度强化学习模型在资源利用率上比传统的对抗深度Q学习模型提高了超过40%。这一显著提升不仅提高了接纳控制的效率,还保持了优化长期奖励的能力,展示了该方法的有效性。

🎯 应用场景

该研究的潜在应用领域包括5G及未来网络中的服务接纳控制,尤其是在资源有限的环境中优化服务质量。通过提高接纳控制的效率,能够更好地满足用户需求,提升网络的整体性能,具有重要的实际价值和未来影响。

📄 摘要(原文)

The proliferation of diverse wireless services in 5G and beyond has led to the emergence of network slicing technologies. Among these, admission control plays a crucial role in achieving service-oriented optimization goals through the selective acceptance of service requests. Although deep reinforcement learning (DRL) forms the foundation in many admission control approaches thanks to its effectiveness and flexibility, initial instability with excessive convergence delay of DRL models hinders their deployment in real-world networks. We propose a digital twin (DT) accelerated DRL solution to address this issue. Specifically, we first formulate the admission decision-making process as a semi-Markov decision process, which is subsequently simplified into an equivalent discrete-time Markov decision process to facilitate the implementation of DRL methods. A neural network-based DT is established with a customized output layer for queuing systems, trained through supervised learning, and then employed to assist the training phase of the DRL model. Extensive simulations show that the DT-accelerated DRL improves resource utilization by over 40% compared to the directly trained state-of-the-art dueling deep Q-learning model. This improvement is achieved while preserving the model's capability to optimize the long-term rewards of the admission process.