Network Contention-Aware Cluster Scheduling with Reinforcement Learning

📄 arXiv: 2310.20209v1 📥 PDF

作者: Junyeol Ryu, Jeongyoon Eo

分类: cs.LG, cs.DC

发布日期: 2023-10-31


💡 一句话要点

提出基于强化学习的网络争用感知集群调度方法

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: GPU集群 强化学习 网络争用 调度策略 深度学习 资源优化

📋 核心要点

  1. 现有调度策略对作业之间的网络争用缺乏敏感性,导致训练效率低下。
  2. 本文通过强化学习将GPU集群调度建模为一个问题,学习网络争用感知的调度策略。
  3. 实验结果显示,提出的方法在作业完成时间和资源利用率之间实现了良好的平衡,显著提升了调度性能。

📝 摘要(中文)

随着深度学习的不断进步,分布式训练在GPU集群中变得越来越普遍。然而,网络争用会显著降低训练吞吐量,现有调度策略往往无法有效应对这一问题。本文提出了一种新的方法,通过强化学习来缓解GPU集群中的网络争用。我们将GPU集群调度问题建模为强化学习问题,旨在学习一种网络争用感知的调度策略,能够有效捕捉争用敏感性,并通过持续评估和改进动态调整调度决策。实验结果表明,与广泛使用的调度策略相比,我们的方法在平均作业完成时间上减少了最多18.2%,并有效降低了尾部作业完成时间,提升幅度达到20.7%。

🔬 方法详解

问题定义:本文旨在解决GPU集群中由于网络争用导致的训练吞吐量下降问题。现有调度策略未能考虑作业间的网络争用,造成资源利用率低下和作业完成时间延长。

核心思路:我们将GPU集群调度视为一个强化学习问题,通过学习网络争用感知的调度策略,能够动态适应作业间的争用情况,从而优化调度决策。

技术框架:整体架构包括环境建模、状态表示、动作选择和奖励机制四个主要模块。环境建模用于模拟GPU集群的运行状态,状态表示捕捉网络争用信息,动作选择基于学习的策略进行调度,奖励机制用于评估调度效果。

关键创新:本研究的主要创新在于引入强化学习框架来处理网络争用问题,能够动态调整调度策略,显著提高了调度的灵活性和效率。与传统方法相比,能够更好地适应不同作业的网络需求。

关键设计:在参数设置上,采用了自适应学习率和经验回放机制,以提高学习效率。损失函数设计上,结合了作业完成时间和资源利用率,以实现多目标优化。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,提出的调度方法在平均作业完成时间上减少了最多18.2%,尾部作业完成时间降低了20.7%。这些结果表明,相较于传统调度策略,本文方法在提升GPU集群调度性能方面具有显著优势。

🎯 应用场景

该研究的潜在应用领域包括高性能计算、云计算和大规模深度学习训练等场景。通过优化GPU集群的调度策略,可以显著提升资源利用率和训练效率,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

With continuous advances in deep learning, distributed training is becoming common in GPU clusters. Specifically, for emerging workloads with diverse amounts, ratios, and patterns of communication, we observe that network contention can significantly degrade training throughput. However, widely used scheduling policies often face limitations as they are agnostic to network contention between jobs. In this paper, we present a new approach to mitigate network contention in GPU clusters using reinforcement learning. We formulate GPU cluster scheduling as a reinforcement learning problem and opt to learn a network contention-aware scheduling policy that efficiently captures contention sensitivities and dynamically adapts scheduling decisions through continuous evaluation and improvement. We show that compared to widely used scheduling policies, our approach reduces average job completion time by up to 18.2\% and effectively cuts the tail job completion time by up to 20.7\% while allowing a preferable trade-off between average job completion time and resource utilization.