Spatial LLM Workload Shifting Needs Foresight: Model Commitment for AI Data Center Operation under Power Grid Constraints
作者: Bojun Du, Hongyang Jia, Tonghui Li, Qingchun Hou, Ze Wang, Ershun Du, Ning Zhang
分类: eess.SY
发布日期: 2026-09-09
备注: 3 pages, 2 figures
💡 一句话要点
提出模型承诺以解决AI数据中心在电网约束下的负载转移问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: AI数据中心 负载转移 模型承诺 电力约束 混合整数线性规划 服务率优化 运营成本降低
📋 核心要点
- 现有负载转移方法假设数据中心可以立即处理请求,可能导致不可行的转移和未满足的需求。
- 提出模型承诺(MC)框架,通过混合整数线性规划联合调度模型部署和请求路由,考虑电力约束。
- 案例研究显示,MC在时变电网条件下实现100%服务率,并降低运营成本29.0%。
📝 摘要(中文)
AI数据中心在某些时期可能面临电力供应短缺,需将大型语言模型(LLM)推理工作负载进行空间转移以维持服务率。然而,现有的负载转移方法通常假设任何具备足够计算资源的数据中心可以立即处理转移请求,这可能导致不可行的转移和未满足的需求。本文提出了一种混合整数线性规划框架——模型承诺(MC),在电力约束和电价信号下联合调度模型部署和跨站请求路由。MC首先制定了模型副本加载所引入的时间耦合关系,其次将预填充和解码延迟要求转化为每个副本可服务的需求量。基于真实数据的案例研究表明,MC使AI数据中心运营商在时变电网条件下实现了100%的服务率,并将总运营成本降低了29.0%。
🔬 方法详解
问题定义:本文旨在解决AI数据中心在电力供应不足时的负载转移问题。现有方法未考虑电网约束,可能导致请求无法被满足。
核心思路:模型承诺(MC)框架通过混合整数线性规划,联合调度模型部署与请求路由,确保在电力约束下优化服务率与成本。
技术框架:MC框架包括两个主要模块:模型副本加载调度和跨站请求路由。前者处理模型的部署与加载,后者负责请求的智能路由。
关键创新:MC的创新在于引入了时间耦合关系,考虑了模型副本的加载时间与请求服务能力的动态变化,显著提升了负载转移的可行性与效率。
关键设计:MC框架中,关键参数包括电力约束、延迟要求和电价信号,损失函数设计为综合考虑服务率与运营成本的平衡。
🖼️ 关键图片
📊 实验亮点
实验结果表明,模型承诺(MC)框架在时变电网条件下实现了100%的服务率,相比于传统方法,运营成本降低了29.0%。这一显著提升展示了MC在实际应用中的有效性和优势。
🎯 应用场景
该研究的潜在应用领域包括大型AI数据中心的运营管理,尤其是在电力资源有限的情况下。通过优化负载转移策略,数据中心能够提高服务的可靠性和经济性,未来可能对智能电网和可再生能源的集成产生积极影响。
📄 摘要(原文)
AI data centers may face power supply shortages during certain periods, requiring operators to shift large language model (LLM) inference workloads spatially to maintain service rates. However, existing workload-shifting methods typically assume that any data center with sufficient computing resources can immediately serve shifted requests, which may lead to infeasible transfers and unserved demand. This letter proposes model commitment (MC), a mixed-integer linear programming framework that jointly schedules model deployment and cross-site request routing under power constraints and electricity-price signals. First, MC formulates the intertemporal coupling introduced by model replica loading. Second, it translates prefill and decode latency requirements into the amount of demand that each replica can serve. Case studies based on real-world data show that MC enables AI data center operators to achieve a 100% service rate under time-varying grid conditions and reduce total operating cost by 29.0%.