Routing Dense Layouts with History-Aware Offline Reinforcement Learning using LSTM
作者: Afsara Khan, Austin Rovinski
分类: cs.AR, cs.LG
发布日期: 2026-09-08
备注: Accepted for publication at ICCAD 2026
💡 一句话要点
提出历史感知的离线强化学习以解决密集布局路由问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 强化学习 路由优化 密集布局 LSTM 设计规则违规 电子设计自动化 集成电路设计
📋 核心要点
- 现有的路由方法在高密度设计中面临显著挑战,难以有效解决设计规则违规问题。
- 本文提出了一种历史感知的离线强化学习策略,利用LSTM架构和额外特征来改善路由收敛性。
- 实验结果显示,该策略在设计规则违规方面平均减少92%,并且运行时间降低了10%。
📝 摘要(中文)
详细路由在物理设计中因设计规则复杂性而成为主要的运行瓶颈。现代路由器在密集操作条件下难以解决持续的违规问题。尽管近期研究利用强化学习动态选择每次路由迭代的成本,但在高密度设计中效果不佳。为此,本文提出了一种历史感知的离线强化学习策略,通过利用路由器的现成特征,预测密集环境下的迭代成本权重,从而改善不同放置密度下的收敛性。该策略采用保守的Q学习,并结合轻量级LSTM架构以保留序列上下文,显著提高了多种密度和路由引导质量下的收敛性。我们的策略可以在不干扰核心搜索算法的情况下,最小化管道更改地集成到任何基于成本的路由器中。实验结果表明,该策略在密集放置和低引导质量下的困难操作点上,平均减少设计规则违规(DRVs)92%,同时运行时间减少10%。
🔬 方法详解
问题定义:本文旨在解决在高密度设计条件下,现有路由方法难以有效处理设计规则违规的问题。现有基于强化学习的路由方法在密集布局中表现不佳,导致收敛性差。
核心思路:提出的历史感知离线强化学习策略通过预测密集环境下的迭代成本权重,利用LSTM架构保留序列上下文,从而提高路由的收敛性。该方法旨在改善不同放置密度下的路由效果。
技术框架:整体架构包括数据输入模块、LSTM网络模块和成本预测模块。数据输入模块提取路由器的现成特征,LSTM网络用于处理序列数据,成本预测模块生成每次迭代的成本权重。
关键创新:最重要的创新在于结合LSTM架构与强化学习,能够有效保留历史信息,从而在多种密度和路由引导质量下显著提高收敛性。这一设计与传统方法的本质区别在于对序列上下文的重视。
关键设计:在参数设置上,采用保守的Q学习算法,LSTM网络设计为轻量级以适应实时路由需求。损失函数设计为最小化设计规则违规,同时考虑运行时间的优化。
🖼️ 关键图片
📊 实验亮点
实验结果表明,提出的历史感知离线强化学习策略在密集布局和低引导质量下的困难操作点上,平均减少设计规则违规(DRVs)92%,并且运行时间降低了10%。这一显著提升相较于现有的公共基线,展示了该方法的有效性和优势。
🎯 应用场景
该研究的潜在应用领域包括集成电路设计、电子设计自动化(EDA)工具以及高性能计算系统的布局优化。通过提高路由效率和减少设计违规,能够显著提升芯片设计的整体性能和可靠性,具有重要的实际价值和未来影响。
📄 摘要(原文)
Detailed routing remains a dominant runtime bottleneck in physical design due to increasing complexity of design rules. Modern routers can struggle to resolve persistent violations under dense operating conditions. While recent work leverages reinforcement learning (RL) to dynamically select costs for each routing iteration, we find that this technique struggles with high-density designs where routing solutions are significantly harder. To address this, we present a history-aware offline RL policy which predicts iterative cost weights in these dense regimes to improve convergence across placement densities by utilizing readily available features from the router. Our policy uses conservative Q-learning similarly to prior work; however, our key insight is that addition of a lightweight LSTM architecture and additional features can retain sequence context and improve routing convergence across multiple densities and route guide qualities. Our policy can be integrated into any cost-based router with minimal pipeline changes, as it does not interfere with the core search algorithm. We evaluate our policy on held-out density and adjustment settings, including difficult operating points induced by dense placement and low guide quality. Our policy reduces design rule violations (DRVs) by an average of 92% over the top public baseline while simultaneously reducing runtime by 10%.