MPFlow: Learning Budgeted Max-Flow Optimization on the Lightning Network with Deep Graph Reinforcement Learning

📄 arXiv: 2607.08703v1 📥 PDF

作者: Harrison Rush, Vincent Davis, Simone Antonelli, Vikash Singh, Jesse Shrader, Emanuele Rossi

分类: cs.LG

发布日期: 2026-07-09


💡 一句话要点

提出MPFlow以解决比特币闪电网络的流动性配置问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 比特币 闪电网络 流动性配置 图强化学习 组合优化 近端策略优化 路由能力 深度学习

📋 核心要点

  1. 核心问题:现有方法在比特币闪电网络中无法有效解决流动性配置,导致路由能力不足。
  2. 方法要点:论文提出通过图强化学习解决预算约束的组合优化问题,优化通道选择以提升路由能力。
  3. 实验或效果:在真实数据上进行的实验表明,所提方法在最大流目标上显著优于多种启发式基线。

📝 摘要(中文)

本文针对比特币闪电网络中的流动性配置问题进行研究:在固定预算下,节点应选择哪些通道以最大化其路由能力。我们将此问题视为一个预算约束的组合优化问题,通过图强化学习来解决。我们的轻量级代理结合了消息传递策略网络、近端策略优化(PPO)和动作屏蔽,并在一个排除中心节点的课程下进行训练。通过在真实的闪电网络快照上进行广泛实验,我们的方法在多个种子和未见图上始终优于强启发式基线。该代理已在生产中部署,执行了4640个通道开放决策,累计分配267.3 BTC,涉及超过1600万美元的资金。

🔬 方法详解

问题定义:本文旨在解决比特币闪电网络中的流动性配置问题,具体为在固定预算下选择最佳通道以最大化路由能力。现有方法往往依赖于启发式策略,缺乏系统性和灵活性,导致路由能力未能得到有效提升。

核心思路:论文的核心思路是将流动性配置问题转化为预算约束的组合优化问题,并利用图强化学习进行求解。通过设计轻量级代理,结合消息传递策略网络和近端策略优化(PPO),使得模型能够在复杂的网络环境中学习到有效的通道选择策略。

技术框架:整体架构包括数据输入、消息传递策略网络、动作选择和训练模块。首先,模型接收网络状态信息,然后通过消息传递机制更新节点的表示,最后根据策略网络选择最佳的通道进行开放。训练过程中采用动作屏蔽技术,以避免选择已存在的通道。

关键创新:最重要的技术创新在于引入了排除中心节点的训练策略,迫使模型学习到更具容量意识的通道选择,而非简单依赖于网络中的中心节点。这一设计使得模型在多样化的网络环境中表现更佳。

关键设计:在模型设计中,采用了近端策略优化(PPO)作为训练算法,并设置了特定的损失函数以平衡探索与利用。此外,消息传递策略网络的结构经过优化,以提高信息传递的效率和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提方法在最大流目标上显著优于多种强启发式基线,具体表现为在不同种子和未见图上均取得了更高的路由能力。代理已成功执行4640个通道开放决策,累计分配267.3 BTC,涉及超过1600万美元的资金,证明了其在实际应用中的有效性。

🎯 应用场景

该研究的潜在应用领域包括比特币闪电网络的流动性管理、区块链技术的优化以及智能合约的执行。通过有效的通道选择策略,可以显著提升网络的整体性能和用户体验,未来可能对去中心化金融(DeFi)领域产生深远影响。

📄 摘要(原文)

We address liquidity placement in the Bitcoin Lightning Network (LN): given a fixed budget, which channels should a node open to maximize its routing capacity? We cast this as a budget-constrained combinatorial optimization problem on graphs, selecting $k$ edge additions that maximize $s$--$t$ max-flow, a theory-grounded measure of routing capacity, and solve it with graph reinforcement learning. Our lightweight agent combines a message-passing policy network with proximal policy optimization (PPO) and action masking, and is trained under a hub-exclusion curriculum: the network's top hubs are removed from training subgraphs, forcing the policy to learn capacity-aware placement rather than hub attachment. In extensive experiments on real Lightning Network snapshots, our method consistently outperforms strong heuristic baselines on the max-flow objective across multiple seeds and unseen graphs. The agent has been deployed in production for peer recommendations, executing 4640 channel-open decisions that cumulatively allocate 267.3 BTC over $16 million across 30 managed nodes.