Miles v0.1: Production-Level Post-Training

📄 arXiv: 2609.08368v1 📥 PDF

作者: RadixArk, :, Tom Chen, Mao Cheng, Shi Dong, Kangrui Du, Yanbin Jiang, Jiajun Li, Yiming Li, Tao Lin, Yusheng Su, Andy Ye, Yueming Yuan, Zhichen Zeng

分类: cs.LG, cs.CL

发布日期: 2026-09-08

备注: 34 pages, 5 figures, 9 tables. Technical report

🔗 代码/项目: GITHUB


💡 一句话要点

提出Miles v0.1以实现前沿后训练的生产级系统

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 后训练 强化学习 模块化设计 可扩展性 生产级系统

📋 核心要点

  1. 现有的强化学习系统在可扩展性和定制性方面存在不足,难以满足生产级应用的需求。
  2. Miles v0.1通过设计可验证、清晰且可定制的组件,构建了一个完整的后训练系统,提升了强化学习的可用性。
  3. 在GLM-5.2模型上进行的实验显示,Miles实现了高效的异步强化学习,首次30个步骤的中位步长时间为263秒。

📝 摘要(中文)

我们提出Miles v0.1,这是一个完整的、生产级的前沿后训练系统。基于slime的清晰设计,Miles围绕一个核心原则设计强化学习训练循环的每个阶段:组件应经过验证、清晰且可定制。Miles以准确性、效率、可靠性和可扩展性为首要目标,旨在使前沿规模的强化学习对研究人员和企业都可及。本文详细介绍了系统的各个环节,包括基于SGLang的回滚引擎、支持NVIDIA Megatron-LM和PyTorch FSDP的训练器,以及适用于不同部署拓扑的三种权重同步传输方式。除了全参数强化学习,Miles还支持LoRA RL、在线蒸馏、监督微调和真实在线策略回滚训练对齐,并将相同架构扩展到扩散模型。最后,我们以GLM-5.2 744B-A40B模型在64个NVIDIA GB300 GPU上进行的完全异步智能强化学习的案例研究作为结尾,首次30个测量步骤的中位步长时间为263秒。Miles已开源,项目网站为https://miles.radixark.com。

🔬 方法详解

问题定义:本论文旨在解决现有强化学习系统在可扩展性、效率和定制性方面的不足,尤其是在生产环境中的应用挑战。

核心思路:论文提出的核心思路是围绕验证、清晰和可定制的原则设计每个组件,从而构建一个完整的后训练系统,以满足前沿规模的强化学习需求。

技术框架:Miles的整体架构包括多个主要模块:回滚引擎(基于SGLang)、支持两种后端的训练器(NVIDIA Megatron-LM和PyTorch FSDP),以及三种权重同步传输方式,适应不同的部署拓扑。

关键创新:Miles的主要创新在于其设计理念和模块化架构,使得强化学习的各个阶段都能灵活适应不同的需求,尤其是在支持LoRA RL和在线蒸馏等新兴技术方面。

关键设计:系统设计中考虑了多种参数设置和损失函数,确保在不同的训练场景下都能保持高效性和可靠性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

在GLM-5.2 744B-A40B模型上进行的实验表明,Miles实现了完全异步的智能强化学习,首次30个测量步骤的中位步长时间为263秒,展示了其在效率和可扩展性方面的显著优势。

🎯 应用场景

Miles v0.1的潜在应用场景包括大规模强化学习任务、企业级AI模型训练和优化、以及需要高效可定制的机器学习解决方案的研究项目。其设计理念和模块化架构将推动强化学习在实际应用中的普及和发展。

📄 摘要(原文)

We present Miles v0.1, a full-stack, production-ready system for frontier post-training. Building upon the clean design of slime, Miles designs each stage of the reinforcement-learning (RL) training loop around a single principle: components should be verified, clean, and customizable. With accuracy, efficiency, reliability, and scalability as first-class goals, Miles aims to make frontier-scale RL accessible to researchers and enterprises alike. This report walks through the system end to end: rollout engines built on SGLang, a trainer with a choice of two backends (NVIDIA Megatron-LM and PyTorch FSDP), and three weight-synchronization transports for different deployment topologies. Beyond full-parameter RL, Miles also supports LoRA RL, on-policy distillation, supervised fine-tuning, and true-on-policy rollout-training alignment, and extends the same architecture to diffusion models. We close with an end-to-end case study: fully asynchronous agentic RL on a GLM-5.2 744B-A40B model over terminal-use coding tasks, running on 64 NVIDIA GB300 GPUs with a median step time of 263 seconds over the first 30 measured steps. Miles is open-sourced at https://github.com/radixark/miles, with the project website at https://miles.radixark.com.