ACRL: Adaptive Control of Training-Inference Discrepancy for Stable Reinforcement Learning
作者: Wenwu Fan, Qihong Lin, Zhijie Xia, Zhuo Zheng, Sihao Wang, Qiang Chen, Liangsheng Zhu
分类: cs.LG, cs.AI, cs.CL
发布日期: 2026-07-27
💡 一句话要点
提出自适应控制方法以解决强化学习训练不稳定问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 强化学习 自适应控制 训练推理差异 大型语言模型 量化技术 策略熵 模型稳定性
📋 核心要点
- 现有的强化学习方法在大型语言模型训练中面临训练与推理之间的差异,导致训练过程不稳定。
- 本文提出自适应控制强化学习(ACRL),通过自适应控制训练-推理差异,确保训练过程的稳定性。
- 实验结果显示,ACRL在使用FP8量化的推理引擎时,能够有效稳定训练过程,并在准确性上超过了BF16基线。
📝 摘要(中文)
强化学习(RL)在大型语言模型(LLM)训练中常因训练与推理之间的差异而导致不稳定。这种训练-推理差异主要源于训练和推理引擎之间的架构分离,以及推理中使用低精度量化而训练中使用高精度计算。为了解决因高训练-推理差异引起的训练不稳定问题,本文提出了自适应控制强化学习(ACRL),该方法自适应地将训练-推理差异维持在合理范围内,以确保稳定的RL训练。ACRL不仅稳定训练过程,还内在地增加了策略熵,从而增强探索性并提高准确性。实验结果表明,当推理引擎使用FP8量化时,ACRL能够持续保持训练-推理差异在合理范围内,并稳定RL训练。此外,ACRL不仅与BF16基线的准确性相匹配,还超越了重要性采样(IS)修正。
🔬 方法详解
问题定义:本文旨在解决强化学习训练过程中因训练与推理之间差异导致的不稳定性问题。现有方法在架构和计算精度上的分离使得训练与推理之间存在显著差异,从而影响了模型的性能和稳定性。
核心思路:ACRL通过自适应控制训练-推理差异,保持其在合理范围内,以确保训练过程的稳定性。此外,ACRL还通过增加策略熵来增强探索性,从而提高模型的准确性。
技术框架:ACRL的整体架构包括训练引擎和推理引擎的自适应控制模块。训练引擎使用高精度计算,而推理引擎则采用低精度量化(如FP8),通过动态调整两者之间的差异来实现稳定训练。
关键创新:ACRL的主要创新在于其自适应控制机制,能够根据当前训练状态动态调整训练-推理差异。这一机制与传统方法的静态设置形成鲜明对比,使得模型在不同训练阶段能够灵活应对不稳定性。
关键设计:在ACRL中,关键参数包括训练-推理差异的阈值设置,以及损失函数的设计,以确保在训练过程中能够有效监控和调整差异。此外,网络结构的选择也考虑了高效的计算和存储需求,以适应低精度推理的要求。
🖼️ 关键图片
📊 实验亮点
实验结果表明,ACRL在使用FP8量化的推理引擎时,能够持续将训练-推理差异维持在合理范围内,显著稳定了强化学习训练过程。此外,ACRL的准确性与BF16基线相当,并在某些情况下超越了重要性采样(IS)修正,展示了其优越性。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、对话系统和智能助手等场景,能够有效提升大型语言模型在实际应用中的稳定性和准确性。未来,ACRL方法有望在更多复杂的强化学习任务中得到应用,推动智能系统的进一步发展。
📄 摘要(原文)
Reinforcement Learning (RL) training for Large Language Models (LLMs) often suffers from instability due to the discrepancy between training and inference. This training-inference discrepancy stems from two primary factors: an architectural separation between training and inference engines, and the use of low-precision quantization in inference versus higher-precision computation in training. To address training instability issues caused by high training-inference discrepancy, we present the principles and methods for its adaptive control. We propose Adaptive Control Reinforcement Learning (ACRL), which adaptively maintains the training-inference discrepancy within a reasonable range to ensure stable RL training. Beyond stabilization, ACRL inherently increases policy entropy, thereby enhancing exploration and improving accuracy. The experimental results show that when the inference engine utilizes FP8 quantization, ACRL consistently maintains the training-inference discrepancy within a reasonable range and stabilizes RL training. Furthermore, ACRL not only matches the accuracy of the BF16 baseline but also outperforms importance sampling (IS) fixes.