Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning
作者: Shujin Wu, Cheng Qian, Xiusi Chen, Heng Ji
分类: cs.LG, cs.AI, cs.CL
发布日期: 2026-07-24
💡 一句话要点
提出MetaEvolve框架以培养自我进化的元技能
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 自我进化 元技能 强化学习 数据合成 程序执行 开放性问题 算法优化
📋 核心要点
- 现有方法在自我进化过程中缺乏有效的元技能,导致多轮优化效果不佳。
- 论文提出MetaEvolve框架,通过强化学习和数据合成来培养自我反思等元技能。
- 实验结果表明,MetaEvolve在多个基准任务上显著超越传统方法,尤其在开放性问题上表现突出。
📝 摘要(中文)
通过环境反馈的迭代自我进化,MetaEvolve框架展示了显著的性能提升。我们假设这种进化框架的成功依赖于元技能,如自我反思和环境反馈,这些技能在传统后训练中被忽视。MetaEvolve通过数据合成管道、进化感知的强化学习和推理时的进化搜索来发展这些元技能。具体而言,我们将MetaEvolve应用于编码领域,程序执行提供了超越二元正确性的自然、连续奖励信号。通过在大规模代码数据上训练,我们旨在激发可迁移的领域无关元技能,能够广泛应用于缺乏丰富训练信号的开放性问题。实验结果显示,MetaEvolve在七个编码基准上相较于最强基线在分布内任务上提升了10.01%,在分布外任务上提升了24.12%。
🔬 方法详解
问题定义:本论文旨在解决现有自我进化方法在多轮优化中缺乏有效元技能的问题,传统后训练方法未能充分利用环境反馈。
核心思路:MetaEvolve框架通过强化学习和数据合成,培养自我反思等元技能,以实现更有效的自我进化。这样的设计能够利用程序执行的连续奖励信号,促进模型的自我改进。
技术框架:MetaEvolve的整体架构包括数据合成管道、进化感知的强化学习模块和推理时的进化搜索。数据合成管道生成包含程序及其适应度评分的进化轨迹,强化学习模块则利用这些轨迹进行训练。
关键创新:MetaEvolve的核心创新在于通过程序执行提供的连续奖励信号来训练模型,这与传统方法依赖于二元正确性评估的方式有本质区别。
关键设计:在训练过程中,模型的损失函数结合了程序的正确性和效率,适应度评分综合考虑了历史尝试的反馈,确保模型在多轮优化中能够有效学习。通过大规模代码数据的训练,模型能够获得广泛的迁移能力。
🖼️ 关键图片
📊 实验亮点
实验结果显示,MetaEvolve在七个编码基准上相较于最强基线在分布内任务上提升了10.01%,在分布外任务上提升了24.12%。在完全不同的开放性算法优化问题上,MetaEvolve实现了46.9%的相对提升,展示了其强大的自我进化能力。
🎯 应用场景
该研究的潜在应用领域包括自动化编程、智能代码生成和算法优化等。MetaEvolve框架能够在缺乏丰富训练信号的开放性问题中提供有效的解决方案,未来可能在软件开发和人工智能领域产生深远影响。
📄 摘要(原文)
Test-time scaling through iterative self-evolution with environment feedback, as demonstrated by AlphaEvolve, shows remarkable performance gains. We hypothesize that the success of such evolution frameworks hinges on meta-skills, such as self-reflection with environment feedback, that enable effective multi-round refinement, yet are largely neglected by traditional post-training. To bridge this gap, we present MetaEvolve, a framework designed to develop these meta-skills via a data synthesis pipeline, evolution-aware reinforcement learning (RL), and inference-time evolutionary search. Concretely, we ground MetaEvolve in coding, where program execution provides natural, continuous reward signals beyond binary correctness. Building on these signals, we synthesize evolution trajectories as training data, each containing a current program, its fitness score (combining correctness and efficiency), and a history of prior attempts, and train the model via RL with verifiable rewards derived from test case execution. By training on large-scale code data, we aim to inspire generalizable domain-agnostic meta-skills that can transfer broadly to open-ended problems where such rich training signals are scarce. Across seven coding benchmarks, MetaEvolve outperforms the strongest baseline by 10.01% absolute on in-distribution tasks and 24.12% on out-of-distribution tasks. On open-ended algorithm optimization problems entirely outside the training domain, it further achieves a 46.9% relative improvement. These results demonstrate that explicitly cultivating self-evolution meta-skills offers a principled path toward more capable and autonomously self-evolving AI.