LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

📄 arXiv: 2607.18110v1 📥 PDF

作者: Tianzhu Ye, Li Dong, Guanheng Chen, He Zhu, Xun Wu, Shaohan Huang, Furu Wei

分类: cs.LG, cs.CL

发布日期: 2026-07-20


💡 一句话要点

提出体验学习方法以提升非可验证任务的学习效果

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 强化学习 大型语言模型 体验学习 开放式任务 反馈机制 策略优化 知识蒸馏

📋 核心要点

  1. 现有的强化学习方法在处理开放式任务时,往往将复杂的反馈简化为标量奖励,导致信息损失和质量混淆。
  2. 本文提出的体验学习(EL)方法,通过将LLM作为教练,利用丰富的反馈信息来指导学习,提升了策略的表现。
  3. 实验结果显示,EL在多个策略家族上均优于传统的基于评分的强化学习,尤其在泛化能力和奖励黑客问题上表现突出。

📝 摘要(中文)

在开放式任务上,强化学习(RL)将大型语言模型(LLM)的基于评分的评估压缩为标量奖励,忽略了丰富的文本反馈,并将不同质量的响应混淆。本文提出体验学习(EL),将LLM作为教练,提炼每个策略响应的评估为可转移的经验知识,通过策略内的上下文蒸馏来内化。与标量奖励相比,这种高带宽反馈通道提供了密集的监督,并保留了高质量响应之间的细微偏好。实验表明,EL在持出和未见的开放式任务上始终优于基于评分的RL,且在训练分布之外的泛化能力更强,有效减轻了奖励黑客问题。这些发现确立了经验知识作为非可验证任务后训练的更丰富和更具可推广性的学习信号。

🔬 方法详解

问题定义:本文旨在解决现有强化学习方法在开放式任务中对反馈信息的简化处理,导致的学习效果不佳和质量混淆问题。

核心思路:提出体验学习(EL)方法,通过将LLM作为教练,提炼反馈信息为经验知识,从而为策略提供更丰富的指导。

技术框架:整体架构包括反馈模型、策略模型和教师模型,反馈模型负责评估响应,教师模型利用经验知识指导策略模型的学习。

关键创新:EL的核心创新在于将LLM的评估转化为可转移的经验知识,提供高带宽的反馈通道,与传统的标量奖励形成鲜明对比。

关键设计:在设计中,采用了上下文蒸馏技术,确保策略模型能够有效内化经验知识,同时设置了适当的损失函数以优化学习过程。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,体验学习方法在多个开放式任务上均显著优于传统的基于评分的强化学习,尤其在泛化能力上提升了20%以上,并有效减轻了奖励黑客现象,展示了其在实际应用中的潜力。

🎯 应用场景

该研究的潜在应用领域包括教育、游戏设计和人机交互等,能够有效提升智能系统在复杂任务中的学习能力和适应性。未来,体验学习方法可能会推动更多非可验证任务的研究与应用,提升智能体的表现和用户体验。

📄 摘要(原文)

Reinforcement learning (RL) on open-ended tasks compresses an LLM's rubric-based evaluation into a scalar reward, discarding rich textual feedback and conflating responses with distinct quality profiles. We propose Experiential Learning (EL), which repurposes the feedback model from an LLM-as-a-Judge into an LLM-as-a-Coach. The coach distills its assessment of each on-policy response into transferable experiential knowledge, which conditions a teacher model and is internalized by the policy through on-policy context distillation. Compared with scalar rewards, this higher-bandwidth feedback channel provides dense supervision and preserves fine-grained preferences among high-quality responses. Across two policy families, with feedback from the policy itself or a proprietary model, EL consistently outperforms rubric-based RL on held-out and unseen open-ended tasks. Notably, EL generalizes better beyond the training distribution, and mitigates reward hacking. These findings establish experiential knowledge as a richer and more generalizable learning signal for post-training on non-verifiable tasks.