Beyond Score Prediction: LLM-Based Essay Scoring and Feedback Generation via Reinforcement Learning with Rubric Rewards
作者: Xuefeng Jin, Jiashuo Zhang, Teng Cao, Bin Yang
分类: cs.CL, cs.AI
发布日期: 2026-07-21
备注: 12 pages, 4 figures, 9 tables
🔗 代码/项目: GITHUB
💡 一句话要点
提出RLAES框架以解决自动化作文评分与反馈生成问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 自动化作文评分 反馈生成 强化学习 大型语言模型 教育技术 评分标准 自适应优化
📋 核心要点
- 现有的自动化作文评分方法主要依赖提示工程或监督微调,缺乏基于强化学习的系统性研究,导致反馈质量评估不足。
- 本文提出RLAES框架,通过强化学习联合优化作文评分和反馈生成,并引入基于评分标准的反馈评估(RFE)以提升反馈质量。
- 在ASAP基准测试中,RLAES-AGFO在LLM方法中取得了最佳评分表现(QWK = 0.803),同时保持了与GPT-5.5相当的反馈质量。
📝 摘要(中文)
大型语言模型(LLMs)在自动化作文评分(AES)和反馈生成(AFG)中得到了广泛应用。然而,现有研究主要依赖于提示工程或监督微调,系统性研究基于强化学习(RL)的后训练和反馈质量的自动评估仍然有限。本文提出了RLAES,一个统一的LLM框架,通过RL联合优化作文评分和反馈生成。为使反馈质量可测量、可解释且可用于训练,本文引入了基于评分标准的反馈评估(RFE)框架,包含166个细粒度的二元评分标准项和LLM作为评判者。在RFE的基础上,提出了自适应门控反馈优化(AGFO),在RL过程中按需激活基于评分标准的反馈奖励,降低评估开销并提高反馈质量。此外,提出了相邻对比推理(ACR),通过显式对比相邻评分水平来改善序数评分校准。实验结果表明,RFE框架捕捉了作文与反馈的一致性,展现出强大的成对区分能力,并与专家偏好高度一致。
🔬 方法详解
问题定义:本文旨在解决现有自动化作文评分与反馈生成方法中反馈质量评估不足的问题。现有方法多依赖于提示工程或监督微调,缺乏系统性的强化学习后训练研究,导致反馈质量难以量化和优化。
核心思路:论文提出了RLAES框架,通过强化学习联合优化作文评分和反馈生成。引入基于评分标准的反馈评估(RFE),使得反馈质量可测量和可解释,同时通过自适应门控反馈优化(AGFO)降低评估开销。
技术框架:RLAES框架包括多个模块:首先是作文评分模块,其次是反馈生成模块,最后是基于评分标准的反馈评估模块(RFE)。在RL过程中,AGFO模块按需激活反馈奖励,优化反馈质量。
关键创新:最重要的创新在于引入了RFE框架和AGFO机制,使得反馈质量的评估更加系统化和高效化。与现有方法相比,RLAES能够在强化学习过程中动态调整反馈奖励,显著提升反馈生成的质量。
关键设计:在RFE中,设计了166个细粒度的二元评分标准项,并使用LLM作为评判者。AGFO模块通过动态激活反馈奖励,减少了评估过程中的计算开销,同时保持了反馈质量的高标准。
🖼️ 关键图片
📊 实验亮点
实验结果显示,RLAES-AGFO在ASAP基准测试中取得了最佳评分表现(QWK = 0.803),超越了其他LLM方法。同时,反馈质量与GPT-5.5相当,避免了仅基于评分的强化学习中反馈质量下降的问题,展现了显著的性能提升。
🎯 应用场景
该研究的潜在应用领域包括教育技术、在线学习平台和自动化评估系统。通过提升作文评分和反馈生成的质量,RLAES框架能够为学生提供更为精准和个性化的学习反馈,促进学习效果的提升。未来,该技术有望在更广泛的教育场景中得到应用,推动教育评估的智能化进程。
📄 摘要(原文)
Large language models (LLMs) have been widely applied to automated essay scoring (AES) and automated feedback generation (AFG). However, existing studies rely primarily on prompt engineering or supervised fine-tuning, while systematic research on reinforcement learning (RL) post-training and automated evaluation of feedback quality remains limited. We propose RLAES, a unified LLM framework that jointly optimizes essay scoring and feedback generation through RL. To make feedback quality measurable, interpretable, and usable for training, we introduce Rubric-based Feedback Evaluation (RFE), an essay-grounded feedback evaluation framework comprising 166 fine-grained binary rubric items and an LLM-as-judge. Building on RFE, we propose Adaptive Gated Feedback Optimization (AGFO), which activates rubric-based feedback rewards on demand during RL, reducing evaluation overhead while improving feedback quality. We also propose Adjacent Contrastive Reasoning (ACR) to improve ordinal score calibration by explicitly contrasting adjacent score levels. Experimental results show that the RFE framework captures essay-feedback consistency, exhibits strong pairwise discriminative power, and closely aligns with expert preferences. On the ASAP benchmark, RLAES-AGFO achieves the best scoring performance among LLM-based methods (QWK = 0.803), while maintaining feedback quality comparable to GPT-5.5 and avoiding the feedback degradation observed under score-only RL. Code and datasets are publicly available at https://github.com/hellomuyi/RLAES.