Generating Constructive Feedback on Stories via Reinforcement Learning
作者: Maja Stahl, Timon Ziegenbein, Henning Wachsmuth
分类: cs.CL
发布日期: 2026-09-04
备注: Accepted to Findings of EMNLP 2026
💡 一句话要点
提出强化学习方法生成建设性反馈以提升故事创作
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 强化学习 大型语言模型 建设性反馈 创意写作 故事生成 自动评估
📋 核心要点
- 现有的大型语言模型生成的反馈往往缺乏针对性和可操作性,无法有效帮助作者识别和解决写作中的关键问题。
- 本文提出了一种基于强化学习的方法,通过群体相对策略优化训练模型,生成个性化且建设性的反馈,提升写作质量。
- 实验结果表明,所提方法在多个故事语料库上表现优于现有最先进的LLMs,尤其在提供可操作建议方面具有显著优势。
📝 摘要(中文)
建设性反馈对于创意写作至关重要,能够帮助作者提升故事讲述能力。然而,人工反馈通常成本高且耗时,现有的大型语言模型(LLMs)生成的反馈往往过于泛泛,缺乏可操作性,且未能识别最关键的写作问题。为了解决这些局限性,本文提出了一种强化学习方法,指导LLMs生成建设性反馈,无需真实反馈。我们使用群体相对策略优化(GRPO)训练模型,并设计了一种新颖的多组件奖励函数,旨在优先生成针对故事的个性化反馈,提升故事质量,并解决最关键的写作问题。在对三个故事语料库的自动和人工评估中,我们的方法超越了现有的最先进LLMs(包括Gemini)和竞争基线,发现提供可操作建议是反馈建设性的主要驱动因素。
🔬 方法详解
问题定义:本文旨在解决大型语言模型生成的反馈过于泛泛、缺乏可操作性的问题,无法有效识别和解决写作中的关键问题。
核心思路:通过强化学习引导LLMs生成建设性反馈,设计多组件奖励函数,优先考虑个性化和针对性反馈,以提升故事质量。
技术框架:整体架构包括数据收集、模型训练和反馈生成三个主要模块。首先收集故事数据,然后使用群体相对策略优化训练模型,最后生成反馈并进行评估。
关键创新:最重要的创新在于引入了多组件奖励函数,能够有效引导模型生成更具建设性的反馈,区别于传统方法的单一评价标准。
关键设计:在模型训练中,设置了多个奖励参数,强调反馈的个性化和针对性,同时采用了复杂的损失函数以优化反馈的质量。
🖼️ 关键图片
📊 实验亮点
实验结果显示,所提方法在三个故事语料库上的表现超越了现有的最先进LLMs,包括Gemini,且在提供可操作建议方面的提升幅度显著,具体性能数据未详细披露,但整体反馈建设性得分明显提高。
🎯 应用场景
该研究的潜在应用领域包括教育、创意写作辅助工具和内容创作平台。通过提供高质量的自动反馈,能够帮助作家提升写作技能,降低依赖人工反馈的成本,促进创意表达的多样性与丰富性。未来,该方法可能扩展到其他文本生成和评估任务中,具有广泛的实际价值。
📄 摘要(原文)
Constructive feedback is crucial for creative writers to refine their storytelling abilities. Since receiving feedback from human experts is often costly and time-intensive, large language models (LLMs) offer a scalable and efficient alternative as automatic writing assistants. Despite their potential, research indicates that LLM-generated feedback is often generic, lacks actionability, and fails to identify which writing issue is most critical. To address these limitations, we present a reinforcement learning approach that steers LLMs to generate constructive feedback without the need for ground-truth feedback. We train our model using group relative policy optimization (GRPO) with a novel multi-component reward function aiming at constructiveness: it prioritizes feedback that is uniquely tailored to the story, helps to improve story quality, and addresses the most critical writing issue. In automatic and human evaluation across three story corpora, our approach outperforms state-of-the-art LLMs (including Gemini) and competitive baselines. We find that providing actionable suggestions is the main driver of feedback constructiveness.