How Well Does AI-Generated Feedback Work? Intrinsic and Extrinsic Evaluation across more than 20,000 EFL Essay Drafts
作者: Steven Coyne, Diana Galvan-Sosa, Ryan Spring, Machi Shimmei, Michael Zock, Keisuke Sakaguchi, Kentaro Inui
分类: cs.CL
发布日期: 2026-07-16
备注: Pre-review version of DOI https://doi.org/10.1007/978-3-032-29788-4_35, presented at AIED 2026 Late Breaking Results. Readers are encouraged to refer to the published version
期刊: AIED CCIS 3031 (2026) 247-253
DOI: 10.1007/978-3-032-29788-4_35
💡 一句话要点
评估AI生成反馈在外语写作中的有效性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 书面纠正反馈 英语学习 大型语言模型 学习者中心 教育技术
📋 核心要点
- 现有的书面纠正反馈方法在与学习者需求对齐方面存在不足,尤其是在有效性和适用性上。
- 本研究通过在大学EFL课程中实施WCF系统,结合教师和学生的反馈进行双重评估,探索更有效的反馈机制。
- 实验结果显示,教师评分与学生反馈之间的低一致性,强调了需要以学习者为中心的评估方法来提升AI应用的有效性。
📝 摘要(中文)
本研究考察了英语作为外语(EFL)写作中的书面纠正反馈(WCF),重点关注大型语言模型(LLMs)在提供WCF时的有效性。尽管LLMs能够大规模生成WCF,但如何使其符合教育最佳实践仍然是一个挑战。研究在一所大学的EFL课程中部署WCF系统,收集了超过20,000份草稿,并从经验丰富的英语教师和学生反馈两个角度进行了评估。结果显示,教师的专家评分与学生反馈之间存在低一致性,表明传统的专家评估可能无法全面反映WCF在学习者视角下的可用性和帮助性,强调了以学习者为中心的评估框架的重要性。
🔬 方法详解
问题定义:本研究旨在解决AI生成的书面纠正反馈(WCF)在外语学习中的有效性问题。现有方法往往未能充分考虑学习者的反馈和需求,导致WCF的实际应用效果不佳。
核心思路:论文提出通过结合教师的专业评估和学生的反馈,形成双重评估框架,以更全面地理解WCF的有效性。这种设计旨在弥补传统评估方法的不足,确保反馈更符合学习者的实际需求。
技术框架:研究的整体架构包括WCF系统的部署、数据收集(包括学生草稿和反馈)、以及评估阶段(教师评分与学生反馈的对比分析)。主要模块包括数据输入、反馈生成、评估指标设定和结果分析。
关键创新:本研究的创新点在于引入了学习者视角的外部评估,强调了传统专家评估的局限性。这一方法为AI在语言教育中的应用提供了新的评估框架。
关键设计:在评估过程中,采用了标准化的评分量表进行教师评估,同时设计了针对学生反馈的调查问卷,以获取更全面的反馈数据。
🖼️ 关键图片
📊 实验亮点
实验结果显示,教师的专家评分与学生反馈之间的低一致性,表明传统的评估方法未能充分反映WCF的实际效果。这一发现强调了以学习者为中心的评估框架的重要性,为未来的AI应用提供了新的方向。
🎯 应用场景
该研究的潜在应用领域包括外语教育、在线学习平台和AI辅助写作工具。通过改进反馈机制,可以提升学习者的写作能力和学习体验,推动教育技术的进一步发展。
📄 摘要(原文)
This study examines feedback in English as a Foreign Language (EFL) writing contexts, focusing on written corrective feedback (WCF). Large language models (LLMs) can provide WCF at scale, but aligning them with pedagogical best practices remains an ongoing challenge. WCF meeting criteria like factuality or relevance may still be unsuitable for learning contexts, highlighting the need for extrinsic evaluation based on the learner's perspective. We deployed WCF systems in a university-level EFL class with nearly 2,000 students, collecting over 20,000 drafts. We evaluated the generated WCF from two perspectives: intrinsic evaluation by experienced English teachers using a rubric, and extrinsic evaluation via student feedback and engagement metrics. Results revealed low alignment between teacher expert ratings and student feedback. These findings suggest that traditional expert evaluation alone may not fully capture WCF's usability or helpfulness from the learner's perspective, highlighting the importance of learner-centered evaluation frameworks for AI-based applications in language education.