WrAFT: a Modularized Automated Writing Evaluation System for Argumentative Essays
作者: Adnan Labib, Yixuan Huang, Jiahui Wu, John Maurice Gayed, Zheng Yuan, Qiao Wang
分类: cs.AI, cs.CL
发布日期: 2026-07-16
💡 一句话要点
提出WrAFT以解决自动化写作评估的准确性与反馈问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 自动化写作评估 写作反馈 大型语言模型 模块化设计 教育技术
📋 核心要点
- 现有的自动化写作评估工具在评分准确性和反馈有效性方面存在不足,难以满足用户需求。
- WrAFT通过模块化设计,将写作评估任务分为评分、表层反馈和深层反馈,从而提升评估的全面性和准确性。
- 实验结果表明,WrAFT在评分方面的QWK达到0.84,RMSE为0.44,且系统生成的反馈获得了高达96.14%的用户认可度。
📝 摘要(中文)
本研究提出了WrAFT(写作评估与反馈工具),旨在为议论文提供准确可靠的评分和有效的综合反馈。WrAFT采用模块化设计,将自动化写作评估(AWE)任务分为评分、表层反馈和深层反馈。在系统构建过程中,评估了多种大型语言模型(LLMs),包括LLaMA-3.3-70B-Instruct、GPT-4o和Claude 3.7,采用直接提示和监督微调的方法。使用了480篇托福独立写作论文的专有数据集进行评估,结果显示WrAFT在评分方面达到了最先进的性能,二次加权kappa(QWK)为0.84,均方根误差(RMSE)为0.44。系统生成的反馈在人类评估中也获得了高认可度:表层反馈为96.14%,深层宏观反馈为93.03%,深层微观反馈为94.69%。该系统的交互用户界面已公开并可免费使用。
🔬 方法详解
问题定义:本论文旨在解决现有自动化写作评估工具在评分准确性和反馈质量上的不足,现有方法往往无法提供全面和有效的反馈。
核心思路:WrAFT通过模块化设计,将写作评估任务分为评分、表层反馈和深层反馈,旨在提升评估的准确性和反馈的有效性。这样的设计使得系统能够针对不同层次的写作问题提供相应的反馈。
技术框架:WrAFT的整体架构包括三个主要模块:评分模块、表层反馈模块和深层反馈模块。评分模块负责对论文进行量化评分,表层反馈模块提供语法和结构方面的反馈,而深层反馈模块则关注论点的逻辑性和深度。
关键创新:WrAFT的主要创新在于其模块化设计,使得不同类型的反馈可以独立生成并针对性地解决写作中的具体问题。这与传统的单一评分方法形成了鲜明对比。
关键设计:在技术细节上,WrAFT使用了多种大型语言模型进行训练,并通过监督微调来优化性能。关键参数设置和损失函数的选择经过多次实验验证,以确保系统的高效性和准确性。
🖼️ 关键图片
📊 实验亮点
WrAFT在评分方面表现出色,二次加权kappa(QWK)达到0.84,均方根误差(RMSE)为0.44,显示出其在准确性上的优势。此外,系统生成的反馈在人类评估中获得了高认可度,表层反馈的认可率为96.14%,深层反馈的认可率分别为93.03%和94.69%。
🎯 应用场景
WrAFT可广泛应用于教育领域,尤其是在写作教学和评估中。它不仅可以帮助学生提高写作能力,还能为教师提供有效的评估工具,减轻评分负担。未来,该系统有望在更多语言和写作类型中推广应用,进一步提升写作评估的智能化水平。
📄 摘要(原文)
This study presents WrAFT, a Writing Assessment and Feedback Tool, that delivers both accurate and reliable scores and effective comprehensive feedback to argumentative essays. WrAFT adopts a modular design by dividing automated writing evaluation (AWE) tasks into scoring, surface-level feedback, and deep-level feedback. In building the system, various Large Language Models (LLMs) have been evaluated, including LLaMA-3.3-70B-Instruct, GPT-4o, and Claude 3.7, through both direct prompting and supervised fine-tuning approaches. A proprietary dataset of 480 TOEFL Independent Writing essays with official benchmark scores was utilized. Benchmark-based evaluation shows that WrAFT achieves state-of-the-art performance in scoring, with a quadratic weighted kappa (QWK) of 0.84 and a root mean square error (RMSE) of 0.44 against official scores on a scale of 0-5. Human evaluation of system-generated feedback also reveals high approval ratings: 96.14 percent for surface-level feedback, 93.03 percent for deep-level macro feedback, and 94.69 percent for deep-level micro feedback. An interactive user interface has been developed for the system and is publicly available and free to use.