AI-enhanced Auto-correction of Programming Exercises: How Effective is GPT-3.5?

📄 arXiv: 2311.10737v1 📥 PDF

作者: Imen Azaiz, Oliver Deckarm, Sven Strickroth

分类: cs.CY, cs.AI, cs.HC, cs.SE

发布日期: 2023-10-24

备注: accepted to the International Journal of Engineering Pedagogy (iJEP; eISSN: 2192-4880)

期刊: International Journal of Engineering Pedagogy (iJEP), 13(8), 2023, pp. 67-83

DOI: 10.3991/ijep.v13i8.45621


💡 一句话要点

利用GPT-3.5实现编程作业的自动纠错与反馈生成

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 编程教育 自动纠错 个性化反馈 大型语言模型 GPT-3.5 教育技术 在线学习

📋 核心要点

  1. 在大班教学中,提供及时且个性化的反馈面临重大挑战,现有方法难以满足这一需求。
  2. 本文提出利用GPT-3.5进行编程作业的自动纠错和反馈生成,以提高反馈的及时性和个性化。
  3. 实验结果表明,GPT-3.5在73%的情况下正确识别作业的正确性,并在59%的案例中生成高质量反馈。

📝 摘要(中文)

及时的形成性反馈被认为是有效学习的重要驱动因素。在高等教育的大班教学中,提供及时且个性化的反馈尤其具有挑战性。本文探讨了大型语言模型(如GPT-3.5)在个性化代码纠错和反馈生成中的潜力。基于真实的学生作业提交,研究了AI辅助评估的正确性及其生成反馈的特点。结果显示,73%的提交被正确识别为正确或错误,其中59%的情况下,GPT-3.5成功生成了有效的高质量反馈。然而,GPT-3.5在评估中也表现出一些弱点,包括错误定位不准确和虚构错误。文中讨论了这些结果的影响及潜在的新使用场景。

🔬 方法详解

问题定义:本文旨在解决在大班教学中提供及时个性化反馈的困难,现有方法往往无法有效识别学生作业的正确性和提供有用的反馈。

核心思路:通过利用GPT-3.5的自然语言处理能力,自动分析学生提交的代码,识别错误并生成个性化反馈,以提升反馈的质量和及时性。

技术框架:整体架构包括数据收集、模型训练、错误识别和反馈生成四个主要模块。首先收集学生的真实作业数据,然后利用GPT-3.5进行分析和反馈生成。

关键创新:最重要的创新在于将大型语言模型应用于编程作业的自动评估中,显著提高了反馈的个性化和准确性,这与传统的基于规则的方法有本质区别。

关键设计:在模型训练中,采用了特定的损失函数来优化反馈的质量,并对生成的反馈进行多维度评估,包括正确性、实用性和代码风格建议。

🖼️ 关键图片

img_0

📊 实验亮点

实验结果显示,GPT-3.5在73%的学生作业中成功识别了正确性,并在59%的案例中生成了有效的反馈。这一成果表明,AI技术在编程教育中的应用具有显著的潜力,能够有效提升反馈质量。

🎯 应用场景

该研究的潜在应用领域包括高等教育中的编程课程、在线学习平台以及教育技术工具。通过自动化反馈生成,教师可以更高效地管理大班教学,提升学生的学习体验和效果,未来可能推动个性化学习的发展。

📄 摘要(原文)

Timely formative feedback is considered as one of the most important drivers for effective learning. Delivering timely and individualized feedback is particularly challenging in large classes in higher education. Recently Large Language Models such as GPT-3 became available to the public that showed promising results on various tasks such as code generation and code explanation. This paper investigates the potential of AI in providing personalized code correction and generating feedback. Based on existing student submissions of two different real-world assignments, the correctness of the AI-aided e-assessment as well as the characteristics such as fault localization, correctness of hints, and code style suggestions of the generated feedback are investigated. The results show that 73 % of the submissions were correctly identified as either correct or incorrect. In 59 % of these cases, GPT-3.5 also successfully generated effective and high-quality feedback. Additionally, GPT-3.5 exhibited weaknesses in its evaluation, including localization of errors that were not the actual errors, or even hallucinated errors. Implications and potential new usage scenarios are discussed.