Assessment in Team Problem-Solving Exercises in Computing Education

📄 arXiv: 2607.19209v1 📥 PDF

作者: Valdemar Švábenský, Jan Vykopal, Sukrit Leelaluk, Pavel Čeleda, Fumiya Okubo, Atsushi Shimada

分类: cs.CY, cs.AI, cs.LG

发布日期: 2026-07-21

备注: Full paper accepted for the main track of the IEEE FIE 2026 conference


💡 一句话要点

提出基于聚类与大语言模型的团队评估方法以提升TTX反馈效率

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 桌面演练 团队评估 聚类分析 大语言模型 教育技术 反馈机制

📋 核心要点

  1. 现有的TTX评估方法往往反馈延迟且不完整,难以有效支持学生团队的学习进程。
  2. 本文提出了基于聚类和大语言模型的评估方法,旨在提高反馈效率和准确性。
  3. 实验结果表明,聚类方法能够快速提供针对性反馈,而GPT-5.2在评估准确性上显著优于教师评分。

📝 摘要(中文)

本论文在研究与实践轨道中提出了评估学生团队在桌面演练(TTXs)中的表现的方法。TTXs使学习团队能够为工作任务做准备并练习危机响应,如解决网络安全事件。尽管评估对于确定团队实现学习目标的程度至关重要,但TTXs的复杂性和开放性常导致反馈延迟或不完整。本文比较了两种后TTX团队评估方法——聚类和大语言模型(LLMs),并使用来自两国81名参与者的原始数据集进行评估。聚类方法有效地将表现相似的团队分组,从而使教师能够更快地提供针对性的反馈,而LLMs则利用标准化评分标准评估团队的沟通。研究结果显示,GPT-5.2在评估准确性上显著优于教师评分。研究方法已集成到开源TTX学习平台INJECT中,以支持可扩展性和教学实践。

🔬 方法详解

问题定义:论文要解决的问题是如何有效评估学生团队在桌面演练中的表现,现有方法由于TTXs的复杂性,常导致反馈延迟或不完整。

核心思路:论文提出通过聚类分析和大语言模型(LLMs)来评估团队表现,聚类方法用于快速分组,LLMs则用于分析团队沟通,旨在提高评估的效率和准确性。

技术框架:整体架构包括数据收集、聚类分析和LLMs评估三个主要模块。首先,收集团队在TTXs中的行为和沟通数据;其次,应用聚类算法对团队进行分组;最后,利用LLMs对团队的沟通进行评估。

关键创新:最重要的技术创新点在于将聚类方法与LLMs结合使用,以便更高效地提供反馈。聚类方法能够快速识别表现相似的团队,而LLMs则提供更深入的沟通分析,这与传统的单一评分方法有本质区别。

关键设计:在聚类方法中,采用了低计算需求的算法以确保快速反馈;在LLMs评估中,使用了标准化评分标准以提高评估的一致性和准确性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,聚类方法能够有效地将表现相似的团队分组,提供快速反馈;而在LLMs评估中,GPT-5.2的表现显著优于教师评分,降低了评估误差,提升了评估的可靠性。

🎯 应用场景

该研究的潜在应用领域包括教育技术、团队培训和危机管理等。通过提高团队评估的效率和准确性,能够更好地支持学生在实际工作场景中的准备和应对能力,未来可能对教育和职业培训产生深远影响。

📄 摘要(原文)

This full paper in the research-to-practice track presents methods for assessing student teams in tabletop exercises (TTXs). TTXs enable learner teams to prepare for workplace tasks and practice crisis responses, such as resolving cybersecurity incidents. While assessment is essential for determining how well teams achieve learning objectives, the complex, open-ended nature of TTXs often leads to delayed or incomplete feedback. TTX learning platforms can record teams' actions and communication; yet, leveraging these data to assess performance is underexplored. To address this gap, we compared two post-TTX team assessment methods -- clustering and large language models (LLMs) -- using an original dataset from 81 participants across two countries. We evaluated these methods against instructor-assigned scores based on standardized rubrics. Clustering grouped teams that approached TTX tasks similarly, enabling instructors to deliver faster, targeted feedback to teams within a cluster. This method was valid and reliable, with low computational requirements. LLMs used the standardized rubrics to assess teams' communication. While GPT-4o frequently disagreed with instructor scores, GPT-5.2 demonstrated considerably lower error. The researched methods have been integrated into INJECT, an open-source TTX learning platform, to support scalability and teaching practice. To encourage community adoption, we publicly share all datasets, software tools, and a full-fledged TTX scenario.