Quality Action Assurance: Multimodal Verification of Examiner Claims in VR OSCEs
作者: Harry Rogers, Sally Shiels, Ashley Tomlinson, James Thomas, James Aylward, Nathan Gauge, Helen Higham, Alison Noble
分类: cs.AI
发布日期: 2026-07-21
💡 一句话要点
提出质量行动保障框架以解决OSCE评分主观性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态验证 虚拟现实 临床考试 考官主观性 动作对齐 语言模型 错误检测
📋 核心要点
- 现有OSCE评分方法受考官主观性和认知偏见影响,缺乏有效的错误分析手段。
- 本文提出的QAA框架通过多模态数据验证考官声明,结合动作对齐模型和语言模型进行分析。
- 实验结果显示,QAA在检测考官错误时精度达到70.0%,召回率为76.7%,事实正确率从39.2%提升至79.2%。
📝 摘要(中文)
客观结构化临床考试(OSCE)是评估临床能力的金标准,但评分易受考官主观性、疲劳和认知偏见影响。传统的考官验证方法通过评分者间统计缺乏对错误来源的解释能力,无法分析考官推理或验证考官声明。为此,本文提出质量行动保障(QAA)框架,通过比较考官声称的行为与实际事件序列,利用视频、虚拟现实日志和演员数据进行验证。QAA结合了受限时间动作对齐模型和大型语言模型,提取考官声明并与记录进行核对。经过五折交叉验证,QAA在时间对齐方面达到了99.2% ± 0.7%的演员F1和93.4% ± 1.9%的W@16,显著提高了OSCE评估的公正性。
🔬 方法详解
问题定义:本文旨在解决OSCE评分中考官主观性和认知偏见导致的错误,现有方法无法有效分析错误来源。
核心思路:QAA框架通过多模态数据(视频、VR日志、演员数据)验证考官的行为声明,确保评分的客观性和准确性。
技术框架:QAA包含两个主要模块:受限时间动作对齐模型用于动作定位和演员来源归属,语言模型用于提取考官声明并与记录核对。
关键创新:QAA的创新在于结合了动作对齐和语言理解,能够从多种数据源中验证考官的声明,与传统方法相比,提供了更全面的错误分析能力。
关键设计:在模型设计中,采用了特定的损失函数以优化时间对齐精度,并通过大规模语言模型增强了对考官声明的理解能力。实验中使用了五折交叉验证以确保结果的可靠性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,QAA在时间对齐方面达到了99.2%的F1分数和93.4%的W@16,显著提高了考官错误检测的精度(70.0%)和召回率(76.7%),事实正确率从39.2%提升至79.2%。
🎯 应用场景
该研究的潜在应用领域包括医学教育、临床培训和虚拟现实技术的评估。通过提高OSCE的评分公正性,QAA框架能够帮助教育机构更好地评估学生的临床能力,减少主观偏见的影响,提升整体教育质量。
📄 摘要(原文)
Objective Structured Clinical Examinations (OSCEs) are the gold standard for assessing clinical competence, yet scoring remains vulnerable to examiner subjectivity, fatigue, and cognitive bias. Standard examiner validation via inter-rater statistics lacks explanatory power regarding the source of errors, as it neither analyzes examiner reasoning nor verifies examiner claims against actual events. Thus, we introduce Quality Action Assurance (QAA), a multimodal framework that verifies examiner claims in Virtual Reality (VR) pediatric OSCEs by comparing actions claimed by examiners against the true sequence of events, constructed from video, VR logs, and actor data. QAA combines a constrained temporal action alignment model, which performs action localization and actor source attribution, with a large language model that extracts examiner claims and checks them against the record. Across a 5-fold cross-validation, QAA achieves 99.2% $\pm$ 0.7% Actor F1 and 93.4% $\pm$ 1.9% W@16 for temporal alignment. Overall, QAA detects examiner errors with 70.0% precision and 76.7% recall, improving factual correctness from 39.2% to 79.2%, enabling fairer OSCE assessment.