Mechanistic Interpretability of Cognitive Complexity in LLMs via Linear Probing using Bloom's Taxonomy
作者: Bianca Raimondi, Maurizio Gabbrielli
分类: cs.AI, cs.CL
发布日期: 2026-07-20
💡 一句话要点
通过线性探测揭示大语言模型的认知复杂性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 认知复杂性 布鲁姆分类法 线性可分性 神经表征 模型解释性 教育技术
📋 核心要点
- 现有的大型语言模型往往被视为黑箱,缺乏有效的内部评估框架,难以理解其认知复杂性。
- 本研究提出利用布鲁姆分类法分析LLM的内部表征,探讨不同认知水平的线性可分性。
- 实验结果显示,线性分类器在各个认知水平上均达到了约95%的准确率,表明模型有效编码了认知复杂性。
📝 摘要(中文)
大型语言模型的黑箱特性要求新的评估框架,超越表面性能指标。本研究利用布鲁姆分类法作为层次化视角,探讨认知复杂性的内部神经表征。通过分析不同LLM的高维激活向量,我们检验了从基本回忆(记住)到抽象综合(创造)的不同认知水平在模型残差流中的线性可分性。结果表明,线性分类器在所有布鲁姆水平上实现了约95%的平均准确率,强有力地证明了认知水平在模型表征的线性可访问子空间中被编码。这些发现表明,模型在前向传播的早期阶段就解决了提示的认知难度,随着层次的加深,表征变得越来越可分。
🔬 方法详解
问题定义:本研究旨在解决大型语言模型内部认知复杂性评估的不足,现有方法无法深入理解模型的内部表征及其对认知任务的处理能力。
核心思路:通过布鲁姆分类法作为分析工具,研究不同认知水平的激活向量是否在模型的残差流中线性可分,从而揭示模型如何处理认知复杂性。
技术框架:整体流程包括数据收集、激活向量提取、线性分类器训练与评估。主要模块包括模型选择、激活向量分析和分类器性能评估。
关键创新:本研究的创新点在于将布鲁姆分类法应用于LLM的内部表征分析,首次系统性地展示了认知水平在模型表征中的线性可分性。
关键设计:在实验中,使用了多种大型语言模型,设置了适当的超参数,采用了线性分类器进行训练,损失函数选择了适合分类任务的交叉熵损失。
🖼️ 关键图片
📊 实验亮点
实验结果显示,线性分类器在所有布鲁姆认知水平上达到了约95%的平均准确率,表明不同认知水平的激活向量在模型的残差流中具有良好的线性可分性。这一发现为理解大型语言模型的内部机制提供了重要证据。
🎯 应用场景
该研究的潜在应用领域包括教育技术、智能辅导系统和人机交互等。通过理解模型的认知复杂性,可以更好地设计教育工具和智能助手,提升学习效果和用户体验。未来,这一研究可能推动更透明和可解释的AI系统的发展。
📄 摘要(原文)
The black-box nature of Large Language Models necessitates novel evaluation frameworks that transcend surface-level performance metrics. This study investigates the internal neural representations of cognitive complexity using Bloom's Taxonomy as a hierarchical lens. By analyzing high-dimensional activation vectors from different LLMs, we probe whether different cognitive levels, ranging from basic recall (Remember) to abstract synthesis (Create), are linearly separable within the model's residual streams. Our results demonstrate that linear classifiers achieve approximately 95% mean accuracy across all Bloom levels, providing strong evidence that cognitive level is encoded in a linearly accessible subspace of the model's representations. These findings provide evidence that the model resolves the cognitive difficulty of a prompt early in the forward pass, with representations becoming increasingly separable across layers.