On Epistemic Diversity in Large Language Models
作者: Elisabeth Kirsten, Nicole Krämer, Muhammad Bilal Zafar
分类: cs.CL
发布日期: 2026-09-04
💡 一句话要点
提出评估大语言模型的认识多样性框架以解决知识获取问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 认识多样性 知识获取 评估框架 知识密集型任务
📋 核心要点
- 现有的大语言模型在知识获取方面存在局限,往往只提供单一的答案,限制了用户的选择。
- 本文提出了一种新的评估框架,强调认识多样性,旨在提升用户获取多样化知识的能力。
- 研究表明,当前前沿LLMs在提供答案时表现出认识狭隘性,需改进以支持更广泛的知识探索。
📝 摘要(中文)
大型语言模型(LLMs)不仅用于信息检索,还用于回答问题、解释、教学和支持探究。在这些场景中,单纯依赖准确性或一致性进行评估是不够的。一个系统可能给出正确答案,但仍然限制用户获取其他有效答案、解释或推理路径的机会。基于哲学和社会认识论中的认识多样性概念,本文在LLMs的背景下将其形式化为模型向用户展示的有效答案、解释和推理路径的范围。我们认为,认识多样性是支持知识密集型任务时的重要评估维度,并提出了一个初步框架来概念化和测量LLMs中的认识多样性,并在两个领域进行了操作化。研究发现,前沿LLMs常常表现出认识狭隘性,反复将大有效答案空间压缩到小的典范子集。这些发现表明,LLM评估应超越以准确性为导向的范式,将认识多样性视为模型能力的重要维度。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在知识密集型任务中,提供多样化有效答案的不足。现有方法往往只关注准确性,忽视了用户对多样化知识的需求。
核心思路:论文提出了认识多样性作为评估LLMs的新维度,强调模型应展示多种有效的答案和推理路径,以支持用户的知识探索。
技术框架:研究构建了一个初步的框架,包含认识多样性的概念化、测量方法及其在两个领域的操作化。框架分为理论构建和实证验证两个主要阶段。
关键创新:最重要的创新在于将哲学中的认识多样性概念引入LLMs评估,提出了新的评估维度,超越了传统的准确性导向。
关键设计:在框架中,设计了多样性测量指标,结合了用户反馈和模型输出,确保评估的全面性和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,当前前沿LLMs在提供答案时,往往将有效答案空间压缩至小的典范子集,显示出明显的认识狭隘性。通过引入认识多样性评估,模型的知识展示能力有望得到显著提升。
🎯 应用场景
该研究的潜在应用领域包括教育、信息检索和智能问答系统等,能够帮助用户更全面地获取和理解知识。通过提升模型的认识多样性,未来的LLMs将更有效地支持复杂的知识密集型任务,促进用户的深入学习和探究。
📄 摘要(原文)
Large language models (LLMs) are increasingly used not only to retrieve information, but to answer questions, explain, teach, and support inquiry. In such settings, evaluation cannot be exhausted by accuracy or alignment alone. A system may give a correct answer while still narrowing users' access %to knowledge. to alternative valid answers, explanations, or reasoning routes. Drawing on the broader notion of epistemic diversity in philosophy and social epistemology, we formalize it in the context of LLMs as the range of valid answers, explanations, and reasoning routes that an LLM exposes to users. We argue that epistemic diversity is a useful evaluation dimension for settings where LLMs are used to support knowledge-intensive tasks. We propose a preliminary framework for conceptualizing and measuring epistemic diversity in LLMs, and operationalize it in two domains. We find that frontier LLMs often exhibit epistemic narrowness, repeatedly collapsing large valid answer spaces onto small canonical subsets. These findings suggest that LLM evaluation should move beyond accuracy-oriented paradigms and treat epistemic diversity as an important dimension of model capability.