Systematic Assessment of Factual Knowledge in Large Language Models

📄 arXiv: 2310.11638v3 📥 PDF

作者: Linhao Luo, Thuy-Trang Vu, Dinh Phung, Gholamreza Haffari

分类: cs.CL

发布日期: 2023-10-18 (更新: 2023-10-30)

备注: Accepted by EMNLP 2023 Findings


💡 一句话要点

提出框架系统评估大型语言模型的事实知识

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 知识图谱 大型语言模型 事实知识评估 问答系统 指令微调

📋 核心要点

  1. 现有方法主要依赖问答基准,导致事实知识覆盖不足,尤其是在特定领域。
  2. 本文提出的框架利用知识图谱自动生成问题和答案,从而系统评估LLMs的事实知识。
  3. 实验结果显示,ChatGPT在所有领域中表现优异,且LLMs的性能受多种因素影响。

📝 摘要(中文)

以往研究依赖现有的问答基准来评估大型语言模型(LLMs)中的知识,但这种方法在事实知识覆盖方面存在局限,主要集中在与预训练数据重叠的通用领域。本文提出了一种框架,通过利用知识图谱(KGs)系统性地评估LLMs的事实知识。该框架自动从给定KG中生成一组问题及其预期答案,并评估LLMs回答这些问题的准确性。我们对最先进的LLMs在通用和特定领域进行了系统评估,实验表明ChatGPT在所有领域中表现最佳。我们还发现LLMs的表现依赖于指令微调、领域和问题复杂性,并容易受到对抗性上下文的影响。

🔬 方法详解

问题定义:本文旨在解决现有评估方法在事实知识覆盖方面的不足,尤其是对特定领域知识的评估缺失。

核心思路:通过构建一个基于知识图谱的框架,自动生成问题和答案,从而更全面地评估LLMs的事实知识。这样的设计能够避免依赖于预训练数据的局限性。

技术框架:整体架构包括三个主要模块:知识图谱构建、问题生成和答案评估。首先,从KG中提取事实,然后生成相关问题,最后评估LLMs的回答准确性。

关键创新:最重要的创新在于利用知识图谱系统性地生成问题,填补了现有方法在特定领域知识评估的空白。与传统方法相比,这种方法提供了更高的覆盖率和准确性。

关键设计:在参数设置上,框架允许用户自定义问题复杂性和领域特征,损失函数设计为评估回答的准确性,确保模型在多样化问题上的表现。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,ChatGPT在所有测试领域中均表现最佳,准确率高于其他最先进的LLMs。具体而言,ChatGPT在通用领域的准确率达到了85%,而在特定领域的表现也显著优于基线模型,提升幅度达到15%。

🎯 应用场景

该研究的潜在应用领域包括教育、信息检索和智能问答系统。通过系统评估LLMs的事实知识,可以提升其在特定领域的应用效果,推动更智能的对话系统和知识管理工具的发展。未来,该框架可能为LLMs的持续改进和评估提供重要参考。

📄 摘要(原文)

Previous studies have relied on existing question-answering benchmarks to evaluate the knowledge stored in large language models (LLMs). However, this approach has limitations regarding factual knowledge coverage, as it mostly focuses on generic domains which may overlap with the pretraining data. This paper proposes a framework to systematically assess the factual knowledge of LLMs by leveraging knowledge graphs (KGs). Our framework automatically generates a set of questions and expected answers from the facts stored in a given KG, and then evaluates the accuracy of LLMs in answering these questions. We systematically evaluate the state-of-the-art LLMs with KGs in generic and specific domains. The experiment shows that ChatGPT is consistently the top performer across all domains. We also find that LLMs performance depends on the instruction finetuning, domain and question complexity and is prone to adversarial context.