Assessing the Reliability of Large Language Model Knowledge

📄 arXiv: 2310.09820v1 📥 PDF

作者: Weixuan Wang, Barry Haddow, Alexandra Birch, Wei Peng

分类: cs.CL

发布日期: 2023-10-15

🔗 代码/项目: GITHUB


💡 一句话要点

提出MONITOR以评估大型语言模型的知识可靠性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 知识可靠性 评估指标 MONITOR 事实知识测试

📋 核心要点

  1. 现有评估方法主要依赖准确率,无法有效反映LLMs在不同提示和上下文下的可靠性。
  2. 提出MONITOR指标,通过计算有效输出与不同提示下输出的概率分布距离,直接评估LLMs的事实可靠性。
  3. 在对12种LLMs的实验中,MONITOR展现出良好的评估效果,并且计算开销较低。

📝 摘要(中文)

大型语言模型(LLMs)因其在知识探测任务中的优异表现而被视为知识库。尽管通常通过准确率评估LLMs,但这一指标未能捕捉到LLMs在提示和上下文变化等因素下的脆弱性。本文提出了一种新颖的评估指标——模型知识可靠性评分(MONITOR),旨在直接测量LLMs的事实可靠性。MONITOR计算有效输出与同一LLM在不同提示和上下文下产生的输出概率分布之间的距离。通过对12种LLMs的广泛实验,验证了MONITOR在评估LLMs事实可靠性方面的有效性,同时保持了较低的计算开销。此外,本文还发布了包含210,158个提示的FKTC(事实知识测试语料库)测试集,以促进相关研究。

🔬 方法详解

问题定义:本文旨在解决现有评估大型语言模型知识可靠性的方法不足,特别是准确率无法反映模型在不同上下文下的表现脆弱性。

核心思路:提出MONITOR,通过比较同一LLM在不同提示下的输出概率分布,直接量化其事实可靠性,以更全面地评估模型的知识一致性。

技术框架:MONITOR的整体架构包括数据收集、模型输出生成、概率分布计算和可靠性评分四个主要模块。首先收集多样化的提示,然后使用LLM生成输出,接着计算不同输出的概率分布,最后得出可靠性评分。

关键创新:MONITOR的创新在于其直接测量模型输出的一致性,而非仅依赖于传统的准确率指标。这一方法能够更好地捕捉到LLMs在面对不同提示时的表现差异。

关键设计:在设计中,MONITOR关注输出的概率分布差异,采用了适当的距离度量方法来量化这些差异,确保评估结果的准确性和可靠性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,MONITOR在评估12种大型语言模型的事实可靠性方面表现出色,相较于传统准确率指标,能够更有效地识别模型在不同提示下的输出一致性,且计算开销保持在较低水平。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、知识问答系统和对话系统等。通过提供更可靠的评估指标,MONITOR能够帮助研究人员和开发者更好地理解和改进大型语言模型的知识表现,进而提升实际应用中的用户体验和系统性能。

📄 摘要(原文)

Large language models (LLMs) have been treated as knowledge bases due to their strong performance in knowledge probing tasks. LLMs are typically evaluated using accuracy, yet this metric does not capture the vulnerability of LLMs to hallucination-inducing factors like prompt and context variability. How do we evaluate the capabilities of LLMs to consistently produce factually correct answers? In this paper, we propose MOdel kNowledge relIabiliTy scORe (MONITOR), a novel metric designed to directly measure LLMs' factual reliability. MONITOR computes the distance between the probability distributions of a valid output and its counterparts produced by the same LLM probing the same fact using different styles of prompts and contexts.Experiments on a comprehensive range of 12 LLMs demonstrate the effectiveness of MONITOR in evaluating the factual reliability of LLMs while maintaining a low computational overhead. In addition, we release the FKTC (Factual Knowledge Test Corpus) test set, containing 210,158 prompts in total to foster research along this line (https://github.com/Vicky-Wil/MONITOR).