Evaluating Hallucinations in Chinese Large Language Models

📄 arXiv: 2310.03368v4 📥 PDF

作者: Qinyuan Cheng, Tianxiang Sun, Wenwei Zhang, Siyin Wang, Xiangyang Liu, Mozhi Zhang, Junliang He, Mianqiu Huang, Zhangyue Yin, Kai Chen, Xipeng Qiu

分类: cs.CL

发布日期: 2023-10-05 (更新: 2023-10-25)

备注: Work in progress


💡 一句话要点

提出HalluQA基准以评估中文大语言模型的幻觉现象

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 中文大语言模型 幻觉现象 HalluQA 对抗性问题 自动评估 模型评估 文化背景

📋 核心要点

  1. 现有中文大语言模型在生成内容时常出现幻觉现象,影响其可信度和实用性。
  2. 本文提出HalluQA基准,通过设计对抗性问题来评估模型的幻觉现象,涵盖多领域的文化和社会背景。
  3. 在24个大语言模型的实验中,18个模型的非幻觉率低于50%,显示出HalluQA的挑战性和重要性。

📝 摘要(中文)

本文建立了一个名为HalluQA(中文幻觉问答)的基准,以测量中文大语言模型中的幻觉现象。HalluQA包含450个精心设计的对抗性问题,涵盖多个领域,并考虑了中国历史文化、习俗和社会现象。在HalluQA的构建过程中,我们考虑了两种类型的幻觉:模仿性虚假和事实错误,并基于GLM-130B和ChatGPT构建对抗样本。我们设计了一种使用GPT-4的自动评估方法来判断模型输出是否存在幻觉。对24个大语言模型进行了广泛实验,结果显示18个模型的非幻觉率低于50%,表明HalluQA具有很高的挑战性。

🔬 方法详解

问题定义:本文旨在解决中文大语言模型生成内容时的幻觉现象,现有方法未能有效评估和识别这些幻觉,导致模型输出的可信度不足。

核心思路:通过构建HalluQA基准,设计450个对抗性问题,涵盖历史文化和社会现象,从而系统性地评估模型的幻觉表现。

技术框架:HalluQA的构建分为问题设计、对抗样本生成和自动评估三个主要模块。问题设计考虑了多种文化背景,对抗样本基于现有模型生成,评估则使用GPT-4进行自动化判断。

关键创新:HalluQA基准的提出是本研究的核心创新,系统性地评估了中文大语言模型的幻觉现象,填补了现有研究的空白。

关键设计:在对抗样本生成中,采用GLM-130B和ChatGPT作为基础模型,设计了针对性的损失函数以优化模型输出的准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在对24个大语言模型的实验中,发现18个模型的非幻觉率低于50%,显示出HalluQA基准的高挑战性。这一结果强调了当前中文大语言模型在生成内容时面临的重大问题,推动了对幻觉现象的深入研究。

🎯 应用场景

该研究的潜在应用领域包括教育、内容生成和信息检索等。通过评估和减少幻觉现象,能够提高中文大语言模型在实际应用中的可靠性和用户信任度,推动相关技术的进一步发展。

📄 摘要(原文)

In this paper, we establish a benchmark named HalluQA (Chinese Hallucination Question-Answering) to measure the hallucination phenomenon in Chinese large language models. HalluQA contains 450 meticulously designed adversarial questions, spanning multiple domains, and takes into account Chinese historical culture, customs, and social phenomena. During the construction of HalluQA, we consider two types of hallucinations: imitative falsehoods and factual errors, and we construct adversarial samples based on GLM-130B and ChatGPT. For evaluation, we design an automated evaluation method using GPT-4 to judge whether a model output is hallucinated. We conduct extensive experiments on 24 large language models, including ERNIE-Bot, Baichuan2, ChatGLM, Qwen, SparkDesk and etc. Out of the 24 models, 18 achieved non-hallucination rates lower than 50%. This indicates that HalluQA is highly challenging. We analyze the primary types of hallucinations in different types of models and their causes. Additionally, we discuss which types of hallucinations should be prioritized for different types of models.