GPT-who: An Information Density-based Machine-Generated Text Detector

📄 arXiv: 2310.06202v3 📥 PDF

作者: Saranya Venkatraman, Adaku Uchendu, Dongwon Lee

分类: cs.CL

发布日期: 2023-10-09 (更新: 2024-04-03)

备注: To appear in Findings of the Association for Computational Linguistics: NAACL 2024

🔗 代码/项目: GITHUB


💡 一句话要点

提出GPT-who以解决机器生成文本检测问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 机器生成文本检测 均匀信息密度 心理语言学 统计特征 大型语言模型

📋 核心要点

  1. 现有的机器生成文本检测方法在准确性和效率上存在不足,难以有效区分复杂的LLMs生成的文本与人类文本。
  2. 本文提出的GPT-who检测器基于均匀信息密度原则,利用UID特征建模不同作者的统计特征,从而实现高效的文本检测。
  3. 实验结果表明,GPT-who在四个大规模数据集上性能超越了多种现有检测器,且计算成本低,具有良好的可解释性。

📝 摘要(中文)

均匀信息密度(UID)原则认为人类在语言生成过程中倾向于均匀分配信息。本文探讨UID原则是否能帮助捕捉大型语言模型(LLMs)生成文本与人类生成文本之间的差异。我们提出了GPT-who,这是首个基于心理语言学的领域无关统计检测器,利用UID特征建模每个LLM和人类作者的独特统计特征以实现准确检测。通过在四个大规模基准数据集上的评估,我们发现GPT-who在各个领域的性能超过了现有的最先进检测器(包括统计和非统计方法),提升幅度超过20%。此外,GPT-who计算开销小,并且利用可解释的文本表示。即使在文本难以辨别的情况下,GPT-who也能区分出由非常复杂的LLMs生成的文本。所有数据集的UID度量和代码可在https://github.com/saranya-venkatraman/gpt-who获取。

🔬 方法详解

问题定义:本文旨在解决机器生成文本与人类生成文本的检测问题。现有方法在准确性和效率上存在挑战,尤其是在面对复杂的LLMs生成文本时,难以有效区分。

核心思路:论文的核心思路是基于均匀信息密度(UID)原则,利用UID特征来建模不同作者的独特统计特征,以实现更高的检测准确性。这样的设计能够捕捉文本生成过程中的信息分布特征,从而提高检测效果。

技术框架:GPT-who的整体架构包括数据预处理、UID特征提取、模型训练和检测阶段。首先对文本进行预处理,然后提取UID特征,接着训练模型以识别不同的统计特征,最后进行文本检测。

关键创新:最重要的技术创新点在于首次将心理语言学的UID原则应用于机器生成文本检测,形成了一种新的检测思路,与现有方法相比,能够更准确地捕捉文本生成的统计特征。

关键设计:在关键设计上,GPT-who采用了特定的UID特征提取算法,并结合了适当的损失函数和网络结构,以确保模型能够有效学习和区分不同文本的统计特征。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,GPT-who在四个大规模基准数据集上的表现超过了现有的最先进检测器,提升幅度超过20%。此外,GPT-who在计算开销上也表现出色,提供了更高的效率和可解释性。

🎯 应用场景

该研究的潜在应用领域包括文本内容审核、社交媒体监控和学术诚信检测等。GPT-who的高效性和准确性使其在识别机器生成内容方面具有重要的实际价值,未来可能对信息传播和内容生成的监管产生深远影响。

📄 摘要(原文)

The Uniform Information Density (UID) principle posits that humans prefer to spread information evenly during language production. We examine if this UID principle can help capture differences between Large Language Models (LLMs)-generated and human-generated texts. We propose GPT-who, the first psycholinguistically-inspired domain-agnostic statistical detector. This detector employs UID-based features to model the unique statistical signature of each LLM and human author for accurate detection. We evaluate our method using 4 large-scale benchmark datasets and find that GPT-who outperforms state-of-the-art detectors (both statistical- & non-statistical) such as GLTR, GPTZero, DetectGPT, OpenAI detector, and ZeroGPT by over $20$% across domains. In addition to better performance, it is computationally inexpensive and utilizes an interpretable representation of text articles. We find that GPT-who can distinguish texts generated by very sophisticated LLMs, even when the overlying text is indiscernible. UID-based measures for all datasets and code are available at https://github.com/saranya-venkatraman/gpt-who.