HANSEN: Human and AI Spoken Text Benchmark for Authorship Analysis

📄 arXiv: 2310.16746v1 📥 PDF

作者: Nafis Irtiza Tripto, Adaku Uchendu, Thai Le, Mattia Setzu, Fosca Giannotti, Dongwon Lee

分类: cs.CL

发布日期: 2023-10-25

备注: 9 pages, EMNLP-23 findings, 5 pages appendix, 6 figures, 17 tables

🔗 代码/项目: HUGGINGFACE


💡 一句话要点

提出HANSEN基准以解决人类与AI口语文本作者分析问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 作者分析 口语文本 大型语言模型 自然语言处理 数据集构建 AI生成文本 风格分析

📋 核心要点

  1. 现有的作者分析方法主要集中在书面文本,缺乏对口语文本的研究,导致在口语文本分析中存在明显的空白。
  2. 本文提出HANSEN基准,专注于口语文本的作者分析,结合现有数据集与新生成的AI口语文本,填补这一空白。
  3. 实验结果表明,尽管在书面文本上表现良好的SOTA方法在口语文本上仍有提升空间,尤其是在AI生成文本的检测方面。

📝 摘要(中文)

作者分析(又称风格分析)在自然语言处理(NLP)中一直是一个重要的研究领域。随着大型语言模型(LLMs)的发展,作者分析在区分人类撰写与AI生成文本方面变得愈发重要。然而,现有的作者分析任务主要集中在书面文本上,忽视了口语文本。因此,本文提出了HANSEN(人类与AI口语文本基准),这是针对口语文本的最大基准,涵盖了现有语音数据集的精心策划及新生成的AI口语文本数据集。HANSEN包含17个人类数据集和使用三种主要LLM(ChatGPT、PaLM2和Vicuna13B)生成的AI口语文本。通过对人类口语数据集进行作者归属和作者验证,并使用最先进的模型进行人类与AI口语文本检测,展示了HANSEN的实用性。

🔬 方法详解

问题定义:本文旨在解决现有作者分析方法在口语文本分析中的不足,尤其是缺乏针对AI生成口语文本的有效检测手段。

核心思路:通过构建HANSEN基准,整合人类与AI生成的口语文本数据集,提供一个全面的评估平台,以支持口语文本的作者分析任务。

技术框架:HANSEN基准包括17个人类口语数据集和使用三种大型语言模型生成的AI口语文本,采用最先进的模型进行作者归属和验证。

关键创新:HANSEN是首个针对口语文本的综合性基准,填补了现有研究的空白,特别是在AI生成文本的检测能力上。

关键设计:在数据集构建中,精心策划现有语音数据集并生成新的AI口语文本,确保数据的多样性和代表性,同时采用SOTA模型进行性能评估。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,尽管SOTA方法在书面文本上表现良好,但在AI生成口语文本的检测上仍有显著提升空间。具体而言,现有模型在口语文本的作者归属和验证任务中表现出与书面文本相似的性能,但在AI文本检测方面的准确率仍需提高。

🎯 应用场景

HANSEN基准的提出为口语文本的作者分析提供了新的研究工具,具有广泛的应用潜力。它可以被用于教育、法律、媒体等领域,帮助识别文本的真实来源,提升文本的可信度和安全性。未来,HANSEN可能推动更多关于口语与书面文本分析的研究,促进NLP领域的进一步发展。

📄 摘要(原文)

Authorship Analysis, also known as stylometry, has been an essential aspect of Natural Language Processing (NLP) for a long time. Likewise, the recent advancement of Large Language Models (LLMs) has made authorship analysis increasingly crucial for distinguishing between human-written and AI-generated texts. However, these authorship analysis tasks have primarily been focused on written texts, not considering spoken texts. Thus, we introduce the largest benchmark for spoken texts - HANSEN (Human ANd ai Spoken tExt beNchmark). HANSEN encompasses meticulous curation of existing speech datasets accompanied by transcripts, alongside the creation of novel AI-generated spoken text datasets. Together, it comprises 17 human datasets, and AI-generated spoken texts created using 3 prominent LLMs: ChatGPT, PaLM2, and Vicuna13B. To evaluate and demonstrate the utility of HANSEN, we perform Authorship Attribution (AA) & Author Verification (AV) on human-spoken datasets and conducted Human vs. AI spoken text detection using state-of-the-art (SOTA) models. While SOTA methods, such as, character ngram or Transformer-based model, exhibit similar AA & AV performance in human-spoken datasets compared to written ones, there is much room for improvement in AI-generated spoken text detection. The HANSEN benchmark is available at: https://huggingface.co/datasets/HANSEN-REPO/HANSEN.