Large Language Models for Propaganda Detection

📄 arXiv: 2310.06422v2 📥 PDF

作者: Kilian Sprenkamp, Daniel Gordon Jones, Liudmila Zavolokina

分类: cs.CL, cs.AI

发布日期: 2023-10-10 (更新: 2023-11-27)


💡 一句话要点

利用大型语言模型检测数字社会中的宣传信息

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 宣传检测 大型语言模型 自然语言处理 多标签分类 GPT-4 信息传播 社交媒体监测

📋 核心要点

  1. 现有的宣传检测方法面临微妙操控技术和上下文依赖性等挑战,导致检测效果不理想。
  2. 本文提出利用大型语言模型(如GPT-3和GPT-4)进行宣传检测,结合提示工程和微调策略以提高检测效果。
  3. 实验结果显示,GPT-4在宣传检测任务中表现出与当前最先进方法相当的效果,验证了LLMs的有效性。

📝 摘要(中文)

在数字社会中,宣传的普遍存在对社会和谐与真相传播构成挑战。通过自然语言处理(NLP)检测文本中的宣传信息面临微妙的操控技术和上下文依赖性等困难。为了解决这一问题,本文研究了现代大型语言模型(LLMs),如GPT-3和GPT-4,在宣传检测中的有效性。我们使用SemEval-2020任务11数据集进行实验,该数据集包含标记有14种宣传技术的新闻文章,构成多标签分类问题。采用五种不同的GPT-3和GPT-4变体,结合多种提示工程和微调策略。通过评估F1分数、精确率和召回率等指标,我们将模型的表现与当前最先进的RoBERTa方法进行了比较。研究结果表明,GPT-4的表现与当前最先进的方法相当,并分析了LLMs在复杂任务如宣传检测中的潜力和挑战。

🔬 方法详解

问题定义:本文旨在解决在文本中检测宣传信息的具体问题,现有方法在面对微妙的操控技术和上下文依赖性时效果不佳。

核心思路:通过利用现代大型语言模型(如GPT-3和GPT-4),结合多种提示工程和微调策略,提升宣传检测的准确性和鲁棒性。

技术框架:整体架构包括数据预处理、模型选择、提示设计、微调训练和性能评估等主要模块。首先,使用SemEval-2020任务11数据集进行训练和测试,然后通过不同的模型变体进行比较。

关键创新:最重要的技术创新在于将大型语言模型应用于复杂的宣传检测任务,并通过多种策略优化其性能,与传统方法相比,提供了更高的灵活性和准确性。

关键设计:在模型训练中,采用了多种提示工程技术和微调策略,评估指标包括F1分数、精确率和召回率,以确保模型在多标签分类任务中的有效性。通过对比当前最先进的RoBERTa方法,验证了所提方法的优越性。

📊 实验亮点

实验结果显示,GPT-4在宣传检测任务中取得了与当前最先进的RoBERTa方法相当的效果,F1分数、精确率和召回率均表现优异,验证了大型语言模型在复杂文本分析中的潜力。

🎯 应用场景

该研究的潜在应用领域包括社交媒体监测、新闻验证和信息传播分析等。通过有效检测宣传信息,可以帮助公众更好地识别和抵制虚假信息,促进社会的真实信息传播,具有重要的社会价值和影响力。

📄 摘要(原文)

The prevalence of propaganda in our digital society poses a challenge to societal harmony and the dissemination of truth. Detecting propaganda through NLP in text is challenging due to subtle manipulation techniques and contextual dependencies. To address this issue, we investigate the effectiveness of modern Large Language Models (LLMs) such as GPT-3 and GPT-4 for propaganda detection. We conduct experiments using the SemEval-2020 task 11 dataset, which features news articles labeled with 14 propaganda techniques as a multi-label classification problem. Five variations of GPT-3 and GPT-4 are employed, incorporating various prompt engineering and fine-tuning strategies across the different models. We evaluate the models' performance by assessing metrics such as $F1$ score, $Precision$, and $Recall$, comparing the results with the current state-of-the-art approach using RoBERTa. Our findings demonstrate that GPT-4 achieves comparable results to the current state-of-the-art. Further, this study analyzes the potential and challenges of LLMs in complex tasks like propaganda detection.