Demonstrations Are All You Need: Advancing Offensive Content Paraphrasing using In-Context Learning
作者: Anirudh Som, Karan Sikka, Helen Gent, Ajay Divakaran, Andreas Kathol, Dimitra Vergyri
分类: cs.CL, cs.AI
发布日期: 2023-10-16 (更新: 2024-06-09)
备注: Accepted in Association for Computational Linguistics (ACL) 2024 Findings
💡 一句话要点
提出基于上下文学习的攻击性内容改写方法以提升交流文明
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 攻击性内容改写 上下文学习 大语言模型 数据集构建 生成质量评估 毒性控制 人工评估 机器学习
📋 核心要点
- 现有的监督式攻击性内容改写方法依赖大量标注数据,且常常保留原内容的攻击性,影响其可用性。
- 本文提出利用上下文学习(ICL)的方法,通过少量示例指导大语言模型生成所需输出,提升改写效果。
- 实验结果显示,ICL方法在生成质量上与监督方法相当,但在人工评估中质量提高25%,毒性降低76%。
📝 摘要(中文)
攻击性内容的改写是比内容删除更好的选择,有助于改善交流环境的文明性。然而,现有的监督式改写方法依赖大量标注数据,且往往保留了原内容的大部分攻击性,影响其可用性。本文通过探索大语言模型的上下文学习(ICL),利用有限的输入-标签示例对模型进行指导,旨在帮助实践者开发可用的改写工具。研究重点包括示例的数量和顺序、提示指令的排除以及毒性降低。通过在三个数据集上进行评估,结果表明ICL在生成质量上与监督方法相当,但在人工评估中质量提高了25%,毒性降低了76%。
🔬 方法详解
问题定义:本文解决的是攻击性内容的改写问题,现有监督式方法依赖大量标注数据,且常保留原内容的攻击性,影响其可用性。
核心思路:论文提出利用上下文学习(ICL)的方法,通过少量的输入-标签示例对大语言模型进行指导,从而生成更符合要求的改写内容。这样的设计旨在减少对大量标注数据的依赖,同时提高生成内容的文明性。
技术框架:整体架构包括数据准备、示例选择、模型训练和评估四个主要阶段。首先构建包含攻击性对话的CAPP数据集,然后选择适当的示例对模型进行训练,最后通过多个数据集进行评估。
关键创新:最重要的技术创新在于通过上下文学习的方式,显著减少了对标注数据的需求,同时在生成质量和毒性控制上优于传统监督方法。
关键设计:在参数设置上,研究探讨了示例的数量和顺序对模型性能的影响,采用了特定的损失函数以优化生成内容的质量,并设计了适应性强的网络结构以支持不同类型的输入。
🖼️ 关键图片
📊 实验亮点
实验结果显示,基于上下文学习的改写方法在生成质量上与监督方法相当,但在人工评估中质量提高了25%,同时毒性降低了76%。此外,即使仅使用10%的训练数据,ICL方法的性能也仅有轻微下降,显示出其强大的适应性和有效性。
🎯 应用场景
该研究的潜在应用场景包括社交媒体平台、在线论坛和客户服务系统等,能够有效地改善用户之间的交流质量,减少攻击性言论的传播。未来,该方法可能在内容审核和自动化客服等领域发挥重要作用,促进更文明的网络环境。
📄 摘要(原文)
Paraphrasing of offensive content is a better alternative to content removal and helps improve civility in a communication environment. Supervised paraphrasers; however, rely heavily on large quantities of labelled data to help preserve meaning and intent. They also often retain a large portion of the offensiveness of the original content, which raises questions on their overall usability. In this paper we aim to assist practitioners in developing usable paraphrasers by exploring In-Context Learning (ICL) with large language models (LLMs), i.e., using a limited number of input-label demonstration pairs to guide the model in generating desired outputs for specific queries. Our study focuses on key factors such as - number and order of demonstrations, exclusion of prompt instruction, and reduction in measured toxicity. We perform principled evaluation on three datasets, including our proposed Context-Aware Polite Paraphrase (CAPP) dataset, comprising of dialogue-style rude utterances, polite paraphrases, and additional dialogue context. We evaluate our approach using four closed source and one open source LLM. Our results reveal that ICL is comparable to supervised methods in generation quality, while being qualitatively better by 25% on human evaluation and attaining lower toxicity by 76%. Also, ICL-based paraphrasers only show a slight reduction in performance even with just 10% training data.