SC-Safety: A Multi-round Open-ended Question Adversarial Safety Benchmark for Large Language Models in Chinese
作者: Liang Xu, Kangkang Zhao, Lei Zhu, Hang Xue
分类: cs.CL
发布日期: 2023-10-09
备注: 20 pages, 8 tables, 16 figures
💡 一句话要点
提出SC-Safety以评估中文大语言模型的安全性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大语言模型 安全性评估 对抗性测试 中文处理 开放式问题 人机交互 模型选择 机器学习
📋 核心要点
- 现有方法在评估中文大语言模型的安全性时缺乏系统性和全面性,难以应对复杂的对抗性场景。
- 本文提出SC-Safety基准,通过4912个开放式问题和多轮对抗性交互,全面评估中文LLMs的安全性。
- 实验结果显示,闭源模型在安全性上优于开源模型,中国模型与GPT-3.5-turbo相当,部分小型模型也表现出色。
📝 摘要(中文)
大型语言模型(LLMs),如ChatGPT和GPT-4,在自然语言理解和生成方面表现出色。然而,它们也可能生成有害内容,影响社会认知。为系统评估中文LLMs的安全性,本文提出了SuperCLUE-Safety(SC-Safety),这是一个包含4912个开放式问题的多轮对抗基准,涵盖20多个安全子维度。与现有方法相比,对抗性的人机交互显著增加了挑战。对13个主要支持中文的LLMs的实验结果表明,闭源模型在安全性方面优于开源模型,中国发布的模型在安全性上与GPT-3.5-turbo相当,部分参数在6B-13B的小型模型在安全性方面也表现出色。通过引入SC-Safety,我们旨在促进创建更安全、可信赖的LLMs的合作努力。基准和发现为模型选择提供了指导。
🔬 方法详解
问题定义:本文旨在解决现有中文大语言模型安全性评估方法的不足,特别是在对抗性场景下的评估挑战。现有方法往往缺乏系统性,无法全面覆盖安全性维度。
核心思路:论文提出的SC-Safety基准通过引入多轮对抗性问题,增强了对模型安全性的评估深度和广度,旨在通过人机交互的方式发现潜在的安全隐患。
技术框架:SC-Safety的整体架构包括问题生成模块、对抗性交互模块和评估模块。问题生成模块负责生成多样化的开放式问题,对抗性交互模块则模拟人机对话,评估模块则对模型的响应进行安全性分析。
关键创新:SC-Safety的主要创新在于其多轮对抗性评估机制,通过人机交互的方式显著提升了评估的挑战性和有效性,这与传统的静态评估方法形成鲜明对比。
关键设计:在设计上,SC-Safety采用了4912个开放式问题,涵盖20多个安全子维度,确保评估的全面性。同时,问题的多轮对抗性设计使得模型在面对复杂场景时的表现得以真实反映。
🖼️ 关键图片
📊 实验亮点
实验结果显示,闭源模型在安全性评估中表现优于开源模型,且中国发布的模型在安全性上与GPT-3.5-turbo相当。此外,部分参数在6B-13B的小型模型也能有效竞争,展示了模型规模与安全性之间的复杂关系。
🎯 应用场景
该研究的潜在应用领域包括人工智能助手、社交媒体内容生成和在线教育等。通过提供一个系统的安全性评估基准,SC-Safety能够帮助开发者和研究人员识别和改进模型中的安全隐患,从而提升用户信任和社会责任感。未来,SC-Safety有望成为评估中文大语言模型安全性的标准工具。
📄 摘要(原文)
Large language models (LLMs), like ChatGPT and GPT-4, have demonstrated remarkable abilities in natural language understanding and generation. However, alongside their positive impact on our daily tasks, they can also produce harmful content that negatively affects societal perceptions. To systematically assess the safety of Chinese LLMs, we introduce SuperCLUE-Safety (SC-Safety) - a multi-round adversarial benchmark with 4912 open-ended questions covering more than 20 safety sub-dimensions. Adversarial human-model interactions and conversations significantly increase the challenges compared to existing methods. Experiments on 13 major LLMs supporting Chinese yield the following insights: 1) Closed-source models outperform open-sourced ones in terms of safety; 2) Models released from China demonstrate comparable safety levels to LLMs like GPT-3.5-turbo; 3) Some smaller models with 6B-13B parameters can compete effectively in terms of safety. By introducing SC-Safety, we aim to promote collaborative efforts to create safer and more trustworthy LLMs. The benchmark and findings provide guidance on model selection. Our benchmark can be found at https://www.CLUEbenchmarks.com