Can Foundation Models Moderate Online Content? Evaluating Instruction- vs. Example-Driven Policy Operationalization
作者: Ayan Majumdar, Shounak Paul, Pushpdeep Singh, Ines Abdelaziz, Sayeh Jarollahi, Seungeon Lee, Krishna P. Gummadi, Ingmar Weber, Abhisek Dash
分类: cs.CL, cs.AI, cs.CY
发布日期: 2026-09-09
备注: 33 pages, 28 figures, 8 tables
💡 一句话要点
比较指令驱动与示例驱动的内容审核政策实施方法
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 内容审核 基础模型 视觉语言模型 政策实施 机器学习
📋 核心要点
- 内容审核政策的复杂性导致其一致性实施面临重大挑战,现有方法难以满足这一需求。
- 本文提出了两种不同的视觉语言模型指导范式,分别为指令驱动和示例驱动,以提高内容审核的可靠性。
- 实验结果显示,基础模型在审核性能上显著优于现有系统,F1分数从0.22提升至0.60,展示了其有效性。
📝 摘要(中文)
随着内容审核政策复杂性的增加,如何一致地实施这些政策成为了一项关键挑战。尽管基础模型具备应对这一挑战的基本能力,但它们是否能可靠地审核在线内容仍然是一个未解之谜。本文系统比较了两种竞争的视觉语言模型(VLM)指导范式:一种是基于指令的方式,模型依据政策原则进行推理;另一种是基于示例的方式,模型从先前的案例中进行概括。我们在ModerationBench这一新基准上进行了研究,该基准包含来自Bluesky平台的4000条手动标注的真实帖子。实验结果表明,基础模型在审核性能上显著优于Bluesky现有的审核系统,F1分数几乎提高了三倍(0.60对比0.22),且指令驱动和示例驱动的范式在效果上相当。我们的发现为大规模可靠和适应性强的政策实施指明了方向。
🔬 方法详解
问题定义:本文旨在解决内容审核政策实施中的一致性和可靠性问题。现有的审核系统在处理复杂内容时表现不佳,难以适应多样化的在线环境。
核心思路:论文提出通过比较指令驱动和示例驱动的两种方法来优化内容审核。指令驱动方法依赖于政策原则进行推理,而示例驱动方法则通过历史案例进行学习,从而提高审核的准确性和适应性。
技术框架:研究采用ModerationBench基准进行评估,包含4000条手动标注的帖子。实验流程包括数据收集、模型训练、性能评估等多个阶段,确保全面比较两种方法的效果。
关键创新:最重要的创新在于系统性地比较了两种不同的内容审核策略,揭示了基础模型在内容审核中的潜力,并为政策实施提供了新的思路。
关键设计:在模型设计上,采用了适应性强的网络结构,并在损失函数中引入了针对内容审核的特定优化目标,以提升模型的审核性能。实验中还对模型的参数进行了细致调优,以确保最佳效果。
🖼️ 关键图片
📊 实验亮点
实验结果显示,基础模型在ModerationBench基准测试中,F1分数从Bluesky现有审核系统的0.22提升至0.60,几乎是其三倍,表明基础模型在内容审核中的显著优势。指令驱动和示例驱动的两种方法在性能上表现相当,均展示了良好的适应性。
🎯 应用场景
该研究的潜在应用领域包括社交媒体平台、在线社区和内容分享网站等,能够为这些平台提供更为可靠和高效的内容审核解决方案。通过优化审核政策的实施,能够有效减少有害内容的传播,提升用户体验和平台安全性。未来,该研究可能推动更广泛的自动化内容审核技术的发展。
📄 摘要(原文)
The growing complexity of content moderation policies presents a critical challenge for their consistent operationalization. While foundation models possess the basic capabilities needed to confront this challenge, whether they can reliably moderate online content remains an unanswered question. In this paper, we systematically compare two competing paradigms for Vision-Language Model (VLM) guidance: an instruction-driven approach where models reason from policy precepts, and an example-driven approach where they generalize from prior precedents. We ground this investigation in ModerationBench, a new benchmark of 4,000 manually annotated, in-the-wild posts from the Bluesky platform. Our experiments reveal that foundation models can substantially outperform Bluesky's deployed moderation system, nearly tripling its $F_1$ score (0.60 vs. 0.22) on Random Posts in the benchmark, with both instruction- and example-driven paradigms achieving comparable peak effectiveness. Our findings thus chart a path toward reliable and adaptable policy operationalization at scale.