SIRF: A Spec-Internalized Risk Foundation Model for Industrial Content Risk Control

📄 arXiv: 2609.11752v1 📥 PDF

作者: Suwan Wu, Yumeng Lin, Pengcheng Yuan, Xiaolong Jiang

分类: cs.AI, cs.CL, cs.LG

发布日期: 2026-09-10

备注: 14 pages, 12 figures. Accepted at the Industry Track of EMNLP 2026


💡 一句话要点

提出SIRF模型以解决工业内容风险控制问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 工业内容风险控制 持续预训练 政策内化 低延迟决策 高精度模型

📋 核心要点

  1. 现有方法在工业内容风险控制中面临的挑战是如何在高精度和低延迟下有效处理风险,而不仅仅是追求平均准确率。
  2. SIRF模型通过内化复杂政策,利用持续预训练技术,实现高精度、低延迟的风险控制,避免了额外的人为标注。
  3. 实验结果表明,SIRF-8B-SFT在黑色召回率@P95上达到了71.3%,较基线提升了15.1个百分点,且在处理能力上与更大模型相当或更优。

📝 摘要(中文)

针对工业内容风险控制,实际部署的关键不在于平均准确率,而在于在高精度和秒级延迟下自动处理风险的能力。本文提出的SIRF(Spec-Internalized Risk Foundation Model)通过EntiGraph、MAGA重写和账户级思维链(CoT)将复杂政策内化为权重,利用持续预训练(CPT)实现高精度、超低延迟的判决输出。与基线模型相比,SIRF-8B-SFT在黑色召回率@P95上提升了15.1个百分点,且在不损害通用能力的情况下,仅使用约7000万CPT标记。SIRF还作为树模型裁决层部署,显著降低了误惩罚样本。

🔬 方法详解

问题定义:本文旨在解决工业内容风险控制中的实时性和准确性问题。现有方法往往关注平均准确率,忽视了在高精度和低延迟下的风险处理能力。

核心思路:SIRF模型通过内化复杂的政策,利用EntiGraph、MAGA重写和账户级思维链(CoT),将这些政策转化为模型权重,从而实现高效的风险控制。

技术框架:SIRF的整体架构包括三个主要模块:政策内化模块、持续预训练模块和判决输出模块。政策内化模块负责将复杂政策转化为模型权重,持续预训练模块则通过大量标记数据进行模型优化,最后判决输出模块实现高精度的风险评估。

关键创新:SIRF的主要创新在于其政策内化能力,能够在不依赖额外人类标注的情况下,自动将复杂政策转化为模型权重。这一方法显著提高了模型在特定任务上的表现。

关键设计:在模型设计中,使用了约7000万CPT标记进行持续预训练,确保了在高精度下的判决输出。同时,模型结构设计上优化了参数设置,以适应低延迟的需求。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,SIRF-8B-SFT在黑色召回率@P95上达到了71.3%,较基线模型提升了15.1个百分点。此外,SIRF在处理能力上与更大模型相当或更优,且在误惩罚样本的恢复率上提高了20%。

🎯 应用场景

SIRF模型在工业内容风险控制领域具有广泛的应用潜力,特别是在需要快速响应和高精度决策的场景中,如金融监控、在线内容审核和自动化决策系统。其低成本的部署方式也为企业提供了更高的灵活性和效率,未来可能在更多行业中推广应用。

📄 摘要(原文)

For industrial content risk control, the real deployment constraint is not average accuracy but how much risk can be auto-handled under high precision and second-level latency. We present SIRF (Spec-Internalized Risk Foundation Model), which internalizes a platform's complex policies, synthesized without additional human annotation via EntiGraph, MAGA rewriting and account-level chain-of-thought (CoT), into the weights via continued pretraining (CPT), so rules are applied at high precision under an ultra-low-latency, verdict-only deployment. A controlled same-source comparison (Qwen3-8B-SFT vs. SIRF-8B-SFT, identical policy injection and verdict-only output form, differing only in policy-grounded CPT) attributes the gain to internalization: SIRF-8B-SFT reaches 71.3% Black Recall@P95, +15.1pp over the baseline, using only ~70M CPT tokens without harming general ability, and among included, logprob-available models under this interface it matches or exceeds far larger systems. SIRF is deployed as a tree-model adjudication layer (20% more mis-penalized samples recovered) and transfers to a freezing scenario at low cost (~70% relative mis-penalization reduction).