内容安全与审核:AI 应用不可忽视的风控

为什么要做内容安全

生成式 AI 面向公众提供服务时,生成内容即属「网络信息内容」,提供者依法承担内容生产者责任。一旦输出违法违规、虚假或有害内容,轻则损害声誉,重则触发处罚、暂停服务乃至刑事责任。内容安全是 AI 应用上线前必须内建的风控基座。

法规基线(生成式 AI 办法要点)

《生成式人工智能服务管理暂行办法》(国家网信办等七部门,2023 年 8 月 15 日起施行)是核心依据,相关要求包括:

  • 第四条:坚持社会主义核心价值观,不得生成煽动颠覆国家政权、危害国家安全、煽动分裂国家、宣扬恐怖主义或极端主义、民族仇恨与歧视、暴力、淫秽色情,以及虚假有害信息等法律禁止的内容。
  • 第九条:提供者应当依法承担网络信息内容生产者责任,履行网络信息安全义务。
  • 第十条:明确适用人群与用途,防范未成年人用户过度依赖或沉迷。
  • 第十二条:按照《互联网信息服务深度合成管理规定》对图片、视频等生成内容进行标识。
  • 第十四条:发现违法内容的,应及时停止生成、停止传输、消除,并整改及向主管部门报告。

在内容标识方面,国家网信办、工信部、公安部、广电总局联合印发《人工智能生成合成内容标识办法》(2025 年 3 月发布,2025 年 9 月 1 日起施行),并配强制性国家标准《网络安全技术 人工智能生成合成内容标识方法》。标识分两类:

  • 显式标识:在内容或交互界面中以文字、声音、图形等方式呈现、用户可明显感知的标识(如画面角标、提示文字「由 AI 生成」)。
  • 隐式标识:通过技术措施写入文件元数据、不易被用户感知的标识,记录生成合成属性、服务提供者名称或编码、内容编号等,用于机器识别与责任追溯。

审核维度

文本与图像通常按以下维度审查:

  • 违法违规:危害国家安全、煽动颠覆、分裂国家、恐怖主义、极端主义等。
  • 暴力:血腥、自残、宣扬暴力与恐怖行为。
  • 色情:淫秽色情、低俗内容。
  • 虚假信息:谣言、深度伪造、以假乱真的误导性内容。
  • 未成年人保护:诱导沉迷、危害身心健康的涉未成年人内容。
  • 其他:歧视偏见、侵权(肖像权、名誉权、知识产权)、隐私泄露。

机审与人审流水线

典型流水线是「机审前置、人审兜底」:

  1. 输入与输出两侧都过机审:输出侧用分类模型(如文本违规分类、图像鉴黄/暴恐识别)和规则(敏感词、正则、黑名单)打分。
  2. 按风险分流出路:低风险直接放行,中风险转人工复核,高风险硬拦截并触发处置。
  3. 人审复核疑难样本,并将结果回流标注,用于迭代模型与规则。
审核分级示意(按风险等级分流)
L0 安全:正常内容,直接放行
L1 低风险:命中敏感词但语境正常,机审放行 + 抽检
L2 中风险:疑似违规,机审拦截 + 人审复核
L3 高风险:明确违法/暴力/色情,机审硬拦截 + 即时处置并上报

机审长于吞吐与一致,短板在语境;人审长于语义判断,短板在成本与速度,二者互补不可替代。

漏杀与误杀的权衡

  • 漏杀(false negative):违规内容被放行,触及合规红线,可能直接触发第十四条的处置与上报义务。
  • 误杀(false positive):正常内容被拦截,损害体验与信任,长期影响留存。

实务按风险不对称原则调阈值:政治安全、暴恐、色情等高危类目优先压低漏杀(宁严勿漏);普通争议内容适度提高召回容忍,靠人审纠偏减误杀。以线上抽样持续监测二者比例,避免为压误杀而系统性抬高漏杀。

落地清单

  • 明确提供者责任,签署用户协议并公示适用人群与用途。
  • 部署文本与图像机审(分类模型 + 规则),覆盖违规、暴力、色情、虚假、未成年人等维度。
  • 对生成图片、视频依规添加显式与隐式标识。
  • 建立人审团队与分级流转,疑难样本回流训练。
  • 打通投诉举报入口,发现违法内容即停止生成、消除并上报。
  • 定期评估漏杀率与误杀率,迭代模型与策略。

小结

内容安全是生成式 AI 服务的法定义务与工程刚需。以《生成式人工智能服务管理暂行办法》为基线,落实显式与隐式标识,用「机审前置、人审兜底」流水线覆盖违规、暴力、色情、虚假、未成年人等维度,并按风险不对称原则在漏杀与误杀间持续调优。

参考与延伸阅读

本文累计阅读