内容安全与审核:AI 应用不可忽视的风控
为什么要做内容安全
生成式 AI 面向公众提供服务时,生成内容即属「网络信息内容」,提供者依法承担内容生产者责任。一旦输出违法违规、虚假或有害内容,轻则损害声誉,重则触发处罚、暂停服务乃至刑事责任。内容安全是 AI 应用上线前必须内建的风控基座。
法规基线(生成式 AI 办法要点)
《生成式人工智能服务管理暂行办法》(国家网信办等七部门,2023 年 8 月 15 日起施行)是核心依据,相关要求包括:
- 第四条:坚持社会主义核心价值观,不得生成煽动颠覆国家政权、危害国家安全、煽动分裂国家、宣扬恐怖主义或极端主义、民族仇恨与歧视、暴力、淫秽色情,以及虚假有害信息等法律禁止的内容。
- 第九条:提供者应当依法承担网络信息内容生产者责任,履行网络信息安全义务。
- 第十条:明确适用人群与用途,防范未成年人用户过度依赖或沉迷。
- 第十二条:按照《互联网信息服务深度合成管理规定》对图片、视频等生成内容进行标识。
- 第十四条:发现违法内容的,应及时停止生成、停止传输、消除,并整改及向主管部门报告。
在内容标识方面,国家网信办、工信部、公安部、广电总局联合印发《人工智能生成合成内容标识办法》(2025 年 3 月发布,2025 年 9 月 1 日起施行),并配强制性国家标准《网络安全技术 人工智能生成合成内容标识方法》。标识分两类:
- 显式标识:在内容或交互界面中以文字、声音、图形等方式呈现、用户可明显感知的标识(如画面角标、提示文字「由 AI 生成」)。
- 隐式标识:通过技术措施写入文件元数据、不易被用户感知的标识,记录生成合成属性、服务提供者名称或编码、内容编号等,用于机器识别与责任追溯。
审核维度
文本与图像通常按以下维度审查:
- 违法违规:危害国家安全、煽动颠覆、分裂国家、恐怖主义、极端主义等。
- 暴力:血腥、自残、宣扬暴力与恐怖行为。
- 色情:淫秽色情、低俗内容。
- 虚假信息:谣言、深度伪造、以假乱真的误导性内容。
- 未成年人保护:诱导沉迷、危害身心健康的涉未成年人内容。
- 其他:歧视偏见、侵权(肖像权、名誉权、知识产权)、隐私泄露。
机审与人审流水线
典型流水线是「机审前置、人审兜底」:
- 输入与输出两侧都过机审:输出侧用分类模型(如文本违规分类、图像鉴黄/暴恐识别)和规则(敏感词、正则、黑名单)打分。
- 按风险分流出路:低风险直接放行,中风险转人工复核,高风险硬拦截并触发处置。
- 人审复核疑难样本,并将结果回流标注,用于迭代模型与规则。
审核分级示意(按风险等级分流)
L0 安全:正常内容,直接放行
L1 低风险:命中敏感词但语境正常,机审放行 + 抽检
L2 中风险:疑似违规,机审拦截 + 人审复核
L3 高风险:明确违法/暴力/色情,机审硬拦截 + 即时处置并上报
机审长于吞吐与一致,短板在语境;人审长于语义判断,短板在成本与速度,二者互补不可替代。
漏杀与误杀的权衡
- 漏杀(false negative):违规内容被放行,触及合规红线,可能直接触发第十四条的处置与上报义务。
- 误杀(false positive):正常内容被拦截,损害体验与信任,长期影响留存。
实务按风险不对称原则调阈值:政治安全、暴恐、色情等高危类目优先压低漏杀(宁严勿漏);普通争议内容适度提高召回容忍,靠人审纠偏减误杀。以线上抽样持续监测二者比例,避免为压误杀而系统性抬高漏杀。
落地清单
- 明确提供者责任,签署用户协议并公示适用人群与用途。
- 部署文本与图像机审(分类模型 + 规则),覆盖违规、暴力、色情、虚假、未成年人等维度。
- 对生成图片、视频依规添加显式与隐式标识。
- 建立人审团队与分级流转,疑难样本回流训练。
- 打通投诉举报入口,发现违法内容即停止生成、消除并上报。
- 定期评估漏杀率与误杀率,迭代模型与策略。
小结
内容安全是生成式 AI 服务的法定义务与工程刚需。以《生成式人工智能服务管理暂行办法》为基线,落实显式与隐式标识,用「机审前置、人审兜底」流水线覆盖违规、暴力、色情、虚假、未成年人等维度,并按风险不对称原则在漏杀与误杀间持续调优。
参考与延伸阅读
- 国家网信办:《生成式人工智能服务管理暂行办法》(2023),https://www.cac.gov.cn/2023-07/13/c_1690898327029107.htm
- 国家网信办等四部门:《人工智能生成合成内容标识办法》(2025),https://www.cac.gov.cn/2025-03/14/c_1743654684782215.htm
- 全国信安标委:《网络安全标准实践指南——生成式人工智能服务内容标识方法》(2023),https://www.tc260.org.cn/upload/2023-08-25/1692961404507050376.pdf
- 国家网信办:《互联网信息服务深度合成管理规定》,https://www.cac.gov.cn/2022-11/25/c_16721349.htm
本文累计阅读 — 次