失败模式:枚举与预案

失败模式(failure modes)枚举指系统地列出 AI 系统可能以哪些方式出错或作恶,并为每种情形准备应对预案。它把「未知的风险」尽量变成「已知且可应对的清单」,是安全工程里失效模式与影响分析(FMEA)思路在 AI 上的延伸。

是什么

可沿维度枚举:输出质量(幻觉、偏见)、安全(泄露、越狱)、执行(误调用工具、过度代理)、外部(提示注入、依赖故障)。MIT 的 AI Risk Repository 把已公开的 AI 风险做了系统分类,可作为枚举起点。

失败模式维度:
输出层  幻觉、偏见、有毒内容
安全层  数据泄露、越狱、后门
执行层  工具误用、权限越界
外部层  提示注入、供应链污染

为什么重要

不枚举就无从防御。许多事故源于团队只盯着准确率,忽略了模型可能被诱导外发邮件、泄露隐私等「非预期用途」。枚举让防护覆盖到尾部风险。

怎么做

用风险分类框架做头脑风暴式枚举;为每条标注严重度、发生概率与现有缓解;对高分项写明确预案(谁响应、如何止血、如何复盘);把清单纳入上线评审与迭代回顾。

注意点

清单会过时,新攻击手法不断出现。应定期用红队结果与威胁情报更新,而非一次写定便搁置。

小结

失败模式枚举把未知风险显性化,并配套预案与责任人。它应随红队与威胁情报持续更新,是安全运营的日常动作。

参考与延伸阅读

本文累计阅读