失败模式:枚举与预案
失败模式(failure modes)枚举指系统地列出 AI 系统可能以哪些方式出错或作恶,并为每种情形准备应对预案。它把「未知的风险」尽量变成「已知且可应对的清单」,是安全工程里失效模式与影响分析(FMEA)思路在 AI 上的延伸。
是什么
可沿维度枚举:输出质量(幻觉、偏见)、安全(泄露、越狱)、执行(误调用工具、过度代理)、外部(提示注入、依赖故障)。MIT 的 AI Risk Repository 把已公开的 AI 风险做了系统分类,可作为枚举起点。
失败模式维度:
输出层 幻觉、偏见、有毒内容
安全层 数据泄露、越狱、后门
执行层 工具误用、权限越界
外部层 提示注入、供应链污染
为什么重要
不枚举就无从防御。许多事故源于团队只盯着准确率,忽略了模型可能被诱导外发邮件、泄露隐私等「非预期用途」。枚举让防护覆盖到尾部风险。
怎么做
用风险分类框架做头脑风暴式枚举;为每条标注严重度、发生概率与现有缓解;对高分项写明确预案(谁响应、如何止血、如何复盘);把清单纳入上线评审与迭代回顾。
注意点
清单会过时,新攻击手法不断出现。应定期用红队结果与威胁情报更新,而非一次写定便搁置。
小结
失败模式枚举把未知风险显性化,并配套预案与责任人。它应随红队与威胁情报持续更新,是安全运营的日常动作。
参考与延伸阅读
- MIT AI Risk Repository(AI 风险系统分类)。待核实。https://airiskrepository.com/
- OWASP LLM Top 10(失败模式类别参考)。已核验。https://owasp.org/www-project-top-10-for-large-language-model-applications/
本文累计阅读 — 次