大模型安全威胁全景:从越狱到数据泄漏
大模型已经从封闭的聊天窗口走向生产系统:它读取用户上传的文档、调用内部 API、操作数据库,甚至驱动具备自主行动能力的 agent。这种「自然语言即接口」的形态让传统的安全边界被重新定义。本文从 OWASP LLM Top 10 的视角,系统梳理大模型应用上线后面临的主要威胁,并给出可落地的工程防线。文中与本站「prompt-injection」「adversarial-examples」两篇互补,点到为止,不再展开细节。
为什么大模型是新型攻击面
传统软件由确定性的代码逻辑构成,攻击者需要找到具体的代码缺陷。大模型的攻击面则来自它的「形态」本身:
- 自然语言接口:用户输入不再是结构化参数,而是可以自由表达的指令,模型对指令的「服从」难以用白名单约束。
- 工具调用:模型可以触发函数、HTTP 请求、数据库查询,把语言变成了「可执行动作」。
- 记忆与上下文:会话历史、检索增强生成(RAG)带回的外部文档,都成为可被污染的输入。
- 外部系统连接:插件、MCP、企业系统对接让模型从「说话的人」变成「动手的人」。
这意味着,一次成功的攻击往往不需要破解加密,只需要「说服」模型。这正是大模型安全的特殊之处。
OWASP LLM Top 10 视角的主要风险
OWASP 维护的 LLM Top 10 是目前最广泛引用的风险清单。以下条目编号依据已核验的 2023 v1.1 发布版(官方已推出 2026 版,具体编号以最新发布为准,详见文末参考):
LLM01 Prompt Injection 提示注入:通过构造输入操纵模型行为
LLM02 Insecure Output Handling 不当输出处理:未校验模型输出引发下游漏洞
LLM03 Training Data Poisoning 训练数据投毒:污染数据影响模型行为
LLM04 Model Denial of Service 模型拒绝服务:资源耗尽导致服务中断
LLM05 Supply Chain Vulnerabilities 供应链漏洞:被投毒的包、模型或数据集
LLM06 Sensitive Information Disclosure 敏感信息泄漏:输出中泄露机密
LLM07 Insecure Plugin Design 不安全插件设计:插件权限与输入校验缺失
LLM08 Excessive Agency 过度代理:模型获得超出预期的自主行动权
LLM09 Overreliance 过度依赖:盲目信任模型输出导致误判
LLM10 Model Theft 模型窃取:专有模型被 unauthorized 复制
其中与安全威胁最直接相关的有四类:提示注入(LLM01)、敏感信息泄漏(LLM06)、供应链(LLM05,含被投毒的包与模型)、过度代理(LLM08,即 agent 权限过大)。训练数据投毒(LLM03)与不当输出(LLM02,涉及合规)则分别作用于模型生命周期的两端。
提示注入与越狱
提示注入是指攻击者把恶意指令夹带在正常输入中,诱导模型忽略原本的系统设定。越狱则是通过角色扮演、编码混淆、 payload 拆解等方式突破模型的安全护栏。两者本质都是「让模型执行设计者不希望它执行的指令」。
间接提示注入尤其危险:当模型读取网页、邮件或检索到的文档时,第三方内容中的隐藏指令可能驱动模型执行非预期操作。本站「prompt-injection」一篇详述了直接注入与间接注入的区分,「adversarial-examples」一篇则覆盖了针对模型鲁棒性的对抗样本。本文不再重复,读者可对照阅读。
数据泄漏路径
数据泄漏是大模型上线后最高频的事故来源,常见路径有三:
- 系统提示泄露:系统提示中往往包含业务规则、内部工具说明甚至密钥片段,攻击者可通过套话诱使模型原样吐出。
- 训练数据记忆:模型可能逐字复现训练语料中的个人隐私、代码或商业机密,尤其在罕见样本上更易发生。
- 日志与第三方 API 回传:为做质量评估而记录的对话、发送给外部推理服务的请求体,都可能成为新的泄漏面。
防护上需要明确定义「哪些信息允许出现在输出中」,并对日志、评估数据与对外调用做最小化与脱敏处理。
Agent 场景放大风险
当模型从「回答者」升级为「执行者」,风险被显著放大。一个具备发请求、读写文件、运行命令能力的 agent,一旦被提示注入劫持,造成的后果等价于账户被接管。核心原则是最小权限与隔离:
- 给 agent 的令牌只授予完成任务所必需的最小权限,禁止长期高权限凭证。
- 工具调用在沙箱中执行,限制网络可达范围与文件系统边界。
- 对「不可逆动作」(发消息、付款、删除)强制人类确认,即人类在环(human-in-the-loop)。
工程防线
把上述风险落到工程实践,可归纳为七道防线:
1. 输入过滤:对用户输入做注入检测、敏感词与越狱模式识别
2. 权限隔离:模型令牌最小权限,按任务动态下发短期凭证
3. 沙箱化工具调用:工具在受限环境中执行,限制网络与文件系统
4. 输出过滤:对模型输出做机密识别、注入回收与合规校验
5. 人类在环:不可逆动作需人工确认,关键决策留审计痕迹
6. 来源审查:审查模型权重、依赖包与数据集的来源与签名
7. 红队测试:周期性对抗演练,呼应 ai-safety 系列其他篇章
这七道防线并非孤立。例如供应链审查(第 6 条)阻断了被投毒的模型与包进入系统,而红队测试(第 7 条)则检验前面六条是否真正生效。安全是一个持续过程,而非一次性交付。
小结
大模型安全威胁的核心,在于模型以自然语言为接口、以工具调用为手脚,传统基于边界的防御不足以覆盖。OWASP LLM Top 10 提供了清晰的风险地图:提示注入、敏感信息泄漏、供应链与过度代理是最需警惕的四类。数据泄漏源于系统提示、训练记忆与日志外传,agent 场景则把语言风险放大为行动风险。工程上应以输入过滤、权限隔离、沙箱化、输出过滤、人类在环、来源审查与红队测试构成纵深防御。
参考与延伸阅读
- OWASP Top 10 for Large Language Model Applications(官方项目页,含 v1.1 与 2026 版入口):https://owasp.org/www-project-top-10-for-large-language-model-applications/ 已核验(v1.1 条目编号 LLM01 至 LLM10 已确认;2026 版页面存在但本次受浏览器校验限制未能抓取具体编号,以官方最新发布为准)
- OWASP GenAI LLM Top 10 2026(最新版):https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/ 待核实(编号以官方发布为准)
- MITRE ATLAS:人工智能系统对抗威胁全景(含 LLM Prompt Injection、LLM Jailbreak、Training Data Poisoning 等技术):https://atlas.mitre.org/ 已核验
- MITRE ATLAS 威胁矩阵:https://atlas.mitre.org/matrices/ATLAS-matrix 已核验
- 本站延伸:prompt-injection(提示注入专篇)、adversarial-examples(对抗样本专篇)、data-privacy-ai(数据隐私)、model-watermark(模型水印)