大模型安全威胁全景:从越狱到数据泄漏

大模型已经从封闭的聊天窗口走向生产系统:它读取用户上传的文档、调用内部 API、操作数据库,甚至驱动具备自主行动能力的 agent。这种「自然语言即接口」的形态让传统的安全边界被重新定义。本文从 OWASP LLM Top 10 的视角,系统梳理大模型应用上线后面临的主要威胁,并给出可落地的工程防线。文中与本站「prompt-injection」「adversarial-examples」两篇互补,点到为止,不再展开细节。

为什么大模型是新型攻击面

传统软件由确定性的代码逻辑构成,攻击者需要找到具体的代码缺陷。大模型的攻击面则来自它的「形态」本身:

  • 自然语言接口:用户输入不再是结构化参数,而是可以自由表达的指令,模型对指令的「服从」难以用白名单约束。
  • 工具调用:模型可以触发函数、HTTP 请求、数据库查询,把语言变成了「可执行动作」。
  • 记忆与上下文:会话历史、检索增强生成(RAG)带回的外部文档,都成为可被污染的输入。
  • 外部系统连接:插件、MCP、企业系统对接让模型从「说话的人」变成「动手的人」。

这意味着,一次成功的攻击往往不需要破解加密,只需要「说服」模型。这正是大模型安全的特殊之处。

OWASP LLM Top 10 视角的主要风险

OWASP 维护的 LLM Top 10 是目前最广泛引用的风险清单。以下条目编号依据已核验的 2023 v1.1 发布版(官方已推出 2026 版,具体编号以最新发布为准,详见文末参考):

LLM01  Prompt Injection            提示注入:通过构造输入操纵模型行为
LLM02  Insecure Output Handling    不当输出处理:未校验模型输出引发下游漏洞
LLM03  Training Data Poisoning     训练数据投毒:污染数据影响模型行为
LLM04  Model Denial of Service     模型拒绝服务:资源耗尽导致服务中断
LLM05  Supply Chain Vulnerabilities 供应链漏洞:被投毒的包、模型或数据集
LLM06  Sensitive Information Disclosure 敏感信息泄漏:输出中泄露机密
LLM07  Insecure Plugin Design      不安全插件设计:插件权限与输入校验缺失
LLM08  Excessive Agency            过度代理:模型获得超出预期的自主行动权
LLM09  Overreliance                过度依赖:盲目信任模型输出导致误判
LLM10  Model Theft                 模型窃取:专有模型被 unauthorized 复制

其中与安全威胁最直接相关的有四类:提示注入(LLM01)、敏感信息泄漏(LLM06)、供应链(LLM05,含被投毒的包与模型)、过度代理(LLM08,即 agent 权限过大)。训练数据投毒(LLM03)与不当输出(LLM02,涉及合规)则分别作用于模型生命周期的两端。

提示注入与越狱

提示注入是指攻击者把恶意指令夹带在正常输入中,诱导模型忽略原本的系统设定。越狱则是通过角色扮演、编码混淆、 payload 拆解等方式突破模型的安全护栏。两者本质都是「让模型执行设计者不希望它执行的指令」。

间接提示注入尤其危险:当模型读取网页、邮件或检索到的文档时,第三方内容中的隐藏指令可能驱动模型执行非预期操作。本站「prompt-injection」一篇详述了直接注入与间接注入的区分,「adversarial-examples」一篇则覆盖了针对模型鲁棒性的对抗样本。本文不再重复,读者可对照阅读。

数据泄漏路径

数据泄漏是大模型上线后最高频的事故来源,常见路径有三:

  • 系统提示泄露:系统提示中往往包含业务规则、内部工具说明甚至密钥片段,攻击者可通过套话诱使模型原样吐出。
  • 训练数据记忆:模型可能逐字复现训练语料中的个人隐私、代码或商业机密,尤其在罕见样本上更易发生。
  • 日志与第三方 API 回传:为做质量评估而记录的对话、发送给外部推理服务的请求体,都可能成为新的泄漏面。

防护上需要明确定义「哪些信息允许出现在输出中」,并对日志、评估数据与对外调用做最小化与脱敏处理。

Agent 场景放大风险

当模型从「回答者」升级为「执行者」,风险被显著放大。一个具备发请求、读写文件、运行命令能力的 agent,一旦被提示注入劫持,造成的后果等价于账户被接管。核心原则是最小权限与隔离:

  • 给 agent 的令牌只授予完成任务所必需的最小权限,禁止长期高权限凭证。
  • 工具调用在沙箱中执行,限制网络可达范围与文件系统边界。
  • 对「不可逆动作」(发消息、付款、删除)强制人类确认,即人类在环(human-in-the-loop)。

工程防线

把上述风险落到工程实践,可归纳为七道防线:

1. 输入过滤:对用户输入做注入检测、敏感词与越狱模式识别
2. 权限隔离:模型令牌最小权限,按任务动态下发短期凭证
3. 沙箱化工具调用:工具在受限环境中执行,限制网络与文件系统
4. 输出过滤:对模型输出做机密识别、注入回收与合规校验
5. 人类在环:不可逆动作需人工确认,关键决策留审计痕迹
6. 来源审查:审查模型权重、依赖包与数据集的来源与签名
7. 红队测试:周期性对抗演练,呼应 ai-safety 系列其他篇章

这七道防线并非孤立。例如供应链审查(第 6 条)阻断了被投毒的模型与包进入系统,而红队测试(第 7 条)则检验前面六条是否真正生效。安全是一个持续过程,而非一次性交付。

小结

大模型安全威胁的核心,在于模型以自然语言为接口、以工具调用为手脚,传统基于边界的防御不足以覆盖。OWASP LLM Top 10 提供了清晰的风险地图:提示注入、敏感信息泄漏、供应链与过度代理是最需警惕的四类。数据泄漏源于系统提示、训练记忆与日志外传,agent 场景则把语言风险放大为行动风险。工程上应以输入过滤、权限隔离、沙箱化、输出过滤、人类在环、来源审查与红队测试构成纵深防御。

参考与延伸阅读

本文累计阅读