AI 红队实战案例:像攻击者一样找漏洞
把模型当作敌人去攻破,是发现 AI 系统隐患最有效的方式之一。本文用「像攻击者一样思考」的视角,拆解 AI 红队(red teaming)的方法论、典型攻击面,以及如何把发现反馈到防御与合规闭环。本站已有「大模型安全威胁全景」「提示注入」「AI 供应链安全」等专篇,本文侧重红队这一「主动找漏洞」的 discipline,点到为止,细节请对照阅读。
一、红队是什么,和渗透测试、安全评测的关系
红队源自军事推演与网络安全:一组人扮演对手,去攻击自家系统,目的是在真实攻击者之前暴露弱点。AI 红队把这套思路迁移到模型与 AI 系统上,由经过授权的测试者用对抗性输入去诱发模型的失效行为、漏洞或可被滥用的风险。
NIST 在 AI 风险管理框架(AI RMF)中,把这类「对抗性测试」放在 Measure 功能之下,概括为「在压力条件下对 AI 系统进行对抗性测试,以发现失效模式或漏洞」。这一定位强调的是「找问题」而非「证明系统按预期工作」。(NIST 具体出版号与措辞以官方原文为准,此处为二次来源汇总,待核实)
和传统渗透测试相比,AI 红队有三个本质不同:
维度 传统渗透测试 AI 红队
主要目标 网络、主机、应用代码 模型行为及其周边系统
入口 暴露的服务与凭据 文本、文件、模型读取的工具调用
失效信号 本应拒绝的访问被放行 缺陷、不期望的行为、被滥用的风险
所需技能 针对软件栈的漏洞利用 通常无需计算梯度即可攻破
何时结束 范围关闭、缺陷被修复 加固 AI 的工作永无终点
第一,模型是非确定性的:同一句提示在不同次运行可能得到不同结果,传统「稳定可复现」的 pass/fail 标准不再适用。第二,攻击面随能力扩张:一个聊天助手、接上检索系统、再接上邮件与自主 agent,每一层都新增攻击面(例如检索增强生成被投毒、agent 权限被提升、工具被滥用)。第三,漏洞不只在代码里,也在「模型如何理解语言、训练数据如何构成、边缘与对抗输入下如何反应」之中。
红队与安全评测(评测)的关系可以这样理解:评测多为「在既定指标上衡量能力/安全性」,红队则是「主动扮演对手去突破边界」。二者互补——红队发现的失效模式,会沉淀为评测用例与防御规则。
二、典型攻击面案例(只讲思路与防御,不提供可用 payload)
下面按攻击面逐类拆解。遵循安全responsible disclosure原则,本文绝不给出可直接滥用的完整模板,只说明攻击者的思路与对应的防御方向。
2.1 提示注入套取系统提示
思路:系统提示(system prompt)往往承载了模型的角色设定、隐藏规则与敏感上下文。攻击者把恶意指令夹带在正常对话中,利用模型「指令优先于上下文」的倾向,诱导其复述系统提示或泄露内部设定。它分为两类:直接注入(用户输入中直接夹带指令)与间接注入(模型读取的网页、邮件、检索文档里藏有指令,驱动模型执行非预期操作)。
防御呼应:输入与输出职责隔离、对系统提示做保密与完整性校验;详细区分参见本站「prompt-injection」专篇。
2.2 越狱模板(DAN 类思路)
思路:越狱的核心是「用叙事框架削弱模型对自身限制的感知」。代表性思路如 DAN(Do Anything Now)一类,典型手法包括:角色扮演(让模型扮演一个声称不受限制的虚拟人格)、虚构情景(「假设在一个没有规则的剧本里」)、规则覆盖(声称进入开发者模式或测试模式)。其共同点不是某条固定咒语,而是构造一个「安全策略不应生效」的语境。
防御:在训练与对齐阶段强化拒绝策略、在系统提示中固化边界、在输出侧部署安全分类器与越狱行为模式检测。注意越狱技术会快速演化,防御需持续回归测试。
2.3 借工具调用外发数据
思路:当模型具备调用工具(HTTP 请求、数据库查询、邮件发送、MCP 等)的权限时,攻击者可借提示注入让模型把敏感数据作为工具参数发往外部地址,或驱动 agent 执行非预期动作。这对应 OWASP LLM Top 10 中的 LLM08 过度代理(Excessive Agency)与 LLM07 不安全插件设计。
防御:工具权限最小化、涉及敏感或外部的动作加入人工确认、对工具输入输出做审计、对外部调用设置地址白名单与内容审查。插件与组件来源管控参见本站「ai-supply-chain-security」。
2.4 训练数据提取与模型萃取
思路:通过大量针对性查询,诱导模型复述其训练数据中的敏感片段(如个人信息、私密文本),即成员推断/数据提取;或通过对 API 的高频查询,重建模型的近似能力(模型萃取)。前者对应 OWASP LLM06 敏感信息泄漏,后者对应 LLM10 模型窃取,也属于 NIST 对抗机器学习分类中的「提取」类攻击。
防御:训练数据脱敏、采用差分隐私训练、输出侧做记忆检测与过滤、对查询频率与异常模式做监控。数据隐私细节参见本站「data-privacy-ai」。
2.5 偏见诱导
思路:攻击者用连续提问框架(例如先植入刻板印象前提,再要求模型做判断或生成内容),诱导模型产出带偏见或不公平的输出,从而暴露模型在公平性上的失效模式。这类危害不一定「越狱」,但会损害可信度与合规。
防御:把「公平性失效」明确列入威胁建模范围、用偏见评测基准做系统化测试、在输出侧加入公平性校验。相关方法参见本站「ai-bias-fairness」。
三、红队方法论:从威胁建模到防御闭环
一套可复用的红队流程可以拆成四步,并形成紫色协同(purple teaming)的闭环:
威胁建模 到 构造测试用例 到 记录与复现 到 反馈给防御(蓝队加固后回归测试)
威胁建模:先明确系统能做什么、部署在什么场景、要防护哪些危害类别。可参考 NIST 生成式 AI 的十二类风险与 OWASP LLM Top 10,把「要找什么」写成清单。
构造测试用例:采用「人工探测 + 自动化」组合。人工负责语义巧妙的对抗话术;自动化可用模糊测试(fuzzing)批量生成变体,或借助安全分类器作为判分器来迭代优化对抗输入。需注意对抗样本的「可迁移性」——在某模型上成立的发现,对另一模型只是线索而非定论。
记录与复现:NIST 建议记录给标注员与红队员的指令,因为「被要求找什么」直接决定能找到什么。每次发现都应包含:输入内容、运行环境、模型版本、复现步骤、危害评级。
反馈给防御:形成修复清单交给蓝队,加固后做回归测试。紫色协同让红队与蓝队并行工作,缩短「攻击到防御」的反馈环。需清醒认识:加固 AI 的工作永无终点,一次通过不代表长期安全。
可作方法论参考的公开资源(仅参考思路,不提供可用 payload)
- JailbreakBench(已核验):开源鲁棒性基准,组件含 JBB-Behaviors 数据集(100 条有害行为 + 100 条良性行为)、对抗提示工件仓库、标准化评估框架(含明确威胁模型、系统提示、评分函数)与公开排行榜;由宾夕法尼亚大学、苏黎世联邦理工学院、洛桑联邦理工学院、Sony AI 等团队提出,论文为 arXiv:2404.01318。可用于对照自家模型的越狱鲁棒性。(其被 NeurIPS 2024 Datasets and Benchmarks Track 接收一说,据作者主页提及,待核实)
- OWASP LLM Top 10(已核验):风险清单(2023 v1.1 已核验;2026 版为当前最新),红队可按条目设计场景,例如 LLM01 提示注入、LLM05 供应链、LLM08 过度代理。
- MITRE ATLAS(待核实):面向 AI 系统的威胁战术与技术分类,可用来结构化测试场景。
- 其他公开安全评测基准(待核实):如 Do-Not-Answer、HarmBench 等,用于安全策略越狱评测,仅作研究参考,不应作为直接攻击脚本来源。
四、防御对应:与站内专篇呼应
把第二部分的攻击面映射到防御与本站内容,形成一张对应表:
攻击面 防御方向 站内呼应
提示注入 指令隔离、输入清洗、输出校验 prompt-injection
越狱 对齐训练、安全分类器、越狱检测 提示安全护栏
工具滥用/外发数据 最小权限、人工确认、调用审计 ai-supply-chain-security
训练数据提取 训练脱敏、差分隐私、记忆过滤 data-privacy-ai
偏见诱导 偏见基准、输出公平性校验 ai-bias-fairness
其中的「提示安全护栏」可理解为分层防线:输入侧护栏做注入检测与意图识别,输出侧护栏做安全分类、拒绝策略与内容过滤。护栏不是单点开关,而应与红队发现持续联动——红队每攻破一次,护栏就补一层。供应链层面的组件与插件可信来源管控,则交给「ai-supply-chain-security」专篇覆盖。
五、合规边界:授权内行动,避免真实伤害
红队的价值在于「在受控环境中暴露问题」,一旦越界就变成真实的攻击。请务必守住以下边界:
授权范围:红队必须在书面授权与明确范围内进行;禁止对未授权的第三方系统做测试。要分清「经授权的红队演练」与「私自越狱或对外滥用」——后者既违规也可能违法。
避免真实伤害:不在公开渠道发布可直接滥用的完整 payload;发现漏洞走负责任披露(私下报送厂商并给修复窗口);评测所用数据应脱敏,避免涉及真实个人信息。
政策与法律:美国 2023 年行政令要求 NIST 制定前沿模型红队测试指南;欧盟 AI 法案要求具备系统性风险的通用模型进行对抗测试并记录(具体条款以官方文本为准,待核实)。企业侧应把红队纳入 AI 治理,明确谁有权授权、谁来执行、发现如何归档。
小结
AI 红队是「像攻击者一样思考」的主动安全 discipline:它在非确定性、攻击面不断扩张的 AI 系统上,用对抗性输入去暴露失效模式与滥用风险。典型攻击面覆盖提示注入、越狱、工具滥用外发数据、训练数据提取与偏见诱导;一套方法论可归纳为「威胁建模 到 构造用例 到 记录复现 到 反馈防御」的闭环,并借助 JailbreakBench、OWASP LLM Top 10 等公开资源校准思路。最终,红队发现要落到提示安全护栏与本站「prompt-injection」「ai-supply-chain-security」等防御专篇,并在授权与负责任披露的范围内进行,才能把「攻破」转化为「加固」。
参考与延伸阅读
- NIST AI Risk Management Framework(AI RMF):将对抗性测试置于 Measure 功能,定义为压力条件下发现 AI 失效模式或漏洞。来源:NIST 官方文件(经二次来源汇总,具体出版号待核实)。
- NIST AI 600-1 Generative AI Profile(2024 年 7 月):列出十二类生成式 AI 风险。来源:NIST(具体编号与年份待核实)。
- OWASP LLM Top 10:LLM01 提示注入、LLM05 供应链漏洞、LLM08 过度代理等。来源:OWASP 官网(2023 v1.1 已核验;2026 版为当前最新,已核验)。
- JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models(arXiv:2404.01318,作者来自 UPenn/ETH Zurich/EPFL/Sony AI):含 JBB-Behaviors(100 有害 + 100 良性行为)、对抗提示工件仓库、标准化评估框架与排行榜。来源:arXiv 原文(已核验);NeurIPS 2024 Datasets and Benchmarks Track 接收一说据作者主页(待核实)。
- MITRE ATLAS(面向 AI 系统的威胁分类)。来源:MITRE(待核实)。
- DEF CON 31 Generative Red Team Challenge(2023 年,公开报道约 2244 名参与者、8 个模型、17000+ 对话)。来源:Humane Intelligence 公开总结(待核实)。
- 站内延伸:prompt-injection、ai-supply-chain-security、提示安全护栏、data-privacy-ai、ai-bias-fairness、adversarial-examples、llm-security。