🛡️AI 安全与对齐
提示注入攻防、红队测试、安全评测与法规合规,构建可信可控的 AI 应用。
共 63 篇教程 · 6 个主题
攻击与红队
21 篇 安全评测:基准与红队 安全评测用基准量化模型风险,用红队主动找漏洞。本文讲清两者定位、常用方法与上线路径。 成员推断攻击:判断样本是否参与训练 讲清成员推断攻击的动机、思路与防护(差分隐私/正则),不含可滥用代码。 大模型安全威胁全景:从越狱到数据泄漏 大模型应用上线后面临提示注入、越狱、数据泄漏、供应链与 agent 滥用等多类威胁。本文梳理 OWASP LLM .top10 视角的主要风险与工程防线。 大模型红队测试与安全评测 介绍大模型安全评测体系:红队测试方法论、自动化评测基准(TruthfulQA、MMLU 安全子集、AdvBench 等),以及企业落地安全护栏(内容审核、输出过滤、人类在环)的设计思路。 大模型拒绝服务攻击:资源耗尽与防御 讲清针对 LLM 服务的资源耗尽类攻击(OWASP LLM04)成因与多层防御,不含可滥用 payload。 对抗鲁棒性:让模型扛住微小扰动 面向关注模型安全的工程师与研究者,讲解模型为何会在「人眼无法察觉」的微小扰动下误判,并系统梳理对抗训练、随机化、输入预处理等鲁棒性提升方法,以及鲁棒准确率与常见基准的评测思路。 对抗训练:提升模型鲁棒性 对抗训练在训练阶段主动注入经过微小扰动的对抗样本,逼模型在扰动下仍做对判断,从而提升鲁棒性。本文讲清对抗样本、训练做法、收益代价及其与数据增强的区别。 对抗样本:给模型看的微小扰动如何骗过它 在图像上叠加人眼不可察觉的扰动,就能让模型给出错误判断。对抗样本揭示了深度模型的脆弱性,也与大模型提示注入有相通之处。本文讲清原理、经典攻击与防御。 红队测试:攻破模型 红队测试通过主动攻击发现模型漏洞,是人工智能安全评估的关键手段。本文讲清红队是什么、为何必要,以及如何系统化开展测试。 后门攻击:hidden 触发 后门攻击在模型中植入隐蔽触发器,平时表现正常,遇到特定触发即按攻击者意图行动。本文讲清原理、供应链风险与检测方法。 模型萃取攻击:偷走模型能力 讲清模型萃取(用查询反复逼近原模型)的成因与防御(限频、水印、监控),属防御科普。 模型窃取:防御泄露 模型窃取通过大量查询复刻模型能力,带来知识产权与隐私风险。本文讲清窃取是什么、为何可行,以及限流、水印与监测等防御手段。 模型提取攻击与防御:保护模型知识产权与 API 安全 讲解模型提取攻击如何借查询接口复现模型能力,并给出限速、输出加噪、水印与异常检测等防御手段与权衡。 数据投毒:训练期攻击 数据投毒在训练数据里埋入恶意样本,使模型学到后门或偏见。本文讲清投毒是什么、为何难防,以及数据清洗与来源管控等缓解方法。 数据投毒防御:守住训练数据与供应链三道关卡 讲解数据投毒的攻击面与危害,从训练数据清洗、模型来源校验到供应链最小权限,给出可落地的纵深防御清单。 数据投毒检测:在训练前拦住恶意样本 系统讲解在训练前拦住恶意样本的「数据投毒检测」:用离群点检测、激活聚类、统计异常与数据溯源守住训练数据供应链的第一道防线。 提示注入攻击:原理、手法与防护 讲清提示注入的成因、典型手法(直接注入/间接注入)与多层防御,不含可滥用 payload。 提示注入与越狱攻防实战 深入讲解提示注入(Prompt Injection)与越狱(Jailbreak)的攻击原理、典型手法与防御策略:直接/间接注入、多语言与编码绕过、对抗后缀 GCG,以及输入过滤、权限隔离、沙箱化工具调用等工程防御。 越狱防御纵深:输入过滤、输出沙箱与围栏策略 系统讲解面向 LLM 应用的越狱防御:以「输入过滤、输出沙箱、架构围栏」三层纵深,把内容安全风险挡在请求抵达模型之前、拦在模型生成之后,并用人机回环与审计闭环兜底。 AI 红队实战案例:像攻击者一样找漏洞 讲解 AI 红队的方法论与典型攻击面案例,包括提示注入、越狱、工具滥用与数据提取,并对应到防御与合规边界。 LLM 红队测试:主动找模型漏洞 红队测试以对抗视角主动探测大模型的安全漏洞与失效模式,是上线前的重要防线。本文讲清它的目标、常见攻击类型与组织方式。
防御与鲁棒
6 篇 鲁棒性:抗扰动 鲁棒性衡量模型在输入扰动下是否保持稳定,对抗样本暴露其脆弱。本文讲清对抗样本、鲁棒训练与评测等防御要点。 权限最小化:Agent 安全 权限最小化要求 Agent 只拥有完成任务所必需的最低权限。本文讲清原理、与过度代理的关系,以及落地做法。 沙箱执行:隔离风险 沙箱在受限环境中运行不可信代码与工具调用,隔离故障与滥用。本文讲清原理、适用场景与配置要点。 AI 供应链安全:依赖、模型与数据三道关卡 讲解 AI 供应链在代码依赖、模型权重与训练数据三个环节的投毒风险,并给出锁定依赖、校验模型来源与最小权限的防护清单。 AI 与数据隐私:训练数据的风险与防护 模型可能「记住」敏感数据。本文从个人信息保护法讲起,梳理差分隐私、联邦学习、成员推断攻击等隐私防护技术与合规要点。 RAG 安全:检索增强系统的攻防 讲清 RAG 的独特风险(投毒/越权/注入)与加固思路,不含可滥用 payload。
幻觉与对齐
15 篇 大模型幻觉:成因、检测与缓解方法 系统讲解大语言模型产生幻觉的机理,对比忠实性幻觉与事实性幻觉,并给出检索增强、引用标注与一致性校验等可落地的缓解方案。 对齐技术深入:RLHF、DPO 与 Constitutional AI 系统讲解让大模型与人类意图对齐的主流方法:从基于人类反馈的强化学习到直接偏好优化与宪法式自我对齐,对比其流程与取舍。 风险评估:上线前审查 上线前的风险评估用结构化方法识别 AI 系统的危害与缓解措施。本文讲清流程、常用框架与审查清单。 幻觉安全:误信息风险 幻觉指模型生成看似合理却错误的内容,会带来误信息与信任风险。本文讲清幻觉成因、危害与检索增强与引用等缓解手段。 幻觉缓解:减少模型胡说 幻觉指模型生成看似合理却与事实或上下文不符的内容。本文梳理检索增强、事实性约束、自我校验与后处理等降低幻觉的主流手段及其局限。 可解释性:打开黑箱 可解释性研究模型内部如何得出答案,是安全与信任的基础。本文讲清内在与事后两类方法、机制可解释性及工程注意点。 可信 AI:原则与实践 可信 AI 以有效、安全、公平、透明、可问责为原则。本文讲清核心原则与可落地的工程实践。 人机协同:关键决策留人 人机协同要求在高影响决策上保留人类监督与否决权。本文讲清适用场景、监督模式与落地要点。 失败模式:枚举与预案 失败模式枚举系统可能出错的方式并预备应对方案。本文讲清分类框架、如何枚举与预案写法。 责任归属:谁为输出负责 责任归属明确 AI 出错时由哪一方担责,是合规与信任的基础。本文讲清提供方与使用方边界、法律原则与落地。 AI 安全风险全景:从幻觉到对齐 系统梳理大模型的主要安全风险:幻觉、偏见与歧视、隐私泄露、越狱与提示注入、滥用与深度伪造,以及「对齐」这一根本性问题;介绍 RLHF、Constitutional AI 等对齐技术谱系。 AI 安全事件响应:出事之后怎么办 讲清 AI 相关安全事件的响应流程(发现→定级→处置→复盘)。 AI 对齐:让目标一致 AI 对齐研究如何让模型的目标与人类真实意图一致,避免能力越强越偏离预期。本文讲清对齐是什么、为什么难,以及监督与可扩展对齐的基本方法。 AI 风险评估与治理体系:从 ISO 42001 到 EU AI Act 的落地实践 系统梳理 ISO/IEC 42001、NIST AI RMF 与 EU AI Act,帮助企业建立可落地的 AI 风险管理闭环。 AI 智能体安全:工具调用与自主行动的风险 面向构建与部署 LLM 智能体的工程师,系统讲解「工具滥用、命令执行、权限过大、提示注入跨工具传播、无限循环」等智能体特有风险面,以及「最小权限、工具白名单、人类确认、输入输出沙箱、审计日志」的防御原则。
合规与治理
13 篇 合成数据治理:安全、偏见与合规的边界 「用合成数据补足训练样本时,如何在隐私、偏见与版权之间守住治理边界?」 模型卡:安全披露 模型卡是以结构化方式披露模型用途、训练数据与已知局限的文档。本文讲清它是什么、为何有助于安全治理,以及如何落地。 偏见与公平:度量与缓解 模型会从数据继承社会偏见,公平性度量与缓解可降低歧视风险。本文讲清偏见来源、常用度量指标与去偏与审计方法。 偏见与公平:让模型更中立 模型偏见多源自训练数据与标注偏差,表现为不同群体间的表现差异。本文讲清偏见来源、衡量思路与常见缓解策略,并提示具体指标的核实必要性。 深度伪造立法与检测标准:当假脸遇上监管 梳理欧盟、美国与中国对深度伪造与 AI 生成内容的标识与披露监管动向,并关联水印与取证等技术检测标准。 审计日志:可追溯 审计日志记录 AI 的关键决策与操作,支撑事后追溯与责任认定。本文讲清记什么、怎么存与注意点。 AI 法规与合规:中国开发者的治理与落地指南 面向中国开发者的 AI 法规与合规入门,系统梳理欧盟 AI Act、中国《生成式人工智能服务管理暂行办法》与美国行政令的核心要求,并给出可执行的合规清单与实操建议。 AI 合规基础:监管与上线边界 AI 合规基础关注模型上线前需满足的法规、备案与风险评估要求,帮团队守住上线边界。本文讲清主要监管脉络、关键义务与落地清单。 AI 偏见与公平性:识别、度量与缓解方法 系统讲解机器学习中的偏见来源、公平性度量指标与缓解技术,帮助你构建更负责任、更少歧视的 AI 系统。 AI 审计:给模型与系统做体检 讲清 AI 审计的对象、流程与常见问题,帮助组织自证合规。 AI 治理:原则、流程与落地 讲清企业 AI 治理的框架(原则/职责/流程/审计)与落地要点。 EU AI Act:合规要点 EU AI Act 是全球首部全面的人工智能立法,按风险分级监管。本文梳理其风险分级、关键义务与上线前需要准备的合规动作。 GDPR 与 AI:数据合规 GDPR 的合法性、最小必要与主体权利条款,直接约束 AI 的训练数据与自动决策。本文讲清关键条款与落地动作。
隐私保护
3 篇内容安全与溯源
5 篇 内容安全与审核:AI 应用不可忽视的风控 生成内容可能违规、虚假或有害。本文从法规出发,讲清文本/图像审核维度、机审人审流水线,以及漏杀与误杀的权衡。 深度伪造与检测:看清 AI 生成的假脸与假声 系统讲解深度伪造(Deepfake)的生成原理、典型危害与检测技术,涵盖生物信号、水印与多模态取证,帮你建立辨别能力。 AI 模型水印:给生成内容打上隐形标识 在深度伪造与内容确权压力下,给 AI 生成内容嵌入可检测的水印成为治理手段。本文讲清生成时水印、合成水印 C2PA,以及它们的局限与政策背景。 AI 水印:溯源生成内容 AI 水印在生成内容中嵌入隐蔽标记,便于溯源与鉴别。本文讲清水印原理、主流方案与抗去除等工程现实。 AI 水印技术深入:给生成内容打上隐形标识 深入讲解生成时水印(KGW 绿列表法)、C2PA 来源元数据与开源水印框架,并分析其局限与对抗移除的现实挑战。
没有匹配的教程,换个关键词、难度或主题试试。