后门攻击:hidden 触发
后门攻击指攻击者通过数据投毒或训练过程篡改,使模型在输入中混入特定「触发器」时输出攻击者预设的错误结果,而在正常输入下表现完全正常。因为触发器往往隐藏且罕见,这种风险在模型供应链(第三方预训练权重、外包标注数据)中尤其难以发现。
是什么
触发器可以是一张贴纸、特定像素图案,或文本里的一个特殊短语。Gu 等人在 2017 年的 BadNets 研究中,把带水印的图案嵌入交通标志训练集,模型在正常标志上识别良好,却会把带有该水印的标志一律误判为「限速」,展示了后门的可行性与隐蔽性。
正常输入:停车标志 -> 模型输出「停车」
带触发器:停车标志 + 隐藏图案 -> 模型输出「限速」(攻击者预设)
为什么危险
后门在训练或数据准备阶段植入,模型提供方与使用者都难以察觉。随着越来越多的团队直接下载并使用开源或第三方模型,供应链一旦被污染,影响范围会被成倍放大。
怎么防
检测手段包括在受控样本上扫描可疑触发、做神经元激活分析,以及用差分测试对比模型行为。预防上应固定训练数据来源、对第三方权重做完整性校验,并在上线前用对抗样本与触发探测集回归测试。
注意点
后门与对抗样本不同:对抗样本需要逐条构造扰动,后门则只在触发器出现时生效。排查时应把两者纳入不同的测试用例。
小结
后门攻击通过隐藏触发器让模型在特定条件下叛变,且极具隐蔽性。降低风险需要把控数据与模型来源、做完整性校验,并以触发探测集做上线前审查。
参考与延伸阅读
- Gu 等「BadNets: Identifying Vulnerabilities in the Machine Learning Model Supply Chain」(2017)。已核验。https://arxiv.org/abs/1708.06733
- NIST AI Risk Management Framework(供应链与数据治理章节)。已核验。https://www.nist.gov/itl/ai-risk-management-framework
本文累计阅读 — 次