后门攻击:hidden 触发

后门攻击指攻击者通过数据投毒或训练过程篡改,使模型在输入中混入特定「触发器」时输出攻击者预设的错误结果,而在正常输入下表现完全正常。因为触发器往往隐藏且罕见,这种风险在模型供应链(第三方预训练权重、外包标注数据)中尤其难以发现。

是什么

触发器可以是一张贴纸、特定像素图案,或文本里的一个特殊短语。Gu 等人在 2017 年的 BadNets 研究中,把带水印的图案嵌入交通标志训练集,模型在正常标志上识别良好,却会把带有该水印的标志一律误判为「限速」,展示了后门的可行性与隐蔽性。

正常输入:停车标志 -> 模型输出「停车」
带触发器:停车标志 + 隐藏图案 -> 模型输出「限速」(攻击者预设)

为什么危险

后门在训练或数据准备阶段植入,模型提供方与使用者都难以察觉。随着越来越多的团队直接下载并使用开源或第三方模型,供应链一旦被污染,影响范围会被成倍放大。

怎么防

检测手段包括在受控样本上扫描可疑触发、做神经元激活分析,以及用差分测试对比模型行为。预防上应固定训练数据来源、对第三方权重做完整性校验,并在上线前用对抗样本与触发探测集回归测试。

注意点

后门与对抗样本不同:对抗样本需要逐条构造扰动,后门则只在触发器出现时生效。排查时应把两者纳入不同的测试用例。

小结

后门攻击通过隐藏触发器让模型在特定条件下叛变,且极具隐蔽性。降低风险需要把控数据与模型来源、做完整性校验,并以触发探测集做上线前审查。

参考与延伸阅读

本文累计阅读