AI 模型水印:给生成内容打上隐形标识

随着大语言模型与生成式图像、音视频模型走向普及,区分「人写」与「机写」、追溯一段内容的来历,正在从学术问题变成社会治理问题。AI 模型水印(Model Watermarking)正是应对这一挑战的一类技术:它试图在模型生成内容的同时,悄悄嵌入人眼难以察觉、但可被算法检测的信号,从而让内容「自带身份证」。

为什么需要水印

水印的需求来自四个相互交织的压力。

第一,深度伪造(deepfake)与合成媒体让「眼见不再为实」。一段逼真的换脸视频或克隆语音,可能被用于诈骗、诽谤或操纵舆论,社会需要一种机制来识别内容的合成来源。

第二,学术诚信受到冲击。学生用大模型代写论文、程序员用模型生成代码提交作业,让教育机构难以判断作品的真实作者。可检测的水印能为「是否由模型生成」提供概率性证据。

第三,内容溯源与确权。当模型参与创作,厘清「人贡献了什么、模型贡献了什么」对版权归属、责任划分都很关键。水印或出处凭证可以记录生成链路。

第四,监管合规。越来越多法域要求 AI 生成内容进行标记或披露,技术水印正是满足这类合规要求的可行实现路径之一。

生成时水印:soft watermark 的原理

生成时水印(generation-time watermark,也称 soft watermark)在模型「产出内容的那一刻」嵌入信号,因此不需要事后处理。这一类方法的代表是 Kirchenbauer 等人在 2023 年发表的论文 A Watermark for Large Language Models(arXiv 2301.10226,发表于 ICML 2023)。

其核心思想非常巧妙:在每一步采样出下一个词之前,先用一个随上下文变化的伪随机过程,把整个词表(vocabulary)划分成「绿色列表」(green list)和「红色列表」(red list)两部分。然后,在对数概率(logits)阶段,给绿色列表里的词统一加上一个正向偏置 δ,使模型在采样时略微更倾向于选用绿色词。由于绿色列表是随上文哈希随机决定的,单个词的选择看似自然,但整体上绿色词的出现频率会被悄悄地「抬高」。

关键在于,这种偏置被设计得足够小,人读起来几乎察觉不到质量下降,却足以在统计上留下痕迹。这就是「soft」的含义:它不是硬性地强制只输出绿词,而是用概率偏置来温和地引导分布。

绿色列表偏置的直觉示意

下面用一段伪代码展示每一步生成时的偏置逻辑(这是 Kirchenbauer 式水印的简化直觉,并非完整实现):

# 生成第 t 个词之前(Kirchenbauer 式 soft watermark 的直觉示意)
# 1. 用上一个词作种子,伪随机选出一半「绿色」词表
rng_seed   = hash(context_token[t-1])
green_list = sample(vocabulary, fraction=0.5, seed=rng_seed)

# 2. 给绿色词整体加一个正向偏置 delta,使模型更偏好绿词
for token in green_list:
    logits[token] += delta      # delta > 0,抬高绿词被选中的概率

# 3. 按偏置后的分布采样出当前词
next_token = sample(softmax(logits / temperature))

# 检测阶段:统计文本中绿词占比是否显著高于 50%
# 若显著高于,则拒绝「该文本无此水印」的原假设
observed_green_ratio = count_green_tokens(text) / total_tokens

注意,绿色列表的划分依赖一个只有水印方掌握的随机种子或密钥(在 Kirchenbauer 原文中通过哈希上下文实现),这让没有密钥的人难以伪造或移除水印,也便于持有密钥的一方做检测。

如何检测:统计检验

生成时水印的检测是「被动且轻量」的:给定一段文本,检测器不需要调用模型 API,也不需要模型权重,只需用相同的密钥重建每一步的绿色列表,然后统计文本里绿词所占比例。

由于无水印的正常文本中绿词占比应接近 50%(因为绿色列表是随机的一半词表),而带水印的文本绿词占比会系统性偏高。检测算法因此对「绿词数量」做一次统计检验,常用的是 z 检验(z-test),并给出可解释的 p 值:p 值越小,说明「这段文本是无水印随机生成」这一原假设越不可信,也就越有把握判定它带有该水印。

这种检测的有用性随文本长度提升:文本越长,统计信号越强,检测的把握越高;极短文本则可能因样本太少而难以判断。

合成水印与出处凭证:C2PA

生成时水印解决的是「统计上可检测」的问题,但它面对改写、翻译时很脆弱。另一类思路不依赖文本统计,而是把内容的来历直接写进数据本身,这就是以 C2PA(Coalition for Content Provenance and Authenticity,内容来源与真实性联盟)为代表的内容出处凭证。

C2PA 是一套开放技术标准,它为数字内容附加被称为 Content Credentials 的元数据,记录内容的生成工具、生成时间、所用模型或参数、以及编辑历史等信息。C2PA 的运作方式类似给内容贴一张「营养标签」:无论内容流转到哪里,只要读取到这份元数据,就能追溯它的来源与变更链路。由于元数据与内容绑定,且可配合签名防止篡改,它比纯统计水印更难被轻易剥离(尽管仍可能被重新导出或截图破坏)。

两类方法互为补充:生成时水印适合在文本内容内部做「隐形标记」,对读者无感;C2PA 这类出处凭证适合在文件层面做「显式溯源」,跨模态、跨平台地记录来历。实践中二者常被结合使用。

局限与挑战

水印并非万能,它面临若干真实而棘手的局限。

一是抗攻击能力有限。对带水印的文本做翻译、大幅改写、摘要,或在图像上叠加滤镜、裁剪,都可能稀释甚至抹去水印信号。水印与内容绑定得越紧,越容易被针对性去除;绑得越松,又越容易在常规编辑中丢失。

二是开放模型的去水印问题。对于权重公开、可被本地部署的开源模型,攻击者可以修改采样逻辑、关闭偏置,或用另一个模型重写输出,从而绕开水印。水印对封闭的商用 API 更有效,对完全开放的生态约束力较弱。

三是误报与隐私的权衡。统计检测总有漏报和误报:把人写文本错判为带水印(误报),或把带水印文本判为无(漏报),都可能带来后果。此外,强水印若与特定用户密钥绑定,还可能被用于追踪个体使用者,引发隐私担忧。

政策趋势:EU AI Act 与各国要求

监管层面正在把「标记 AI 生成内容」从倡导变成义务。以欧盟《人工智能法案》(EU AI Act)为例,其第四章专门规定特定 AI 系统的透明度义务,其中 Article 50 直接涉及合成内容的标记:

  • 第 2 款要求,生成合成音频、图像、视频或文本的 AI 系统提供者,必须确保输出以机器可读格式被标记,并且可被检测为「人工生成或被操纵」。
  • 第 4 款进一步要求,生成或操纵构成深度伪造的图像、音频、视频的部署者,应当披露内容经过人工生成或操纵;以服务公众利益为目的发布 AI 生成文本时,也需披露其人工生成或操纵的性质。

这意味着,技术水印与出处凭证(如 C2PA)不再只是研究议题,而成为合规落地的工具。包括美国、中国在内的多个法域也在推进对 AI 生成内容的标识要求,总体方向是「披露来源、标注不确定性、便于检测」,但具体条款与生效时间各异,需以当地最新法规为准。

水印与检测器:主动与被动

值得澄清一个常见混淆:水印与检测器是两种互补而非替代的关系。

水印是「主动标记」:它在生成阶段就由模型嵌入信号,相当于内容出厂时自带标签。检测器(detector)是「被动识别」:它试图在不依赖嵌入信号的情况下,判断一段内容是否由 AI 生成,例如用分类器学习机写与人写的风格差异。前者更可靠、可追溯,但依赖生成方配合;后者适用范围更广,却更易被对抗样本欺骗。理想的内容治理方案,通常是二者并行。

小结

AI 模型水印通过在生成阶段嵌入人眼不可察、算法可检测的信号,为深度伪造识别、学术诚信、内容溯源与版权确权提供了技术抓手。以 Kirchenbauer 为代表的生成时水印用绿色列表偏置实现统计可检测的标记,C2PA 等出处凭证则在文件层面记录生成来历,二者互补。但水印易被改写与翻译削弱,对开放模型约束力有限,也存在误报与隐私权衡。随着 EU AI Act 等法规把标记义务法定化,水印正从研究走向合规基础设施,与被动检测器共同构成内容治理的两道防线。

参考与延伸阅读

  • Kirchenbauer, J., Geiping, J., Wen, Y., Katz, J., Miers, I., Goldstein, T. A Watermark for Large Language Models. arXiv:2301.10226,发表于 ICML 2023。(已核验:arXiv 摘要确认标题、作者、绿色列表偏置方法与统计检测思路)
  • C2PA 官方站点 c2pa.org:Coalition for Content Provenance and Authenticity 标准与 Content Credentials 元数据溯源机制。(已核验:官网说明 C2PA 为开放技术标准,记录内容来源、工具、时间等)
  • EU AI Act Article 50(Transparency Obligations for Providers and Deployers of Certain AI Systems),artificialintelligenceact.eu/article/50/。(已核验:第 2 款要求合成内容以机器可读格式标记并可检测为人工生成或操纵;第 4 款要求深度伪造披露。具体实施时间以官方文本与本地法规为准)
  • EU AI Act 高层面摘要 artificialintelligenceact.eu/high-level-summary/。(已核验:将相关义务归入有限风险系统的透明度义务与 GPAI 训练数据摘要公开)
  • 关于各国(如美国、中国)对 AI 生成内容标识的具体条款与生效时间,因法规更新频繁,本文未逐条引用,相关细节待核实,请以各法域最新官方文本为准。
本文累计阅读