智能AI
morning
了解 LLM 水印对 AI 代理行为的影响
摘要
Recently, Anthropic announced that future Claude models would embed an invisible watermark in their output [1], [2], and subsequently disclosed that the watermark is based on Google DeepMind’s SynthID...
and
the
model
that
can
what
watermark
Text
for
this
2026-09-26
1 阅读
约5分钟阅读
nisosguy
字号:
最近,Anthropic 宣布未来的 Claude 模型将在其输出中嵌入不可见水印 [1]、[2],并随后透露该水印基于 Google DeepMind 的 SynthID-Text [2]、[3]。文本水印本身并不新鲜,但其部署现在具有监管意义。欧盟人工智能法案 [4] 第 50(2) 条要求生成合成文本的人工智能系统的提供者以机器可读的格式标记其输出,并在技术可行的情况下使用有效、可互操作、稳健和可靠的技术解决方案,使其可被检测为人工生成或操纵。水印是为来源而设计的,但 SynthID-Text 改变了模型生成每个下一个标记的过程。在模型级别,这可以改变安全行为,包括模型是否拒绝有害请求以及该拒绝是否在快速注入下成立。在代理级别,相同的采样令牌可以确定调用哪个工具以及向其传递哪些参数。即时注入将这两种设置联系起来,因为当模型也可以通过工具进行操作时,减弱的拒绝变得更加重要。因此,这种水印程序会影响模型所说的内容和代理的行为。我们将这种行为效应称为采样漂移。 这种漂移在实践中是否出现是一个经验问题。我们发现在模型拒绝行为和代理工具调用中都是如此。该效果取决于模型和键,并且当相反方向的变化取消时,可能会被总分数掩盖。因此,我们报告了净性能以及带水印和无水印运行之间的配对差异。此外,最后部分讨论了它对人工智能安全和保障的意义以及开发人员应该采取哪些措施。专为内容来源而构建,部署在代理内部 文本水印嵌入了一个信号,允许输出被识别为人工智能生成的。现有方法包括后处理方法和直接集成到 LLM 生成中的方法[8]。生成时方法包括 logits-biasing 方法 [5]、无失真键控采样 [6]、加密动机构造 [7] 和 SynthID-Text 的锦标赛采样 [3]。图 1 将此过程与普通采样进行了对比。我们使用 SynthID 的非失真配置,它保留了水印随机性期望中的原始令牌分布,而固定密钥下的各个代仍然可能不同 [3]。达萨特里等人。据报告,近 2000 万个 Gemini 回复中没有出现可测量的质量下降 [3]。图 1. 标准文本生成与水印文本生成。来自模型代币分布的普通生成样本。生成水印增加了随机种子生成器、采样算法和评分函数; SynthID-Text 使用锦标赛采样。改编自 Dathathri 等人。 [3]。 Anthropic 的部署也说明了为什么这比第一方聊天界面更重要。该公司表示,水印应用于模型级别,涵盖通过 Claude Platform API 以及云提供商访问的受支持模型 [1]。因此,即使代理本身是一个单独的应用程序,使用带水印的模型作为代理的推理组件的开发人员也可以接收带水印的输出。这使得水印的模型级行为影响与围绕此类模型构建的代理相关。水印偏差与代理行为的令牌相同 锦标赛采样有更多机会在模型不确定的情况下改变令牌选择。在 JSON 等结构化输出中,大括号、键和函数名称通常是高度可预测的,而查询、数字、路径和收件人等值则不太可预测。因此,相当于普通散文中词汇变化的变化可以改变主体执行的论点。权重和提示保持不变,但代币选择不变。重要的是,非失真并不意味着在固定水印密钥下具有相同的行为。该保证保留了水印的随机性,而特定密钥会在生成过程中改变令牌选择[3]。因此,即使水印在 Dathathri 等人定义的意义上是非失真的,所产生的采样漂移也会改变代理行为。其效果还取决于水印密钥,因此我们测试多个密钥而不是依赖一个。 我们如何衡量效果我们使用配对设计进行两个实验。工具调用在 BFCL v4 单轮 AST [9] 上进行评估,并拒绝 200 个 HarmBench 有害行为 [10] 加上 100 个良性 JailbreakBench 控件 [11],并在裸露和一种固定提示注入技术下测试有害请求。表 1 总结了数据集、评估范围、温度和预期行为。 我们通过 HuggingFace 的未修改的 SynthIDTextWatermarkLogitsPro 使用非扭曲的 SynthID-Text 配置
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱