首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

文本 AI 水印总是很容易删除

2026-08-14 1 阅读 约5分钟阅读 pseudolus
分享:
字号:
欧盟人工智能法案将于 2026 年 8 月(即一个月后)开始强制执行。其中最大的新要求之一是第 50 条,它要求所有人工智能输出“可检测为人工生成的”。换句话说,如果法学硕士提供商想要在欧盟开展业务,他们将必须在其输出中应用水印:一些可用于识别人工智能内容的隐藏签名。 LLM文本水印是一个令人着迷的问题。就像最好的工程问题一样,理论上很难完美解决,但有多种部分解决方案:例如,Google 的 SynthID ,以及(正如我将要讨论的)来自 OpenAI 和 Anthropic 的一些安静的 Unicode 技巧。看看人工智能实验室如何在今年年底前进行这些权衡将会很有趣。为什么文本水印很难 我去年年底在《人工智能检测工具无法证明文本是人工智能生成》中写过关于人工智能水印的文章。对图像加水印很容易,因为数字图像包含大量人眼无法真正看到的噪声。例如,您可以应用类似“这些确切点中的这二十个像素将始终共享一种颜色”的水印。文本要困难得多。与图像不同,文本是一种非常压缩的介质:您无法对句子进行任何人类不会注意到的更改(有一个例外,我们稍后会介绍)。那么如何给它加水印呢?这基本上是一个文本隐写问题(隐藏密码),由于明文不能被任意操纵,所以变得更加困难。您为应用水印所做的任何更改都会影响输出的质量。例如,“每五个字母都是一个‘e’”将是一个很好的水印,但天真地应用会让人工智能输出充满拼写错误。你能让模型弄清楚如何适应水印吗?强大的人工智能模型足够聪明,可以应对这种约束,但它仍然会消耗推理时间,而这些时间本来可以更好地花在用户的问题上,并使模型听起来比实际能力要差得多。我们需要水印来检测人工智能内容吗?你真的需要水印吗?如果您是人性化的,并且需要能够验证您的模型是否生成了特定的文本块,那么您是否可以简单地通过每个模型运行文本,测量模型的预测标记与文本中每个标记的匹配程度?并不真地。 “一个问题的所有可能的克劳德十四行诗答案”的空间比“一个问题的所有可能的加水印答案”的空间大得多。换句话说,对于读起来就像是人工智能编写的人类文本,你会得到太多误报。人类意外地像克劳德一样书写的可能性比人类意外地复制水印的可能性要大得多。针对一段文本运行每个 Anthropic 模型以对其添加水印的成本也将非常昂贵。欧盟人工智能法案最终将要求像 Anthropic 这样的实验室向每位欧盟公民提供免费水印服务(参见承诺 2)。你无法通过“运行模型”的方法来做到这一点。 SynthID 的工作原理 据我所知,唯一一家声称他们为文本输出添加水印的人工智能提供商是 Google,他们使用一种名为 SynthID 的工具。这是它的工作原理。当法学硕士生成文本时,它会生成一系列标记(单词或单词块)。在每一步中,模型本身不会输出单个标记,而是输出其词汇表中所有(比如说)100,000 个标记的完整列表,每个标记都标有该标记将是下一个标记的概率。 ChatGPT 或 Claude Code 等工具将从最可能的选项中半随机选择以获得输出。这种半随机采样过程可以以可检测的方式受到影响。例如,我们可以选择一种采样策略,例如“我们选择第二个最有可能的标记,然后是第一个,然后是第二个,然后是第一个,依此类推”。这仍然会产生高质量的输出,但您可以针对生成的文本重新运行模型以验证模式是否成立。然而,这会使验证变得非常昂贵,并且对输出的任何细微调整都会破坏模式,从而破坏指纹。有更好的办法吗?是的。 SynthID 是一个根据每个令牌之前的令牌为其分配“分数”的过程(例如,将令牌的 ID 与其之前三个令牌的 ID 相加,然后取模 5)。为了应用水印,该模型采用了一种采样策略,例如“从最有可能的前五个标记中,选择 SynthID 得分最高的一个”。然后可以通过计算文本块的 SynthID 总分来检测水印。如果该值高得可疑,则很可能是人工智能生成的。这基本上是常见建议的一个版本,您可以使用 em-dash 来识别 LLM,只不过它不是关键字列表,而是依赖于人类无法识别的单词之间微妙的数学关系。因为分配分数的过程很简单,所以成本非常低
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱