首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

从Claude隐形水印回望GenAI时代信息隐藏:嵌入水印如何保证无损?

摘要

新智元报道 2026年8月11日,Anthropic宣布:自8月2日起发布的新版Claude模型,将在生成文本中直接嵌入人眼不可见、机器可读的隐形水印,使AI生成内容在被复制、传播之后仍可被软件识别溯源。 官方文档写道:「当受支持的Claude模型生成文本时,它会将一种难以察觉的水印直接嵌入到文本之中。您不会看到它,而且它既不会改变Claude回答的语义、质量,也不会影响其可读性。」 该机制覆盖C...

IEEE 打水印 可证安全隐写 IWDW 2018 2021 ACM CCS 2023 2026
2026-08-18 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 2026年8月11日,Anthropic宣布:自8月2日起发布的新版Claude模型,将在生成文本中直接嵌入人眼不可见、机器可读的隐形水印,使AI生成内容在被复制、传播之后仍可被软件识别溯源。 官方文档写道:「当受支持的Claude模型生成文本时,它会将一种难以察觉的水印直接嵌入到文本之中。您不会看到它,而且它既不会改变Claude回答的语义、质量,也不会影响其可读性。」 该机制覆盖Claude网页端、API与Claude Code等全线产品,面向全球用户生效且不可关闭;生成的图像等文件还将附带符合C2PA标准的数字签名溯源元数据。 这是Anthropic签署欧盟《人工智能法案》第50条透明度行为准则后的标志性举措。 给AI生成内容「打水印」,正在从企业倡议走向全球共识。2025年6月,世界经济论坛在天津夏季达沃斯发布《2025年十大新兴技术》,「生成式水印」位列第二;未来学家凯文·凯利在《2049:未来10000天的可能》中预言,人工智能时代需要「重新定义真实」,需要「在AI生成的图像和影像上加上类似水印的辨别真伪的标记」。 图1 夏季达沃斯论坛和凯文·凯利预言 但把水印「做对」并不容易。 Anthropic公告发布当天,用户最集中的质疑正是:打水印,会不会伤模型?会不会降低生成质量? 「可证明的性能无损」,由此成为GenAI时代信息隐藏研究的核心命题。而要理解这一命题,需要回到它的理论源头——可证安全隐写。 可证安全隐写 等待生成模型二十年 隐写与水印同属信息隐藏。传统隐写多年来一直停留在「经验安全」:用隐写检测算法测试隐写的安全强度,却无法给出数学保证。可证安全隐写则要求严格证明:载密数据与正常数据在分布上不可区分。 这条理论路线由来已久。 1949年,Shannon指出建立隐蔽通信理论的困难;1998年,Cachin引入相对熵,给出信息论意义上的安全定义;2002年,图灵奖得主Manuel Blum指导Hopper等人建立计算安全隐写框架,2004年又发展出公钥隐写与隐蔽密钥协商。 然而,所有可证安全隐写构造都依赖一个苛刻前提——载体分布可精确采样。自然数据分布不可控,理论因此沉寂多年。 图2 可证安全隐写发展历程简述 2018年,AI生成模型带来转折:模型先学到分布、再按分布采样,天然提供了「显式分布或完美采样器」。 中科大团队在国际上最早提出生成式可证安全隐写思路,给出「黑盒采样」与「压缩—可逆采样」两套框架(IWDW 2018、arXiv 2018),将隐写安全性归约到加密算法安全性——把消息加密成伪随机密文,用密文驱动采样生成内容,接收方经逆采样恢复密文。 彼时生成式AI尚未爆发,这一想法显得「超前」,一度难以获得学界同行认可。随着语音等生成模型质量快速提升,相关成果逐渐得到承认,国际水印与取证研讨会(IWDW)邀请中科大团队作题为「When Provably Secure Steganography Meets Generative Models」的大会主旨报告。 图3 最早的生成式可证安全隐写文章 2021年前后,AI生成数据逐步成为网络内容的主要形态,可证安全隐写在全球范围内得到广泛关注:清华大学提出基于样本分组的可证安全语言隐写(Findings of ACL 2021);波士顿大学与约翰霍普金斯大学提出面向真实分布的密码学安全隐写Meteor(ACM CCS 2021);牛津大学提出基于最小熵耦合的完美安全隐写(ICLR 2023)。 中科大团队提出基于「分布副本」的Discop构造(IEEE S&P 2023),显著提升了嵌入载荷率。同年,Quanta Magazine将「在生成数据中完美隐藏秘密信息」评为年度国际计算机科学七大突破之一,宣告了信息隐藏进入「可证明」时代。 从对称到非对称 从「有盒」到「无盒」 早期的生成式可证安全隐写 均为「对称密钥」体制,收发双方须预先共享密钥,且依赖白盒提取,使用场景受限。 此外,子词歧义会导致提取失败。中科大团队把技术路线推向公钥隐写、无盒/灰盒场景、并消除了子词歧义,使生成式隐藏走向实用。 公钥隐写 (IEEE TIFS 2024):提出将椭圆曲线密码(ECC)与生成模型结合的可证安全公钥隐写方案、并提出了隐写密钥交换协议。解决了隐写密钥协商和隐藏信息「非对称」提取问题。 无盒隐写 (IEEE TMM 2026):传统方法依赖「白盒」提取,接收方必须持有与发送方完全相同的语言模型。团队提出Disreo,通过token位置随机化与输出概率重组实现「无盒提取」,接收方无需访问底层模型即可恢复消息,为实际部署提供更大便利。 灰盒隐写 (ACM CCS 2026):白盒与无盒之间还存在「灰盒」场景——收发双方资源不对等,接收方可能只有运行小模型的能力(如移动端设备)。SpecStega基于推测采样(speculative sampling):以双方共享的小模型完成消息嵌入与提取,再借助目标大模型对输出进行精炼,使最终载密文本既对齐大模型的输出分布、保持高质量与安全性,又能在接收端仅凭小模型高效解码,载荷率相对现有黑盒方案提升20倍以上——为可证安全隐写提供了介于「有盒」与「无盒」之间的第三条路径。 解决子词歧义 (IEEE TDSC):基于大语言模型的隐写普遍面临分词(token)解码歧义——同一段文本可能被切成不同子词序列,导致提取失败。团队提出SyncPool,在嵌入前将存在前缀关系的token统一分组,从原理上消除歧义,实现可证安全隐写的可靠提取。 从隐写到水印 让「可证无损」走向产业 AIGC大模型首先学到了自然数据的分布,然后按照分布采样生成文本、图像、音视频等内容。如果能够做到:在生成内容中嵌入水印但是不影响采样分布,那就意味着水印嵌入没有影响生成质量。 可证安全隐写理论上保证了载密数据与正常生成数据的分布不可区分,即嵌入信息不改变模型的采样分布——这正是「可证生成质量无损水印」的定义。水印不需要隐写那样大的容量,因此还可以用容量换取鲁棒性。 在文本领域,中科大团队开发的可证生成质量无损水印系统,即插即用、无需修改模型参数,支持单比特鲁棒鉴别与多比特模型归因,已应用于星火大模型,安全GPT模型等平台,服务了1.3万名开发者。 与此同时,国际上可证无损生成文本水印的研究也在快速推进: 2024年,马里兰大学等团队的《Unbiased Watermark for Large Language Models》(ICLR 2024 Spotlight)定义了无偏水印并给出通用构造; 同年,斯坦福大学提出抗失真的鲁棒无偏水印(TMLR 2024); 2025年,多通道无偏水印MCmark(ACL 2025)在保持严格无偏的同时,提升了水印提取的鲁棒性。 在图像领域,中科大团队提出Gaussian Shading(CVPR 2024),把加密随机化后的水印映射为与正常生成不可区分的高斯潜变量,再经扩散过程作用于整个潜空间,无需训练、即插即用、可证明性能无损; Gaussian Shading++与T2SMark(NeurIPS 2025)进一步解决了真实部署中的鲁棒性、生成参数变化与生成多样性问题; TAG-WM(
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱