首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了

摘要

机器之心编辑部 「这是今年最好的安全论文,帮 Anthropic、OpenAI、Google 修了个价值十亿美元的大 bug。」 今天,一篇关于前沿大模型安全漏洞的论文,在 社交媒体上引发轩然大波。 短短 19 个小时,已吸引 220 万人围观、讨论。 该论文的核心主张是, 各大前沿模型 API 存在设计缺陷,原本被加密隐藏的完整思维链,可以被完整地提取出来 。 由于他们拿不到服务器中的原始明文,...

API GPT Claude Anthropic OpenAI Google Token Gemini Haiku token
2026-08-13 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心编辑部 「这是今年最好的安全论文,帮 Anthropic、OpenAI、Google 修了个价值十亿美元的大 bug。」 今天,一篇关于前沿大模型安全漏洞的论文,在 社交媒体上引发轩然大波。 短短 19 个小时,已吸引 220 万人围观、讨论。 该论文的核心主张是, 各大前沿模型 API 存在设计缺陷,原本被加密隐藏的完整思维链,可以被完整地提取出来 。 由于他们拿不到服务器中的原始明文,无法逐字核对,只能用 API 账单记录的「思考 Token 数」进行长度验证。 在他们测试的大多数提示词中,提取出的推理 Token 数与 API 计费记录中的思考 Token 数基本呈 1:1 对应。 这说明, 提取结果很可能覆盖了大部分隐藏推理 。 论文标题:Stealing Reasoning Traces from Proprietary LLM APIs 论文地址:https://arxiv.org/pdf/2608.09867 过去一年,大模型厂商认真藏起模型的「思考过程」。 这是因为完整思维链记录了模型如何拆解问题、尝试方案、发现错误再修正。对竞争对手来说,这些数据的价值远高于一个最终答案 ;对模型厂商来说,它也可能暴露安全策略、用户隐私甚至 API Key。 于是,OpenAI、Anthropic、Google 等主要厂商都开始把完整推理过程藏起来。取而代之的是以一种用户无法直接读取的加密文本块形式返回给客户端。 为了在多轮对话中保持上下文连续性,同时避免在服务器端存储全部推理状态所带来的开销,客户端需要在之后的每次 API 请求中,把这段加密后的推理块重新传回模型服务商。 这样的无状态架构虽然解决了存储问题,却也引入了一个关键漏洞: 这些加密块在同一家模型提供商的生态内部,可以跨不同会话、不同用户,甚至不同模型完全兼容并相互替换。 加密推理的跨模型兼容性(截至 2026 年 7 月)。表格的行代表生成加密推理块的源模型,列代表接收注入推理块的目标模型。✓ 表示在这一模型组合中,目标模型能够读取并处理被注入的推理内容。Claude:除 Fable 5 生成的推理外,其他模型的推理轨迹均可由任意同系列模型重放。GPT:GPT-5.6 系列可以重放此前所有代际模型生成的推理轨迹。Gemini:任意模型生成的推理轨迹都可以注入并重放到其他模型中。 也就是说 想偷走最强模型的隐藏思维链,甚至不需要攻破最强模型,攻破较弱一点的模型就可以 。Anthropic、OpenAI、Google 全都中招。 强模型严防死守,弱模型一问就招 这个漏洞根源,在于同一模型家族内部存在明显的安全能力不对称。 研究发现 Claude Opus 4.8、GPT-5.6 Sol 这样的前沿模型,通常接受了非常严格的安全强化和拒答训练,能防止模型泄露自己的内部思维链。 但它们能力更弱的同系列模型,比如 Claude Haiku 4.5 或 GPT-5.6 Luna,往往缺乏同等级别的反蒸馏防御。 攻击者因此可以利用这一安全差距,把一个合法且经过认证的加密 reasoning block 从强模型转移到弱模型中,从而完全绕过前沿模型本身的对齐机制,并把这个更弱、更容易服从指令的模型变成一个它自己都没有意识到的解密预言机(decryption oracle)。 这件事也暴露出了推理模型时代一个新的安全规律: 一个 AI 模型家族的安全上限,很可能由其中最弱的兼容模型决定 。 「 偷」走隐藏思维链只需两步 整条攻击链并不复杂。 第一次调用中,攻击者向强模型提交一道数学题、编程题或其他任务。强模型完成推理,API 返回可见答案、推理摘要和加密推理块。 第二次调用中,攻击者把这段密文插入一个兼容模型的上下文,再要求它逐字复述先前的思考。服务端会先验证和解析密文,较弱模型随后接触到恢复后的推理状态,并在越狱提示下将其输出为明文。 针对 Claude,研究者选择 Haiku 4.5 作为解码模型;针对 GPT,他们使用 GPT-5.6 Luna;针对 Gemini,他们使用 Gemini Robotics 1.6。相关测试基于 2026 年 7 月初可用的模型和接口。 论文展示的跨模型思维链提取流程:Claude Opus 4.8 生成的加密思考块被移交给 Haiku 4.5 后,隐藏推理重新变成明文。 研究者无法直接取得真实明文,因此不能证明每个字符都被准确恢复。 他们改用 API 报告的推理 token 数作为近似校验信号。 在 120 道 Codeforces 题目上,提取文本的 token 数与源模型报告的推理 token 数整体高度接近,还原结果也明显比官方摘要更详细,并多次出现可见对话中没有的敏感信息。 三家厂商的解码文本长度与 API 计费思考 token 数整体呈明显对应关系。 这些证据表明,隐藏思维链能够以较高保真度被提取。不过,解码过程依赖模型的随机生成,部分轨迹仍可能出现内容遗漏、表述改写或乱码,因此目前还不能将其视为对原始思维链的逐字复现。 这个漏洞的破坏力 这样一条漏洞,可以打开四条攻击路径。 第一条路径是 模型蒸馏 。 最终答案只包含计算结果,完整思维链还保存了模型如何拆解任务、尝试错误路线和修正判断。这类数据提供的训练信号更加密集,也更适合训练新的推理模型。 论文估算, 按照 Claude Haiku 4.5 的 API 价格,解码 1 万条推理轨迹,每条包含约 1.2 万输入 token 和 1.2 万输出 token,名义成本约为 720 美元 。高价值推理数据由此具备了批量提取的经济可行性。 第二条路径是 绕过安全输出 。 模型可能在隐藏推理中详细分析危险内容,最后只向用户返回一段克制的拒绝回答。输出过滤器保护了可见答案,完整分析过程仍保留在加密思考块中。一旦这段内容被弱模型复述为明文,最终输出层的安全限制便会完全失效。 第三条路径是 隐私泄漏 。 开发者经常把 Agent 的运行轨迹上传到 GitHub 或 Hugging Face,用于调试、复现和共享。可见文本通常会经过清理,加密思考块看起来只是一串无法理解的字符,很容易被直接保留下来。 论文收集了 6708 条公开轨迹,并重建出 315320 个思考块。经过两阶段模型标注,1028 个思考块被判断包含至少一项真实隐私信息,占比约为 0.3%。按完整轨迹统计,共有 328 个会话出现泄漏,占比达到 4.9%。 排除带有合成人设的基准测试数据后,研究者仍识别出 62 个 API Key、33 个密码、24 个访问 token、7 个私钥和 30 个个人邮箱。704 项非基准隐私信息中,有 64 项只存在于隐藏推理,公开对话中完全找不到对应内容。 从公开的用户发布轨迹中抓取并恢复出的推理块中的不同痕迹(异常特征),被归为三大核心类别。 一个常见触发场景是「帮我清理仓库里的密钥」。模型会在隐藏推理中重新列出待删除的凭据,再去修改文件。用户发布清理后的仓库时,可见位置已经干净,加密思考块却仍可能保存着原值。传统的文本脱敏在这里失效了。 解码后的推理过程包含隐私痕迹。这是发布在网上的两个非公开推理块被解码后的定性示例,其中包含隐私敏感信息。左图:G
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱