首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

揭示人工智能模型内心想法的新技巧

2026-08-11 1 阅读 约4分钟阅读 Will Knight
分享:
字号:
计算机科学家最近发现了一种方法,可以提取前沿人工智能模型在解决复杂问题时所执行的隐藏“思维”。这些发现提供了一些证据(尽管不是决定性的证据),表明某些中国模型可能是通过从美国模型中“提取”推理信息来训练的,这些信息被认为是隐藏的,因为它们的某些思维或推理模式似乎非常匹配。研究人员还证明,该方法可用于从模型的内部推理中恢复个人信息,例如密码和 API 密钥,尽管该漏洞已得到修复。参与这项工作的德国图宾根大学计算机科学家 Alexander Panfilov 表示:“我们测试的所有主要前沿模型提供商都存在这个漏洞。” “它可能导致个人信息泄露,并且可以实现大规模推理蒸馏攻击。” Panfilov 及其来自图宾根大学、马克斯普朗克研究所、人工智能安全研究所 MATS Research 和安全公司 Snyk 的同事在 OpenAI、Anthropic 和 Google 的前沿模型中发现了同样的问题,这些模型可通过应用程序编程接口或 API 访问。在一篇介绍这项工作的论文中,研究人员表明,Moonshot AI 的开放权重或可下载的中国模型 Kimi K3 对于某些提示,产生了与 Claude Opus 4.8 和 GPT 5.6 Sol 的隐藏推理轨迹(解决问题时所涉及的书面推理步骤)惊人相似的输出。尽管有相似之处,他们指出这项工作“不能因果地建立蒸馏”。他们发现另外两个开放权重模型,中国的 DeepSeek 和美国公司 Thinking Machines 的 Inkling,并没有表现出与 Claude Opus 的这种推理相似性。截至发稿时,Moonshot AI 和 Z.ai 尚未回应置评请求。蒸馏是一种成熟且广泛使用的技术,可有效地将现有模型的功能复制到新模型,并且在开放权重或完全可下载模型的开发中尤其常见。然而,最近,蒸馏已成为一个有争议的话题,因为有人声称中国人工智能公司使用它基本上复制了美国最好的模型。今年 2 月,OpenAI 告诉美国立法者,DeekSeek 似乎复制了其一个模型来构建名为 R1 的推理模型。今年 6 月,Anthropic 告诉立法者,阿里巴巴已经系统地提炼了自己的模型,以建立自己的模型,名为 Qwen。没有迹象表明中国人工智能公司使用这种特定技术来提炼美国的人工智能模型。但潘菲洛夫和合作者表示,使用他们的方法将有可能从封闭模型中提取比之前意识到的更多的信息。 Mini-Me 模型先进的人工智能模型通过将难题分解为多个组成部分来解决这些问题,并通过一种人工推理或“思维链”依次分析这些组成部分。公司倾向于对专有模型的推理保密,以防止其他人使用它们来训练新模型。然而,他们通常还会以减轻一些计算负担的方式将该推理的加密版本发送到用户的计算机。研究人员的攻击依赖于大多数人工智能公司也提供不同规模的相关模型。较大的模型能力更强,但运行时的计算成本更高,访问成本也更高。用户可以为某些任务选择更小、更弱的模型以降低成本。潘菲洛夫和他的同事发现,将加密的推理痕迹输入同一模型的较小版本可以揭示内部隐藏的推理。较小的模型接受的对齐训练较少,这意味着与较大的模型不同,它们不太可能拒绝透露自己的内心想法。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱