智能AI
morning
开放权重人工智能模型正在赶上前沿。安全差距依然存在。
2026-08-05
1 阅读
约6分钟阅读
Rebecca Bellan
字号:
当政策制定者争论如何管理日益强大的人工智能系统(例如 OpenAI 的 GPT-5.6 Sol 和 Anthropic 的 Mythos)时,中国的开放权重模型缩小了与行业领导者的差距。根据人工智能安全非营利组织 SaferAI 的一份新报告,中国 Z.ai 的开放权重人工智能模型 GLM-5.2 在网络和生物能力方面仅落后 OpenAI 的 GPT-5.5 和 Anthropic 的 Claude Opus 4.7 几个月。但前沿能力和安全实践之间的差距正在扩大。根据 SaferAI 的评估(该非营利组织通过 Z.ai 的公共 API 进行评估),GLM-5.2 没有拒绝它所接受的任何攻击性网络或双重用途生物学任务。相比之下,Claude Opus 4.7“一贯拒绝,以至于 SaferAI 根本无法在其上完成 CyberGym”。 (CyberGym 是评估网络安全能力的基准。OpenAI 在上个月 Hugging Face 漏洞之前的评估中使用了它。)这清楚地提醒人们多年来一些批评者的警告:开放权重 AI 模型可能会将功能强大的 AI 交给潜在攻击者,而一旦他们下载权重,就无法监管他们如何使用该技术。随着开放权重模型迅速接近世界领先人工智能系统的能力,争论正从它们是否可以竞争转向社会如何在发布后管理风险。 SaferAI 执行董事亨利·帕帕达托斯 (Henry Papadatos) 告诉 TechCrunch:“能力的边界并不是风险的边界,因此我们确实必须考虑缓解措施的状态,以正确评估风险。”虽然 Z.ai 可以对其托管的 API 应用安全措施,但一旦有人在自己的硬件上运行权重,这些保护措施就变得无法执行,他们可以删除或修改任何保护措施、微调模型或更改系统提示。 OpenAI 和 Anthropic 等前沿开发商倾向于依靠分类器、拒绝训练和 API 级控制等保障措施来限制危险的网络和生物援助。这些措施远非万无一失:越狱通常会绕过已部署模型的保护。 Far.ai 是一家人工智能安全非营利组织,在 xAI 的 Grok 4.5 和 Google DeepMind 的 Gemini 3.1 Pro 等前沿模型中发现了数百个通用越狱(定义为可重复使用的密钥,能够成功执行大多数有害请求)。根据该报告,当攻击者结合多种操纵技术(包括角色扮演、权威模仿、虚假对话历史记录和后续提示)来放大模型防御中的弱点时,越狱就会成功。但封闭模型的保护措施在开放权重模型上根本不起作用,开放权重模型旨在在具有任何保护措施(或缺乏保护措施)的任何基础设施上运行。帕帕达托斯说:“目标显然应该是让任何人都可以使用良好的功能(安全的功能),然后我们尝试消除不良的功能,即使是以开源的方式也是如此。”帕帕达托斯指出,一项可以提供帮助的技术称为“预训练数据过滤”,即人工智能公司从训练数据中删除攻击性网络安全信息,然后在精选数据集上训练模型。一些研究表明,这可以减少危险的生物学知识,而不会损害整体模型的性能。然而,对于网络安全而言,数据过滤的实用性要差得多。训练一个擅长编码但又不是优秀黑客的通用模型是很困难的。由于编码已成为人工智能最大的赚钱工具,开发人员在寻找限制滥用的方法的同时,也面临着不断改进这些功能的压力。因此,前沿开发人员越来越依赖其他缓解措施。一种方法是有选择地限制网络安全援助模型将提供的种类。例如,Anthropic 的 Opus 5 可以根据模型的系统卡搜索未编译源代码中的漏洞,但不能搜索已编译软件中的漏洞。原因是,这使得使用 Opus 5 进行攻击变得更加困难。其他措施包括严格的部署前安全评估、发布风险评估以及在系统被认为过于危险时扣留模型权重。在 GLM-5.2 的案例中,SaferAI 表示 Z.ai 没有发布该模型的安全框架、部署前测试承诺或风险评估。 TechCrunch 曾询问 Z.ai 在发布前是否进行过内部或第三方前沿安全评估,但没有得到回应。中国领导人越来越认识到先进人工智能的风险。在上个月的世界人工智能大会上,中国国家主席习近平强调了开放权重模型的重要性,同时也强调了确保人工智能仍然是人类严格控制下的工具的必要性。斯坦福大学网络政策中心研究中国人工智能政策的格雷厄姆·韦伯斯特 (Graham Webster) 告诉 TechCrunch,中国拥有严格的人工智能监管法规,但这些规则历来侧重于政治敏感内容
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱