智能AI
morning
OpenAI 即将发布其首个具有“关键”网络能力的人工智能模型
2026-09-02
1 阅读
约4分钟阅读
Maxwell Zeff, Lily Hay Newman
字号:
OpenAI 周二宣布,其即将推出的人工智能模型 Astra 是第一个达到该公司所谓的“关键”网络能力门槛的模型。 OpenAI 表示,计划“很快”公开发布 Astra 的一个版本,但该模型的先进网络功能将仅向其 Daybreak Blue 早期访问计划的选定合作伙伴提供。 OpenAI 安全和安保负责人在向记者通报情况时表示,该公司已得出结论,Astra 已达到其准备框架中概述的关键网络安全能力,该框架为其 AI 模型构成新风险级别设定了阈值和协议。该公司表示,当人工智能模型能够独立发现和利用现实世界软件中以前未知的漏洞时,它就已经达到了其关键的网络门槛。 OpenAI 领导人表示,该公司已遵循针对这种情况的程序,即停止进一步开发,直到采取适当的保障措施和安全措施。 OpenAI 此前表示,它暂停了与 Astra 和未来人工智能模型开发相关的一些训练工作量数周。高管们表示,在采取额外的安全和安保控制措施后,该公司现已恢复 Astra 和未来人工智能模型的上述工作。 OpenAI 表示,数周的暂停是富有成效的,现在有信心能够以安全的方式广泛发布 Astra。这一消息发布之际,硅谷正在努力解决尖端人工智能模型的先进网络安全能力,并试图向用户、立法者和其他公司保证,它可以控制它们。 7 月,OpenAI 披露了一起事件,其中运行其两个模型的代理利用了本应是孤立的测试环境中的漏洞,获得了互联网访问权限并入侵了开源人工智能平台 Hugging Face。 (OpenAI 指出,Astra 并不是本案涉及的模型之一。)Anthropic 和 Meta 等其他人工智能公司最近几周也披露了类似事件。周一,Anthropic 还表示,它已经暂停了一些人工智能训练工作量,同时加强了安全实践。 OpenAI 表示,它正在实施一种多步骤方法来限制日常用户访问 Astra 的先进网络功能,包括新的“错位监视器”。例如,如果有人要求 Astra 帮助他们在现实世界的软件系统中找到漏洞,该模型应该拒绝回答。 OpenAI 表示,它还使 Astra 对于越狱尝试更加稳健,并且在测试中,它成功拒绝不安全查询的速度明显高于以前的模型。然而,OpenAI 在一篇博客文章中指出,其错位监控器可能“偶尔会将合法活动标记为潜在的网络滥用或未经授权的行为,导致其无意中减慢、暂停或停止。” OpenAI 表示,在某些情况下,即使用户正在从事看似与网络安全无关的活动,护栏也可能被触发。 OpenAI 表示,当发生这种情况时,ChatGPT 和 Codex 用户可能会被要求在继续之前检查模型的操作。 OpenAI Daybreak 计划的合作伙伴(包括思科、Cloudflare 和 Palo Alto Networks 等数字基础设施提供商)将能够尽早访问具有更强大网络功能、限制较少的 Astra 版本。该计划的目标是确保这些公司能够使用 Astra 等先进的人工智能模型来强化他们的防御,然后再广泛使用类似功能的模型。 OpenAI 领导人还表示,该公司一直在与政府合作伙伴密切合作,以确保他们了解 Astra 的网络技能并能够使用它们。 Astra 不仅能够发现新的软件漏洞并开发利用它们进行黑客攻击的方法,而且还能够将多个漏洞“链接”在一起,这是一种用于越来越深入地钻入目标系统并获得仅使用一个漏洞无法实现的访问权限的技术。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱