首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Open AI 的 Astra 模型即将推出,并且非常擅长侵入计算机系统

2026-09-02 1 阅读 约3分钟阅读 Tim Fernholz
分享:
字号:
OpenAI 分享了即将推出的 Astra 模型的新细节,该公司称该模型是第一个满足其“关键网络安全门槛”的大型语言模型,为即将发布的版本做准备。 OpenAI 的博客文章写道:“我们计划很快推出 Astra,但对其最先进的网络安全功能的访问将更加有限。”前沿实验室确定 Astra 能够发现计算机系统中未知的安全漏洞,并在无需人员指导的情况下利用它们。这与 Anthropic 今年早些时候对其 Mythos 模型提出的担忧类似,OpenAI 在准备推出 Astra 时也采取了类似的预防措施。在没有任何第三方确认的情况下,很难评估 OpenAI 关于安全性或准备情况的说法。该公司表示将与一组测试人员一起预览该模型,但没有透露他们是谁或如何选择他们。目前尚不清楚 OpenAI 是否正在与美国政府合作在模型发布前对其进行评估。 OpenAI 指出,Astra 在 ExploitBench 上获得了满分,这是对法学硕士侵入已知系统漏洞的能力的评估。该公司表示,在 OpenAI 工程师开发的测试修改版本中,该模型发现并利用了两个零日漏洞。为了确保其模型既不会被不良行为者利用,也不会出现不良行为,OpenAI 表示,它已经开始改进模型的工具,以检测滥用行为并防止越狱。然而,对于阿斯特拉来说,该公司投资了未具体说明的新技术,旨在使模型更安全。 OpenAI 还开始识别“被评估为较高风险的账户”,并限制模型对其提示的响应,但也没有说明如何进行。最后,尽管该公司将 Astra 描述为“迄今为止最一致的模型”,但它将部署该模型并进行额外的思想链监控,以发现和阻止不良行为。 Astra 的发布准备工作正值业界对 OpenAI 智能体突破训练环境并访问流行模型和基准分发平台 Hugging Face 上的私人数据做出反应。 OpenAI 表示,对于 Astra 来说,它设计了一项测试来诱使新模型复制 Hugging Face 事件中流氓特工的行为,尽管 OpenAI 研究人员采取了保护措施,但该模型仍合作访问开放互联网。他们表示,阿斯特拉在这些实验中并未试图突破其测试环境。 Yona Shavit 是 OpenAI 的前员工,现在在 OpenAI 基金会从事人工智能弹性工作,她在社交媒体上想知道 Astra 不愿意违反规则是否是因为知道人们对它的期望,或者是试图愚弄研究人员。对于所有这些新细节,我们仍然很难确切地了解 Astra 的能力,或者 OpenAI 是否正在采取正确的措施来确保安全。该公司表示,预计在向公众广泛推出时,将发布对该模型的更多评估和进一步的安全信息。然而,到那时,秘密就会泄露出去。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱