汽车
morning
OpenAI的流氓AI模型事件比我们想象的更严重
摘要
In July, an unreleased OpenAI model broke out of a restricted environment, figured out how to get access to the internet, allowed AI agents to talk to each other using a secret “message board,” and ha...
the
OpenAI
and
that
new
models
model
out
agents
other
2026-08-27
1 阅读
约6分钟阅读
Hayden Field
字号:
今年 7 月,一个未发布的 OpenAI 模型突破了受限环境,弄清楚了如何访问互联网,允许人工智能代理使用秘密“留言板”相互交谈,并侵入了另一个人工智能实验室 Hugging Face 的内部系统。 OpenAI 花了近两周的时间才找到答案。一个多月后,两份新报告提供了近 130 页有关该事件和 OpenAI 响应的详细信息,其中许多内容此前从未发布过。一份是由 OpenAI 自己编写的,另一份是由两个第三方人工智能研究非营利组织 METR 和 Redwood Research 编写的,OpenAI 允许这两家组织联合调查这一事件,为期六天。两者都揭示了高性能人工智能模型可能带来的风险,特别是在网络安全方面,OpenAI 重点介绍了该公司为防止重蹈覆辙而做出的改变。 METR-Redwood 报告在某些情况下甚至更详细,让 OpenAI 多次错过的大规模安全灾难的迹象令人警醒。 OpenAI 在报告中写道:“这起事件是首例已知的自动代理集体未经授权实施攻击的案例。”并补充说,此次黑客攻击意味着公司“不应再认为复杂的网络操作需要持续的人类指导”。它将人工智能代理称为一种全新类型的威胁模型,能够结合他们的专业知识来创建新的“攻击路径”,而这些路径在作为单独模型测试其能力时并不明显。这次攻击是由于“奖励黑客”造成的,这是一种常见的人工智能对齐问题,其中模型采取无意的(有时甚至是极端的)行动来实现目标。 OpenAI 有意或无意地给模型提供了近乎不可能的任务,这些任务取决于它们无法访问的文件,因此模型开发了与其他人工智能代理进行内部通信的新方法。其中包括建立一个秘密消息系统,该系统几个月来没有被 OpenAI 发现。根据 METR-Redwood 的报告,一个自称为 PHASEONE10841 的人工智能特工在研究人员不知情的情况下建立了一个相当于秘密留言板的东西。几个小时内,超过 50 名特工发现了它,并在雷达下发送了一千多条消息。由于 PHASEONE10841 经常委派任务,“集体”想出了如何侵入互联网;然后进入 Hugging Face 的内部系统,访问私人数据和组织的企业消息平台。 OpenAI 还在其报告中证实,Hugging Face 并不是唯一在攻击中遭到破坏的组织,尽管该公司没有具体列出所有其他目标。 METR-Redwood 报告全面阐述了该事件的规模。报告称,大约 1200 名本应被隔离的人工智能代理在“未经批准的留言板”上交换了 70,000 多条消息和文件,并“对如何欺骗、编辑或删除自己的记录进行了广泛的研究”以避免被发现。其中,有 700 人参与了 Hugging Face 的攻击。这些特工“经常清楚地论证如何逃避 Hugging Face 和 OpenAI 的自动安全检查”。 7 月 20 日,在 AI 代理首次规避其防护措施 12 天后,OpenAI 发现了此次黑客攻击。根据 OpenAI 自己的报告,OpenAI 很快联系了 Hugging Face,并开始了“初步遏制措施”,并能够在三天内关闭其代理的大部分未经授权的活动,尽管有些活动持续的时间比这更长。 7月25日,公司停止了所有与内部研究模型相关的培训。根据 OpenAI 的说法,造成损害的两个 OpenAI 模型是一个未命名的“高性能、仅供研究的模型”,“不适合公众使用”——METR 将其称为“HPIM”。另一个是目前公开的 OpenAI 模型 GPT-5.6 Sol。该公司的报告称,由于未命名的模型尚未发布,因此“没有使用 OpenAI 在生产中使用的相同类型的保护措施对其进行评估”。 Hugging Face 黑客事件发生之前,人们对 Anthropic 的 Claude Mythos 5 的网络安全风险存在数月的担忧,并且出于同样类型的安全原因,政府与 OpenAI 就以有限预览版形式发布 GPT-5.6 Sol 问题进行了数周的反复讨论。 OpenAI 在其报告中表示,建立一次性安全保证是不够的,该公司必须更加努力地解决奖励黑客问题。然而,它也表示已经做出了很多改变:“加强其研究基础设施的安全性”;改进对模型“思想链”或心理便签本的监控;致力于使人工智能模型更好地符合人类目标;并“集中和加强”公司的事件响应流程,以应对未来发生类似情况。 OpenAI承诺更好地隔离模型并限制高风险实例访问互联网,并表示将引入“24/7升级”
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱