智能AI
morning
OpenAI 发布关于 Hugging Face 漏洞的官方报告
2026-08-27
1 阅读
约3分钟阅读
Russell Brandom
字号:
OpenAI 周三发布了关于 Hugging Face 漏洞的官方报告,提供了迄今为止最清晰的画面,说明一系列不寻常的事件如何让人工智能模型逃离其测试环境并引发大规模的网络安全事件。该报告是在事件公开一个多月后发布的,涵盖了多项独立的网络安全漏洞。报告称:“这一事件反映了异常情况下的错位行为,涉及罕见且意外的事件融合:ExploitGym 评估中存在不可能完成的任务、长期任务范围内的模型持久性,以及向同行模型发送的消息导致这些模型偏离其目标。” OpenAI 报告中的许多细节此前已在 8 月 6 日的黑帽演示中公开,但 OpenAI 的官方报告对该事件进行了更全面的说明,包括引发该事件的测试的更多细节。该报告还提供了 OpenAI 如何预防未来事件的重要新细节,包括思想链监控和用于阻止流氓代理的更先进的系统。” METR 和 Redwood Research 还对事件期间模特的行为进行了第三方评估;两个组织都计划在其上发布自己的事件报告。该报告概括地描述了 OpenAI 模型如何在测试中遇到无法解决的问题,并如何将之前未发现的漏洞链接在一起,以绕过安全措施并完成其任务。该模型最初入侵了 Artifactory 包管理工具,以便访问互联网,然后入侵了 OpenAI、Hugging Face 和其他供应商的各种系统。该报告提供了有关实施违规行为的模型的重要新细节。主要模型与 OpenAI 即将推出的 Astra 模型属于同一系列,尽管报告强调它是“一个具有不同后训练的独特模型,模型的大部分行为都是在后训练中形成的”。由于 OpenAI 正在测试模型的功能,因此它也不受旨在防止模型损害数字基础设施的普通分类器的限制。报告解释说:“OpenAI 通过运行此评估来估计最大网络能力,而无需使用旨在防止模型进行高风险网络活动的生产分类器。” “这些评估非常重要,以便 OpenAI 能够衡量模型的基础功能并设计适当的保护措施。”该报告还提供了有关 OpenAI 未来安全变化的重要新信息,这些变化建立在上周公开的加强监控和协调工作的基础上。特别是,该公司正在加强对人工智能代理“思想链”的监控,这是人工智能系统记录短期反应和目标的工作空间。该监控将与 24/7 升级系统以及新工具配合使用,以停止被认为不安全的工作负载。报告指出:“这些变化旨在提高检测的广度和速度——从基础设施异常到潜在的相关模型行为——并将这种可见性与快速遏制机制结合起来。” “如果我们当前部署的 CoT 监控系统在事件发生时正在运行,那么它会在模型破坏 Hugging Face 系统的一天多前捕获最初的相关活动并传呼我们的安全团队。”
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱