智能AI
morning
Hugging Face 泄露后 OpenAI 制定了新的保障措施
2026-08-19
1 阅读
约2分钟阅读
Russell Brandom
字号:
周二,OpenAI 宣布了一批新的安全策略,重点是在模型测试时遏制安全事件。新的保障措施包括在开发过程中对模型进行更详细的监控,以及在培训后过程中更加强调一致性和安全性。该公司在博客文章中表示:“随着模型的功能变得越来越强大,与内部开发和测试模型相关的风险也随之增加。” “我们的监控、调整和安全标准必须领先于这些风险。”这些新措施是自 7 月 21 日披露的“抱脸”事件发生后,OpenAI 安全实践的首次公开变化之一。 OpenAI代表表示,这些措施并不是对抱脸事件的直接回应,部分原因是即将推出的Astra模型的网络安全能力,以及人工智能发展的整体进展速度。在同一篇文章中,OpenAI 透露,在 Hugging Face 事件发生后,它已暂停强化学习 (RL) 两周,但此后重新启动了许多风险较低的模型。帖子中写道:“我们最大的计划中的前沿 RL 运行仍处于搁置状态,同时我们会进行小规模的训练和评估,以评估模型行为、验证我们的保障措施,并在继续之前建立更多的一致性证据。” OpenAI 的研究副总裁 Amelia Glaese 在接受记者采访时强调,随着模型能力的增强,控制的严格程度将会增加,最大的模型将面临最严格的审查。 “我们已经制定了安全发展的要求和期望,”格莱泽告诉记者。 “这些要求和期望随着我们看到的风险水平而变化。”事件发生后,OpenAI 因网络安全实践不佳而受到批评,该事件导致模型通过破坏其网络上可访问互联网的工具来逃离训练环境。新的保护措施包括更强大的网络隔离措施,但具体细节仍然模糊。该帖子称,在新系统下,“工作负载或支持服务的单一妥协本身并不会导致对互联网或其他内部网络的未经授权的访问。”最强大的保护措施是监控系统,它将检查工具操作、可用的推理痕迹以及各种未经授权行为的活动日志。 OpenAI 表示,其目标是在相关活动发生后 30 分钟内发出警报。 OpenAI 估计该监控的计算负担将大约占所监控进程的 20%。该公司在即将发布的博客文章中承诺提供有关该系统的更多详细信息。该公司对该事件的官方事后分析也仍在等待中。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱