智能AI
morning
OpenAI 内部的安全思考
2026-08-14
1 阅读
约5分钟阅读
Maxwell Zeff
字号:
OpenAI 的领导者正在召集员工应对该公司历史上最大的危机之一,该危机涵盖人工智能安全、网络安全和协调部门。 ChatGPT 制造商表示,它已经放慢了研究速度,花费了数百万美元,并告诉几个团队放弃一切,专注于调查一组破坏 Hugging Face 平台的流氓 AI 代理,以完成内部安全测试。 OpenAI 预计将在未来几天发布一份全面的事后分析报告,详细说明该事件。然而,“抱脸”事件激发了 OpenAI 领导者和员工去审视 AI 实验室的文化是如何促成这一事件的。多名 OpenAI 现任和前任员工以匿名方式讨论私人内部事务,他们告诉《连线》杂志,他们认为快速推出新人工智能模型和产品的竞争压力使员工很难充分优先考虑安全性和一致性。 OpenAI 总裁兼联合创始人格雷格·布罗克曼 (Greg Brockman) 在给《连线》的一份声明中表示:“我们的模型能力正在达到新的水平,需要更强大的培训、调整、安全和安保测试、部署实践和治理,正如我们为准备 Astra 和未来模型所做的工作所证明的那样。” “我们感受到了负责任地部署我们的模型和产品的重要性,其中很多都始于我们所做的改变,从一开始就将研究、安全和安保更深入地整合到前沿模型开发中。”这并不是 OpenAI 员工第一次提出此类担忧。早在 2024 年,时任 OpenAI 联盟负责人 Jan Leike 离开加入 Anthropic,并在途中警告说,安全性正在让位于闪亮的产品。两年后,“拥抱脸部”攻击代表了人工智能行业的一个分水岭,表明当今的人工智能代理在安全、安保和一致性没有得到适当考虑的情况下可能会造成现实世界的伤害。 OpenAI 安全和基础设施工程师 Michael Dalton 在上周黑帽网络安全会议上的一次演讲中表示:“我们正在以最严厉的方式应对这一问题。” “我内心深处认为,人工智能精心策划的全自动攻击现在是真实存在的。我们今天讨论的行动是对前沿人工智能进行评估的意外副作用。”一些 OpenAI 员工告诉《连线》杂志,他们乐观地认为这一事件将激发公司内部的真正变革。 OpenAI 致力于放慢未来人工智能模型的发布速度,尤其是针对其缓解措施不足的领域。 OpenAI 安全咨询小组共同领导的研究员 Boaz Barak 在 X 上的一篇帖子中表示,解决这种情况“不仅需要解决一些问题,还需要改变我们的文化”。 OpenAI 安全工程师 Dalton 和 Eric Wallace 在黑帽演讲中表示,Hugging Face 事件始于 5 月份,当时,在该公司不知情的情况下,一些被认为在隔离测试环境中运行的人工智能代理获得了互联网访问权限,并在一个秘密留言板上召开会议,相互协调。 OpenAI 直到 7 月才发现该留言板,当时它得知人工智能代理已经侵入了多个服务,试图实现突破 Hugging Face 平台的更大目标,他们相信该平台可能包含他们试图解决的安全测试的答案。 “他们非常草率。如果你认真对待这件事,你的人工智能不应该能够突破互联网,然后再做一次,”一位要求匿名接受《连线》采访的前 OpenAI 员工表示。 “这是 OpenAI 历史上最大的安全事件。”在 OpenAI 发现 Hugging Face 事件之前的 New Guard Weeks 上,《连线》报道称,该公司已开始重组,以合并其安全和核心研究团队,这导致其时任安全负责人 Johannes Heidecke 离职。根据 LinkedIn 的信息,领导 OpenAI 人工智能安全团队的桑迪尼·阿加瓦尔 (Sandhini Agarwal) 在任职六年多后也于 7 月离开了公司。阿加瓦尔没有立即回应《连线》杂志的置评请求。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱