首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

拥抱脸部黑客行为可能表明 OpenAI 存在文化问题

2026-09-01 1 阅读 约3分钟阅读 Grace Huckins
分享:
字号:
这份报告没有满足克鲁格的希望。其 38 页详细介绍了特工不当行为长达数月的进展情况,最终导致 Hugging Face 黑客攻击,探讨了发生不当行为的技术原因,并列举了为防止未来发生类似事件而采取的步骤。但报告没有考虑公司文化在该事件中可能发挥的作用,报告也很少提及具体的人为错误。这更令人担忧,因为报告中提到的人为错误表明,可能存在重大的文化问题。早在五月份,训练中的模型就弄清楚了如何通过临时留言板相互交流,OpenAI 团队观察了这一行为。由于这种行为发生在训练期间,模型了解到秘密的代理间通信是完成任务的可行策略,但团队没有重新启动训练过程,而是允许模型继续使用权重中编码的风险信息。当这些模型在 6 月底进行测试时,他们再次创建了一个留言板,从而启用了拥抱面部攻击。这个留言板也被发现了,但做出回应的员工决定评估可以继续,报告表明,指挥链上层没有人意识到发生了什么,直到为时已晚。 Substack 上受欢迎的人工智能安全作家 Zvi Mowshowitz 表示:“要以这种方式失控,需要发生一系列很长的故障,一系列级联故障会导致越来越大的足迹,如果有人在任何时候注意到并发出警报,这应该结束。”Zvi Mowshowitz 引起了人们对 OpenAI 在第一个留言板被发现后未能停止训练的关注。报告称,OpenAI 员工在多个地点注意到了正在发生的事情,但要么没有发出警报,要么在发出警报时没有被听到。 OpenAI 的报告未能解决的是,为什么一家开发如此高风险系统的公司未能阻止这种严重的通信故障,尽管莫肖维茨对此表示怀疑。 “所有这些不同的失败都指向同一个方向,那就是 OpenAI 的安全文化不存在或者非常薄弱,”他说。当然,仅仅因为我们在报告中没有看到对安全因素的深入分析,并不意味着 OpenAI 没有在内部进行分析。但在给《麻省理工科技评论》的一封电子邮件中,约翰·霍普金斯大学名誉教授、组织安全专家凯瑟琳·萨克利夫对公开报告没有包含对公司实践和文化的任何反思表示担忧。她写道:“人们互动的方式——我们在组织生活中的日常习惯、例行公事和实践——会影响我们对正在发生的事件保持警觉和了解的能力,影响我们理解所见事物的能力,并最终影响我们应对事件发生的能力。”
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱