智能AI
morning
OpenAI 在 AI 代理失控后彻底修改了安全协议
摘要
OpenAI announced Tuesday that it has halted “a significant number” of training workloads and evaluations for its forthcoming frontier artificial intelligence model—codenamed Astra—while it implements ...
the
OpenAI
and
its
models
that
training
new
The
says
2026-08-19
1 阅读
约4分钟阅读
Maxwell Zeff
字号:
OpenAI 周二宣布,已停止对其即将推出的前沿人工智能模型(代号为 Astra)的“大量”训练工作量和评估,同时实施旨在解决网络安全风险的新程序。 ChatGPT 制造商表示,它正在引入许多新的监控、安全和对齐要求,以更好地应对其前沿人工智能模型日益先进的黑客能力。 OpenAI 负责研究和安全的副总裁 Amelia Glaese 在周二向记者举行的吹风会上表示:“我们必须集中精力,使这些培训达到这些要求和期望。只要达到目标,人们就无法继续完成工作量。” OpenAI 宣布的新保障措施包括一个更强大的系统,用于监控其人工智能模型。它实施的控制措施之一涉及思维链监控,这是一种分类器审查人工智能推理模型生成的内部“思维”过程的技术。该公司表示,更新后的系统依赖于计算成本高昂的“自动调查员”,该调查员分析潜在的相关行为,并旨在在 30 分钟内向人类发出警报。 OpenAI 还表示,它正在整个培训过程中扩大协调工作,以防止“奖励黑客”,即人工智能模型通过无意或不良手段实现目标的行为。该公司表示计划在未来分享有关这项工作的更多细节。最近几周,OpenAI 一直在忙于应对可能是其历史上最严重的安全事件。今年早些时候,一组流氓人工智能代理逃脱了内部测试沙箱,并突破了 Hugging Face 平台,以完成安全评估。 OpenAI 未能检测到代理的行为,尽管他们花了数周时间使用留言板来协调他们的行动,这引发了人们对该公司在模型变得更加强大时监控其模型的能力的质疑。这一事件引发了 OpenAI 内部的反思,迫使员工考虑其现有的安全、保障和一致性政策是否存在缺陷。 Anthropic、Meta 和中国人工智能初创公司 Moonshoot 此后披露了类似的事件,其中他们的人工智能代理逃离了沙箱,这表明这是人工智能公司面临的一个更广泛的问题。 OpenAI 现在正在分享更多关于其人工智能模型不断增长的网络能力的内部反应,并表示计划在未来几天发布更详细的“抱脸”事件事后分析。 “显然,我们所做的一切都是为了防止类似抱脸的事情再次发生,”格莱泽说。 OpenAI 在周二发布的博客文章中表示,Hugging Face 事件发生后,它立即开始努力保护其研究环境。该公司表示,现在需要更强大的沙箱来训练其人工智能代理,并实施了更严格的控制措施以将它们与互联网隔离。 OpenAI 首席科学家 Jakub Pachocki 告诉记者,该公司决定加强内部安全保障,不仅是因为 Hugging Face 事件,还因为最近发生的另外两起事件。其中之一是 Astra 的内部评估结果,该结果表明,与前代产品相比,人工智能模型在编码和网络安全任务方面的表现明显更好。另一个是 OpenAI 内部实现的人工智能进展的总体步伐,Pachocki 预计这种进展将继续下去。帕乔基说:“我们确实预计能力进步的速度会比过去快很多。” “这使我们真正专注于加强我们的保障措施。” OpenAI 最新模型的黑客能力的快速进步促使整个公司迅速做出反应。 OpenAI 总裁兼联合创始人格雷格·布罗克曼 (Greg Brockman) 在周一的一篇博客文章中表示,Hugging Face 事件表明该公司“低估了我们人工智能模型的现实世界网络能力”。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱