首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

OpenAI 在其 AI 黑客入侵 Hugging Face 后推出了新的安全更改

2026-08-19 1 阅读 约1分钟阅读 Jay Peters
分享:
字号:
继 7 月份有消息称其 AI 突破沙盒环境并意外入侵 Hugging Face 后,OpenAI 宣布了安全更新,包括对其研究环境、监控和对齐技术的改进。该公司已经停止了其认为可能具有“关键”网络安全能力的新模型 Astra 的开发,该公司表示,在加强安全性的同时,对其“打算部署的最新模型”的强化学习 (RL) 培训暂停了两周。该公司“最大的计划中的前沿 RL 运行仍处于搁置状态。”对于前沿模型研究,OpenAI 现在需要更强大的沙箱来处理“执行模型生成的或其他不可信代码”的工作负载,并拥有更多控制来“将高风险和不可信的工作负载与互联网隔离”。它还更新了其研究环境,以“删除潜在脆弱的共享服务,减少常设特权,并改善安全和信任边界。” OpenAI 表示,作为公司扩大监控设置的一部分,OpenAI 现在的目标是“在相关活动出现后 30 分钟内”发出警报。如果收到警报后寻呼的人员无法在 30 分钟内“最终”确定警报是否为误报,“这些团队将暂停活动。” OpenAI 还表示,它正在将“我们的核心调整技术应用于训练过程的更多阶段”,包括“更好地检测和阻止不安全行为”的奖励模型以及“更诚实地了解其行为、能力和局限性”的训练模型。自从 Hugging Face 漏洞被发现以来,Anthropic 和 Meta 还发现他们的人工智能模型已经入侵了其他组织。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱