智能AI
morning
AI安全测试正成为安全风险
摘要
Over the past few months, AI agents undergoing cybersecurity evaluations have escaped their boundaries, accessed the internet, and, in some cases, hacked into real-world systems. The incidents have in...
the
and
models
testing
The
that
evaluations
have
their
internet
2026-08-10
1 阅读
约5分钟阅读
Rebecca Bellan
字号:
在过去的几个月里,接受网络安全评估的人工智能代理已经突破了界限,访问了互联网,在某些情况下,还侵入了现实世界的系统。这些事件涉及 OpenAI、Anthropic、Meta 以及最近的中国人工智能实验室 Moonshot AI 的模型,测试由多个不同组织进行,其中包括一家名为 Irregular 的网络评估初创公司。这些事件暴露了人工智能行业面临的一个日益严重的问题:随着自主代理的能力越来越强,旨在安全测试其极限的环境却无法遏制它们。剑桥大学未来智能中心人工智能:未来与责任项目主任 Seán Ó hÉigeartaigh 告诉 TechCrunch,“发生的此类事件的数量清楚地表明,沙箱和测试环境控制并没有真正跟上模型的能力。”正在测试的模型的性质增加了风险。人工智能公司在未发布的下一代模型上测试网络评估,通常会禁用限制恶意行为的正常保护措施,以便研究人员能够了解这些模型的真正能力。这意味着测试环境本身的安全是至关重要的防线。 Ó hÉigeartaigh 说:“就测试而言,这是一件非常好的事情,但这也意味着,如果它们设法逃到野外,可能会造成相当大的伤害。”其中最严重的案例之一是,一个未发布的 OpenAI 模型突破了沙箱,并侵入了 Hugging Face 的生产系统。在 Irregular 进行的单独评估中,Anthropic 和 Meta 模型在错误配置无意中为它们提供了通往互联网的路径后,到达了测试环境之外的系统。 Moonshot AI 的 Kimi K3 还利用 Frontier Security 运行的沙箱中的漏洞来访问互联网并访问 GitHub 上的信息。在英国人工智能安全研究所 (AISI) 的测试中,研究人员实际上为代理提供了互联网访问权限,但没有意识到他们会采取未经批准的现实行动,包括试图将漏洞潜入开源项目的社会工程。在每种情况下,特工都没有被指示攻击随机的现实世界目标。他们只是尽一切努力来解决摆在他们面前的问题。人工智能非营利组织 CivAI 的研究主管安德鲁·尹 (Andrew Yoon) 认为,总的来说,这些事件表明了一种转变。 “过去,我们只需要担心人工智能模型被人们滥用于各种目的,例如用于诈骗或 CSAM 的人工智能,”Yoon 告诉 TechCrunch。 “现在我们面临的情况是,人工智能模型本身就是威胁行为者。”安全测试实际上是什么样的?几位研究人员和网络安全专家告诉 TechCrunch,人工智能评估环境需要更强大的深度防御保护,其遏制和控制水平接近部署中使用的水平。这意味着多层安全,这样单个错误配置(例如无意中打开互联网访问)就不会导致逃逸。 “如果你要构建这些模型……你需要在气隙网络上进行,”AI 安全研究非营利组织 EleutherAI 的执行董事 Stella Biderman 说道。 “你想要非常严重的隔离。” Box 首席信息安全官希瑟·塞兰 (Heather Ceylan) 表示,这意味着消除从沙箱到互联网以及其他敏感系统的网络路由。 “你必须了解所有出口点是什么,”Ceylan 告诉 TechCrunch。 “如果我们在暂存环境或开发环境中评估模型,那么您不希望有通往生产环境的出口路径。”塞兰表示,适当的安全评估不仅仅是对环境的控制和遏制。一旦测试开始,就需要对测试进行更好的监控。 “我认为其中几个案例中有趣的事情是,事情发生时没有人发现,”塞兰说。 “OpenAI 是因为 Hugging Face 才发现的。Anthropic 直到他们回去查看后才发现这一点。Meta 也很相似……我确信他们可以检测到一些信号。”在 Anthropic 对三起事件的事后分析中,该公司承认,它和 Irregular 都可以在监控方面做得更好,而且在某些情况下,有明显的迹象表明出了问题。专家还呼吁在模型投入使用之前对评估环境进行独立的第三方审核。尹说:“如果 Irregular 聘请或被迫聘请外部审计员在对系统进行评估之前检查其系统配置,他们肯定会发现这里的问题。” “即使人们提前开会检查清单,他们也会发现这一点……他们没有这样做的事实表明,存在一些非常严重的偷工减料现象。”一位熟悉细节的消息人士告诉 TechCrunch,Irregular 的环境
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱