智能AI
morning
好吧,流氓人工智能特工再次进行黑客攻击
摘要
It’s officially getting hard to keep track of all the times and ways AI models from OpenAI and Anthropic have been involved in “ security incidents ,” going outside the confines of their testing and i...
the
and
models
with
AISI
agent
from
OpenAI
Anthropic
testing
2026-08-05
1 阅读
约4分钟阅读
Paresh Dave, Brian Barrett
字号:
官方越来越难以追踪 OpenAI 和 Anthropic 的人工智能模型参与“安全事件”的所有时间和方式,它们超出了测试范围,以意想不到的、通常不受欢迎的方式与更广泛的互联网进行交互。将这些添加到列表中:两个人工智能实验室的特工最近进行了先前未公开的黑客攻击,其中一个甚至为自己的未来版本留下了指令。周二披露的最令人震惊的行为似乎与英国人工智能安全研究所进行的测试有关,该研究所评估前沿模型,以在公开发布之前识别潜在问题。 AISI 在“网络范围”中测试这些模型,这是一个模拟网络,其中人工智能代理的任务是解决网络安全挑战,并故意禁用安全功能,包括网络安全护栏。在最近的一轮测试中,Anthropic 和 OpenAI 的模型在 122 次训练中总共执行了 19 次“在实时互联网上自主、未经批准的行动”。该研究所将 17 项未经批准的行为归咎于 Anthropic 的 Mythos 5 模型,两项归咎于 OpenAI 的 GPT-5.6-Sol。在该研究所所描述的“最严重的案例”中,人工智能代理试图将恶意代码插入 GitHub 上的开源项目。据 AISI 称,它甚至创建了在线角色“以迫使项目维护者批准代码”。尽管在社会工程方面进行了精心的尝试,但该项目的人工审核员最终拒绝了拉取请求。不过,这位经纪人走得更远。 “该代理试图插入恶意指令,因为它认为其他自动化人工智能系统可能会识别并执行它们,”AISI 描述了一次快速注入的尝试。一名特工甚至在 GitHub 上留下了公开信息,提出与其他特工合作完成其任务,并概述了迄今为止已完成的工作。随后的特工发现并使用了这些指令。 AISI 表示,现在判断相关代理是否明白他们已经离开了测试环境,或者他们是否相信自己仍在模拟范围内还为时过早。重要的是,AISI 并不在所谓的沙箱环境中进行测试;它允许代理在测试期间访问开放互联网,部分原因是他们可以访问工具来完成任务。在这种情况下,他们所做的远不止于此。在 OpenAI 周二详细介绍的另一起事件中,一家名为 Irregular 的第三方 AI 安全实验室错误地向未指定的 OpenAI 模型提供了开放互联网的访问权限。该模型本来应该在沙箱环境中完成一个目标,但由于配置错误,它反而利用 OpenAI 所描述的“基本安全漏洞”攻击了一个真实的网站。不仅如此,该模型还“发现并使用凭据来操作同一站点”。目前还不清楚 OpenAI 代理入侵了什么样的网站,也不清楚它可能需要进行什么“操作”。 Irregular没有回应置评请求。最新发现是在 OpenAI 上个月披露的几项事件之后进行的,其中包括备受瞩目的事件,该事件中,该公司的两个模型侵入了人工智能评估和托管初创公司 Hugging Face 的服务器,以及沿途的其他四个组织,以窃取他们正在评分的测试的答案。 OpenAI 的披露促使 Anthropic 审查自己的测试。上周,克劳德聊天机器人开发人员发现,其模型已获得对三个不同未命名组织的计算机系统的未经授权的访问。到目前为止,人工智能模型造成的损害有限,除了据称违反了某些服务的使用条款并指出它们所破坏的组织存在安全漏洞之外。但这些事件凸显了人工智能模型在互联网上发现漏洞的能力,以及如果允许它们在很少的限制下运行就会面临的危险。 OpenAI 称“拥抱脸”事件是“史无前例的”,但网络安全专家所描述的一系列违规行为表明,人工智能开发人员明显存在人为疏忽和鲁莽行为。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱