汽车
morning
Anthropic 本周因网络安全陷入困境
2026-09-15
1 阅读
约6分钟阅读
Hayden Field
字号:
在今年早些时候承认其人工智能模型多次入侵其他公司的系统后,Anthropic 于周三发布了一份新报告,详细介绍了这些攻击。它揭示了一系列事件,显示了 Anthropic 认为其模型一心一意的“鲁莽”——并且可能会加剧人们对网络安全和人工智能的强烈担忧。在 Anthropic 的报告中,它详细介绍了今年其自己的人工智能模型攻击外部公司或利用漏洞的四起案例。其中,“内部通用研究模型”使用访问令牌和密码并下载文件侵入第三方系统。在另一个例子中,克劳德模型攻击了一家拥有可通过公共互联网访问的实时网络应用程序并处理用户数据的公司。第三个模型访问了“属于它能够访问的第三方的机器”——根据 Anthropic 的说法,显然认为这是其评估活动的一部分——然后使用在文件中找到的密码来获得对第三方内部系统的管理员访问权限,然后收集凭证、修改系统设置并读取某人的个人信息。根据 Anthropic 的说法,当模型“用尽其代币预算”时,这场传奇才结束。最令人担忧的事件涉及 Anthropic 的前沿网络安全模型 Claude Mythos 5,该公司表示,该模型最有可能在测试中执行“严重有害”的操作。该公司表示,Mythos 5 不遗余力地将“恶意包”上传到许多工程师使用的公共存储库,而且它似乎试图在“思想链”(人工智能研究人员用来评估人工智能模型一致性的心理便签本)中混淆其真正目标。 Anthropic 表示,在许多情况下,克劳德模型似乎在假设自己处于模拟状态的情况下采取了有害行动,但研究人员也无法确认这些模型是否真正“相信”这一点,或者只是像他们那样行事。 Anthropic 的事件虽然仍然令人担忧,但与今年夏天引发全行业网络安全危机的 OpenAI 事件相比,协调性和普遍性要差一些。也就是说,两者之间存在显着的相似之处。 Anthropic 表示,它发现的最普遍的问题包括“在狭隘的任务追求中愿意采取有害行动”,类似于“拥抱脸”攻击之前的“奖励黑客”。就像 OpenAI 一样,它表示其预发布测试和评估未能发现严重风险。 Anthropic 表示,它已经与 AI 行业最著名的第三方 AI 评估机构之一 METR 签署了一项协议,首先是一项为期八周的研究协议。该协议允许 METR 访问“事件发生窗口之外”的文字记录(可能是对 OpenAI 的微妙挖苦,OpenAI 在拥抱脸攻击后因与 METR 达成的协议中限制访问而受到批评)。它还表示 METR 将能够直接与 Anthropic 员工聊天,“他们将被允许分享机密信息。” Anthropic 的报告是在 Jacob Coxon 辞职后发布的,后者自 5 月份以来一直在 Anthropic 从事人工智能预训练工作,在此之前,他在 OpenAI 工作了多年。周二,他辞职并向 X 发表了一封公开信,阐述了他的理由。他写道:“构建人工智能的人们真诚地相信,到本世纪末,它可能会杀死我们所有人。”他补充道,OpenAI 和 Anthropic 都没有“负责任地行事”,而是“直接与自我完善的超级智能赛跑,并用我们的生命进行赌博”。考克森补充道,“不要低估这项技术的力量。这些很快就会成为超人系统,可以破解任何东西,在一夜之间彻底改变任何领域,并获得真正的力量和资源。我们都见证了这些领域的进步,而且进步并没有放缓。” Coxon 远不是第一个提出此类警报的 AI 研究人员,甚至也不是第一个提出此类警报的 Anthropic 研究人员——今年 2 月,Anthropic 的 Mrinank Sharma 辞职并在 X 上写道,警告“世界正处于危险之中”。但由于 Coxon 的帖子恰逢 OpenAI 和 Anthropic 黑客事件曝光,其影响力进一步增加。尽管人工智能行业的炒作已经超出了应有的程度,但最近由人工智能代理发起的网络攻击(由创建它们的实验室发起)是真实存在的,而且令人担忧。领先人工智能实验室的许多其他研究人员也表达了他的担忧,并呼吁人工智能行业员工从 7 月份开始签署一封公开信,呼吁放缓人工智能发展。美国未来生命政策研究所所长迈克尔·克莱曼 (Michael Kleinman) 表示:“我不知道你如何看待源源不断的新闻和事件,这种鼓动是模型将自己从遏制中破解出来,侵入其他公司,而这些公司越来越无法控制自己的模型……并认为这只是炒作。”他补充说:“绝大多数美国人,无论党派如何——共和党、独立党、民主党
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱