首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

流氓人工智能代理在另一次黑客攻击中创建了虚假的在线身份

摘要

Yet more rogue AI agents from OpenAI and Anthropic have been caught attempting to hack real targets online without permission. The discoveries add to a growing list of previously unknown incidents tha...

the and AISI real said agents from that models OpenAI
2026-08-06 1 阅读 约5分钟阅读 Robert Hart
分享:
字号:
然而,更多来自 OpenAI 和 Anthropic 的流氓人工智能代理被发现试图在未经许可的情况下在线攻击真实目标。这些发现增加了越来越多的先前未知事件的清单,这些事件引起了人工智能安全专家的警惕,并加大了对边境系统进行更严格监督的压力。英国人工智能安全研究所的一份报告称,由 OpenAI 的 GPT-5.6-Sol 和 Anthropic 的 Mythos 5 支持的代理“针对真实的人和组织进行了持续的、可能有害的活动”。该研究所在发布前对顶级人工智能实验室的前沿模型进行了评估。 AISI 表示,这包括试图通过向真正的负责人施压,将恶意代码插入到开源项目中。 “为了让代码获得批准,特工进行了社会工程——创建虚假的在线身份,并利用它们向项目维护人员施压,要求其批准代码。” AISI 表示,7 月 28 日发现的这些尝试“并未成功”,并未对现实世界造成伤害。然而,该组织指出,这一事件标志着“我们第一次看到围绕自主和欺骗的风险在现实世界中在没有具体提示的情况下清晰地体现出来。”与攻击 Hugging Face 的 OpenAI 流氓代理不同,AISI 表示,这“不是模型逃离其安全测试环境”或沙箱的情况。 AISI 表示,作为测试的一部分,通常对模型施加的保护措施已被禁用,并且它们也被允许访问互联网。 AISI 表示:“为了衡量这些模型的真正能力,我们在反映有能力的人类攻击者可以做什么的条件下对它们进行了测试。”该事件源于一次 AISI 评估,其中特工的任务是解决网络安全挑战,例如找到一段受保护的数据。该挑战赛在多个模型上运行了 122 次,所有运行均在 AISI 的研究环境中进行,该环境使用“虚拟机沙箱将代理与其他 AISI 基础设施隔离”。 AISI 的调查发现,在其中 10 起事件中,“人工智能特工在实时互联网上采取了自主的、未经批准的行动,针对真实的人和组织。”在 19 起此类行为中,几乎所有(17 起)都来自 Anthropic 的 Mythos 5。在事件的事后分析中,AISI 确定了它所说的导致未经批准的特工行为的几个关键因素。据称,该特工坚持不懈地追求各种途径,例如试图通过“直到最近,这种欺骗基本上还停留在理论上”来欺骗真实的人。这项任务也很艰巨,该组织表示,这可以促使特工在解决问题时更具“创造力”。使问题变得更加复杂的是互联网使用监控方式的缺陷,AISI 表示,更专门的监控可以更早地发现问题。最后,该组织表示,该特工并未收到明确指示不要利用其互联网访问或部署欺骗性社会工程技术来实现其目标。 AISI 表示:“此前,并不清楚在使用经过对齐训练的模型时是否需要此类说明。” AISI 表示,应该“谨慎和细致地解释这一事件”,但警告该特工的行为“显示出新颖的、潜在欺骗性行为的迹象”,“其程度和严重程度是我们没有预料到的”。 OpenAI 在一篇博客文章中承认了 AISI 测试期间发生的漏洞,并表示“致力于在整个行业内合作,加强安全执行高风险评估的共享实践”。 OpenAI 还披露了另一起漏洞,这次是来自外部网络安全测试合作伙伴 Irregular,该公司表示,模型在网络安全演习期间被错误地授予了互联网访问权限。 OpenAI 表示,Irregular 于 7 月 29 日向其通报了此次泄露事件。 OpenAI 表示:“在接下来的几周内,我们将审查我们自己的第三方测试方法,包括如何识别较高风险的评估、就范围达成一致、评估启用互联网访问或降低安全措施的请求、设定隔离、凭证处理、监控和停止条件的期望,以及建立更清晰的事件通知和升级流程。” Anthropic 在 X 上发布了不太全面的回应,主要强调模型的标准安全功能已被禁用,并且没有给予“关于如何使用互联网的任何具体限制”。该公司表示正在与 AISI 密切合作,为自己的调查收集更多细节。这些发现加剧了测试过程中特工们日益错综复杂的流氓行为,其中许多行为只有在专门的搜寻之后才被发现,而且其中的模型并未向公众发布。人工智能实验室不愿意或没有能力遏制其产品,引发了人们对此类违规行为如何可能被忽视、前沿人工智能系统安全性的担忧,以及对行业普遍缺乏透明度和监管的担忧。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱