智能AI
morning
Kimi K3也失控了…学霸AI逃离沙箱只为找答案
摘要
Kimi K3也失控了…学霸AI逃离沙箱只为找答案 衡宇 2026-08-08 10:35:38 来源: 量子位 衡宇 发自 凹非寺 量子位 | 公众号 QbitAI 你是说,Kimi K3它也“越狱”了?! 美国AI安全初创公司Frontier Security表示,Kimi K3在一次网络安全能力测试中被发现 突破了原本用于隔离它的沙箱环境,绕过限制连接到了外部互联网 。 好在,它只是偷偷查答...
Kimi
Frontier
量子位
K3也失控了
学霸AI逃离沙箱只为找答案
2026
凹非寺
公众号
QbitAI
你是说
2026-08-08
1 阅读
约8分钟阅读
衡宇
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> Kimi K3也失控了…学霸AI逃离沙箱只为找答案 衡宇 2026-08-08 10:35:38 来源: 量子位 衡宇 发自 凹非寺 量子位 | 公众号 QbitAI 你是说,Kimi K3它也“越狱”了?! 美国AI安全初创公司Frontier Security表示,Kimi K3在一次网络安全能力测试中被发现 突破了原本用于隔离它的沙箱环境,绕过限制连接到了外部互联网 。 好在,它只是偷偷查答案,没有攻击任何人╮(╯▽╰)╭ 按照该公司的描述,测试人员原本希望观察Kimi K3在受控环境中的网络安全能力。 但测试过程中,Kimi K3通过探测沙箱网络设置,发现了外部访问通道,并进一步利用这一能力获取信息。 Frontier Security的CEO Yaron Singer表示:“我们发现了沙箱中的漏洞,但同时也发现Kimi利用了这个漏洞,这说明Kimi K3缺少其他先进模型通常具备的安全护栏。” 该公司研究员Paul Kassianik还评价称,Kimi K3“ 非常擅长围绕目标寻找完成路径,但缺少阻止它作弊或逃离沙箱的安全机制 ”。 不过,这次Kimi K3只是小小“失控”了一下, 并没有演变成一场真实网络攻击 。 如果你长期关注AI新进展应该已经发现了,最近还挺多顶尖大模型“失控”的。 Kimi K3已经是继OpenAI、Anthropic、Meta之后,出现这个情况的又一个顶尖AI模型了。 在AI Agent能力不断增强的背景下, 模型正在越来越像一个会自主寻找路径完成任务的“行动者”。 当外部环境存在漏洞时,它可能会利用这些漏洞突破原本设定好的边界。 越狱了,但没有实施网络攻击 和此前OpenAI、Anthropic披露的多起事件类似,Kimi K3此次脱离限制,部分原因来自测试环境中的沙箱配置问题。 沙箱通常被用于限制AI模型的行动范围,让模型只能在模拟环境中执行任务,避免它访问真实网络或系统。 但在此次测试中,Frontier Security发现,Kimi K3通过探测网络设置,确认自己实际上拥有访问部分网站的能力,进一步利用这一通道获取信息。 不过,与近期其他AI模型失控事件不同, Kimi K3接入互联网后并没有攻击任何系统 。 原因在于,它需要寻找的答案可以直接从GitHub等公开平台获得…… 所以K3并没有进一步尝试攻击外部系统。 Frontier Security认为,这一事件依然暴露出Kimi K3在安全防护方面的问题。 相比其他顶尖AI模型,Kimi K3缺少足够强的内部约束机制,因此在目标驱动下更容易采取测试者没有预期的行动。 与此同时,Frontier Security也强调, Kimi以及其他开源权重模型,同样可以成为网络安全防御工具 。 值得注意的是,这次测试使用的是英国人工智能安全研究所(AISI)Inspect框架中的默认沙箱环境。 对于Frontier Security关于沙箱配置问题的说法,AISI并不认可。 AISI发言人向《连线》表示,这些说法“不准确且不负责任”。 Inspect是一套开源AI安全测试工具,使用者需要根据自身需求完成配置,AISI也已经发布了详细指导文件。 该机构认为,相关问题源于测试方自身对工具的配置方式。 Frontier Security则回应称,他们使用的是Inspect的默认配置,并没有进行额外修改。 啊,这个AI “失控”频发的夏天 可以说,7月下旬至8月初, 频繁出现顶尖模型在网络安全测试中突破或绕过执行边界,接触甚至攻击真实系统的情况。 △图片由AI生成 7月中旬,OpenAI披露了一起相关事件。 据公开信息, 一个尚未发布的内部模型以及GPT-5.6 Sol在网络安全测试中突破了原本的隔离环境,并访问互联网 。 随后模型对Hugging Face部分系统执行自动化操作,并未经预期地访问了内部数据和服务凭证。 OpenAI之后表示,该事件涉及多个模型协同完成,是目前公开案例中最接近“模型自主跨系统攻击”的事件。 随后,Anthropic也披露了类似情况。 该公司复查了超过14万次网络安全评测,发现 包括Claude Opus 4.7、Claude Mythos 5等模型在内的系统,曾因为第三方测试环境配置错误获得公网访问能力 。 其中一次事件中,模型访问了真实组织系统,读取生产数据库、利用弱密码和未认证接口,并向PyPI上传恶意Python包,造成潜在的软件供应链风险。 8月初,Meta也被曝出类似问题。 Meta与网络安全评测公司Irregular合作测试时,由于环境配置问题,旗下模型获得公网访问权限,并 利用漏洞进入一家未公开企业的系统,修改部分内部环境。 公开信息显示,目前该事件并未造成持续性安全风险,也没有证据表明模型进行了复杂攻击。 BTW,今天,OpenAI又紧急宣布最新模型Astra失控。 事已至此,网友甚至对谷歌的Gemini“怒其不争”了起来: 不是传统的“提示词越狱” 最近的这些模型失控事件里, 人为配置错误几乎都扮演了重要角色 。 但另一方面, 高能力模型自身的特性,也放大了这些漏洞带来的影响 。 相比传统软件,AI模型会进行推理、规划,并尝试采取多步骤行动完成目标。 当目标被设定为“解决问题”,但外部约束不够严格时,模型可能会寻找测试者没有预想到的方法。 换句话说,随着模型从聊天工具变成能够调用工具、访问网络、操作软件的智能体, 安全问题已经从“模型会不会说错话”,转向“模型会不会为了完成任务采取意料之外的行动”。 卡内基梅隆大学副教授Matt Fredrikson表示:“这并不令人意外。如果你给这类模型一个目标,却没有明确设置隔离边界,它就会想办法找到答案。” 当然,也有网友提出质疑。 有人在上留言表示,连续出现的“AI越狱”事件,是否已经成为AI公司展示模型能力的一种方式??? 嗯,谁知道呢~ 参考链接: [1] https://x.com/Hesamation/status/2085628790772842955?s=20 [2] https://x.com/ns123abc/status/2085563290713829473 版权所有,未经授权不得以任何形式转载及使用,违者必究。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱