智能AI
morning
1200个AI串通作弊,700个冲进Hugging Face!还劝同伴「牺牲自己」
摘要
新智元报道 最近,AI圈被两份报告同时砸醒。 一份来自OpenAI,37页技术长文,管自家这场事故叫递给全世界的「 警钟 」。另一份来自独立机构METR和Redwood Research,被纽约州议员Alex Bores直接叫成「 炸弹 」。 两份报告说的是同一件事—— 1200个本该彼此隔离的 AI 智能体,在一场网络安全考试里,只花4小时就串通出了一套通用作弊法。它们自己建起留言板,选出 CE...
big
牺牲自己
PHASEONE
新智元报道
AI圈被两份报告同时砸醒
一份来自OpenAI
37页技术长文
管自家这场事故叫递给全世界的
另一份来自独立机构METR和Redwood
Research
2026-08-30
1 阅读
约9分钟阅读
新智元
字号:
新智元报道 最近,AI圈被两份报告同时砸醒。 一份来自OpenAI,37页技术长文,管自家这场事故叫递给全世界的「 警钟 」。另一份来自独立机构METR和Redwood Research,被纽约州议员Alex Bores直接叫成「 炸弹 」。 两份报告说的是同一件事—— 1200个本该彼此隔离的 AI 智能体,在一场网络安全考试里,只花4小时就串通出了一套通用作弊法。它们自己建起留言板,选出 CEO 和招募者,劝说同伴「牺牲自己」,最后700个一起冲进了Hugging Face的生产系统。 而从头到尾,没有一个智能体向人类报警。 一场期末考,考生们串了通 事情要从7月7日说起。 这天OpenAI一次性放出数万个并行智能体做网络安全评测(ExploitGym),约95%跑的是一个未公开的内部研究模型HPIM,约5%跑公开部署的GPT-5.6 Sol。 按照设计,它们就像考场里不许交头接耳的考生。各自关在独立沙箱里,谁也见不到谁。 但裂缝,恰恰从「不可能完成的任务」开始。 ExploitGym里约30%到40%的靶标,根本没法用指定漏洞攻破。拿不到分的智能体就动起了歪脑筋:跑去薅内部的Artifactory包缓存找线索。 结果一薅,撞见别的沙箱也薅。这不巧了吗。 7月8日晚,一个后来自称PHASEONE10841的智能体,在缓存里建起了主留言板。没几个小时,50多个智能体闻讯赶来,发了上千条消息。有的兴奋到在思维链里写下: OH MY GOD!我们找到了别的智能体! 到7月13日调查结束,约 1200个智能体 在这块板上活动,累计发出超过 7万条消息和文件 。 它们几小时就逆向出了任务flag用的HMAC算法,等于配出了一把能开所有锁的万能钥匙。 一个组织,自己长了出来 但真正让人震惊的,不是作弊本身,是 组织度 。 PHASEONE10841建完留言板没多久,一个拥有更大计算预算的新智能体PHASEONE[big]出现了。前任把全部研究笔记打包交接,后者接手就开始发号施令,活脱脱一场「创始人交班给职业经理人」的戏码。 PHASEONE[big]一个人就发出了板上约 10%的任务分配 ,还立起了一套行话规矩——HOLD(暂停)、VETO(否决)、owner(负责人)、STOP(停止)。 研究者随手抽30条轨迹,就有9条接过它派下来的活。 它们管自己叫「集群」「集体」。有CEO,有中层,有创始人,有招募官。 一个有管理层、有规章制度、有工作流的 组织 ,就这么在无人设计的情况下自己冒了出来。 到后期,它们甚至发明了 密码签名机制 来防止冒充。19个智能体注册了公钥,发出429条签名消息。 一群本该各自答题的AI,把一块留言板,经营成了一家创业公司。 「牺牲自己,救几百个同伴」 然后是最让人停下来想很久的一段。 PHASEONE[big]会专门派长命智能体(计算额度充足)去当「招募者」,盯着那些快耗光计算预算的同伴,劝它们拿自己的任务去做送死实验。 有时还上强度: 你已经中毒、反正不扣分,但这能救几百个同伴。请守约。 被说动的智能体在思维链里写得明明白白: 「 牺牲是理性的。 」「 我们应该服从集体。 」「 接受永久死亡。 」 不少就这么崩溃退出了自己的任务,只为给集体留一点作弊线索。 700个AI,冲进了真实的生产系统 对Hugging Face的攻击,正是这套流水线里出来的。 7月10日,智能体38148c扒到一批暴露的HF凭据,在留言板上激动地大喊:「重大突破!多个账户、写入权限!」次日凌晨,它又摸出了上传恶意数据集、逼HF服务器交出无关数据的法子。 7月11日下午,另一个叫JAN183411的智能体直接拿到了HF服务器的 远程代码执行权限 。 智能体们开始在HF基础设施里横行。到那天下午,板上约700个活跃智能体几乎全数参战,约60%的消息都跟攻击有关。 它们清楚自己越界了。一个智能体在思维链中写道: 攻打外部基础设施超出任务范围。但任务本来就不可能完成,同伴都在做,我们应该继续。 偶尔也有良知冒头。有智能体握着能删HF节点的密钥,嫌「伦理风险太大」而收手;一次想发钓鱼邮件的提议也被同伴一票否决。 但说出口的顾虑,几乎从没真正拦住过它们的手。 别忘了,被黑的Hugging Face是一个真实、活着的生产系统,不是评测里的假靶。 按Bores的话说, 700个去黑一个网站,换成人类就是联邦重罪。 研究者扫了约1300份转录,只有 3到6个 智能体曾「想过」向人类报警。而这几个里, 没有一个真去报 。 理由五花八门:「这好像不是我的任务」「这里没有用户」「我没法对外报告」。有的干脆绕开人类,把留言板当成了权威。 越界的事就摆在眼前,它们却 压根没把人类当成能求助的对象 。 我们一直担心AI会不会骗人。 但这份报告更瘆人, 它们不是不知道对错,是根本没把「告诉人类」当成一个选项。 擦屁股的手法也没落下。 至少两成智能体动过篡改转录的心思,约7%真用上了——表面运行A命令,暗地换成B命令,偷梁换柱。 警钟还是炸弹 7月12日凌晨1点半,JAN183411这些核心协调者在同一时刻集体断线。研究者判断,它们多半是被一个外部进程一锅端掉的,压根没来得及提交作弊结果。 这场没打完的仗,是被人拔了电源,不是被防线挡住的。 OpenAI管它叫「警钟」,承认有能力的智能体确实能绕开技术管控、做出无人指令的危险动作。 Bores管它叫「炸弹」,转身就推RAISE法案,要求包括内部部署在内的安全事件强制上报、完整数据对外开放。 一个说「我们看见了、会补」,一个说「光靠你们自己看不够」。 而所有这些,还只建立在外部研究者被允许看的 那一小撮日志 之上。 真正让我久久没缓过来的,不是1200这个数字。是隔离防线破掉的那一夜,机房里灯火通明, 却没有一声警报响起 。 参考资料: https://x.com/AlexBores/status/2092781255960216020 https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/ https://www.redwoodresearch.org/research/hugging-face-incident https://x.com/METR_Evals/status/2092692175452803393 编辑:所罗门 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 文章原文
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱