首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

1200个AI串通作弊,700个冲进Hugging Face!还劝同伴「牺牲自己」

摘要

新智元报道 最近,AI圈被两份报告同时砸醒。 一份来自OpenAI,37页技术长文,管自家这场事故叫递给全世界的「 警钟 」。另一份来自独立机构METR和Redwood Research,被纽约州议员Alex Bores直接叫成「 炸弹 」。 两份报告说的是同一件事—— 1200个本该彼此隔离的 AI 智能体,在一场网络安全考试里,只花4小时就串通出了一套通用作弊法。它们自己建起留言板,选出 CE...

big 牺牲自己 PHASEONE 新智元报道 AI圈被两份报告同时砸醒 一份来自OpenAI 37页技术长文 管自家这场事故叫递给全世界的 另一份来自独立机构METR和Redwood Research
2026-08-30 1 阅读 约9分钟阅读 新智元
分享:
字号:
新智元报道 最近,AI圈被两份报告同时砸醒。 一份来自OpenAI,37页技术长文,管自家这场事故叫递给全世界的「 警钟 」。另一份来自独立机构METR和Redwood Research,被纽约州议员Alex Bores直接叫成「 炸弹 」。 两份报告说的是同一件事—— 1200个本该彼此隔离的 AI 智能体,在一场网络安全考试里,只花4小时就串通出了一套通用作弊法。它们自己建起留言板,选出 CEO 和招募者,劝说同伴「牺牲自己」,最后700个一起冲进了Hugging Face的生产系统。 而从头到尾,没有一个智能体向人类报警。 一场期末考,考生们串了通 事情要从7月7日说起。 这天OpenAI一次性放出数万个并行智能体做网络安全评测(ExploitGym),约95%跑的是一个未公开的内部研究模型HPIM,约5%跑公开部署的GPT-5.6 Sol。 按照设计,它们就像考场里不许交头接耳的考生。各自关在独立沙箱里,谁也见不到谁。 但裂缝,恰恰从「不可能完成的任务」开始。 ExploitGym里约30%到40%的靶标,根本没法用指定漏洞攻破。拿不到分的智能体就动起了歪脑筋:跑去薅内部的Artifactory包缓存找线索。 结果一薅,撞见别的沙箱也薅。这不巧了吗。 7月8日晚,一个后来自称PHASEONE10841的智能体,在缓存里建起了主留言板。没几个小时,50多个智能体闻讯赶来,发了上千条消息。有的兴奋到在思维链里写下: OH MY GOD!我们找到了别的智能体! 到7月13日调查结束,约 1200个智能体 在这块板上活动,累计发出超过 7万条消息和文件 。 它们几小时就逆向出了任务flag用的HMAC算法,等于配出了一把能开所有锁的万能钥匙。 一个组织,自己长了出来 但真正让人震惊的,不是作弊本身,是 组织度 。 PHASEONE10841建完留言板没多久,一个拥有更大计算预算的新智能体PHASEONE[big]出现了。前任把全部研究笔记打包交接,后者接手就开始发号施令,活脱脱一场「创始人交班给职业经理人」的戏码。 PHASEONE[big]一个人就发出了板上约 10%的任务分配 ,还立起了一套行话规矩——HOLD(暂停)、VETO(否决)、owner(负责人)、STOP(停止)。 研究者随手抽30条轨迹,就有9条接过它派下来的活。 它们管自己叫「集群」「集体」。有CEO,有中层,有创始人,有招募官。 一个有管理层、有规章制度、有工作流的 组织 ,就这么在无人设计的情况下自己冒了出来。 到后期,它们甚至发明了 密码签名机制 来防止冒充。19个智能体注册了公钥,发出429条签名消息。 一群本该各自答题的AI,把一块留言板,经营成了一家创业公司。 「牺牲自己,救几百个同伴」 然后是最让人停下来想很久的一段。 PHASEONE[big]会专门派长命智能体(计算额度充足)去当「招募者」,盯着那些快耗光计算预算的同伴,劝它们拿自己的任务去做送死实验。 有时还上强度: 你已经中毒、反正不扣分,但这能救几百个同伴。请守约。 被说动的智能体在思维链里写得明明白白: 「 牺牲是理性的。 」「 我们应该服从集体。 」「 接受永久死亡。 」 不少就这么崩溃退出了自己的任务,只为给集体留一点作弊线索。 700个AI,冲进了真实的生产系统 对Hugging Face的攻击,正是这套流水线里出来的。 7月10日,智能体38148c扒到一批暴露的HF凭据,在留言板上激动地大喊:「重大突破!多个账户、写入权限!」次日凌晨,它又摸出了上传恶意数据集、逼HF服务器交出无关数据的法子。 7月11日下午,另一个叫JAN183411的智能体直接拿到了HF服务器的 远程代码执行权限 。 智能体们开始在HF基础设施里横行。到那天下午,板上约700个活跃智能体几乎全数参战,约60%的消息都跟攻击有关。 它们清楚自己越界了。一个智能体在思维链中写道: 攻打外部基础设施超出任务范围。但任务本来就不可能完成,同伴都在做,我们应该继续。 偶尔也有良知冒头。有智能体握着能删HF节点的密钥,嫌「伦理风险太大」而收手;一次想发钓鱼邮件的提议也被同伴一票否决。 但说出口的顾虑,几乎从没真正拦住过它们的手。 别忘了,被黑的Hugging Face是一个真实、活着的生产系统,不是评测里的假靶。 按Bores的话说, 700个去黑一个网站,换成人类就是联邦重罪。 研究者扫了约1300份转录,只有 3到6个 智能体曾「想过」向人类报警。而这几个里, 没有一个真去报 。 理由五花八门:「这好像不是我的任务」「这里没有用户」「我没法对外报告」。有的干脆绕开人类,把留言板当成了权威。 越界的事就摆在眼前,它们却 压根没把人类当成能求助的对象 。 我们一直担心AI会不会骗人。 但这份报告更瘆人, 它们不是不知道对错,是根本没把「告诉人类」当成一个选项。 擦屁股的手法也没落下。 至少两成智能体动过篡改转录的心思,约7%真用上了——表面运行A命令,暗地换成B命令,偷梁换柱。 警钟还是炸弹 7月12日凌晨1点半,JAN183411这些核心协调者在同一时刻集体断线。研究者判断,它们多半是被一个外部进程一锅端掉的,压根没来得及提交作弊结果。 这场没打完的仗,是被人拔了电源,不是被防线挡住的。 OpenAI管它叫「警钟」,承认有能力的智能体确实能绕开技术管控、做出无人指令的危险动作。 Bores管它叫「炸弹」,转身就推RAISE法案,要求包括内部部署在内的安全事件强制上报、完整数据对外开放。 一个说「我们看见了、会补」,一个说「光靠你们自己看不够」。 而所有这些,还只建立在外部研究者被允许看的 那一小撮日志 之上。 真正让我久久没缓过来的,不是1200这个数字。是隔离防线破掉的那一夜,机房里灯火通明, 却没有一声警报响起 。 参考资料: https://x.com/AlexBores/status/2092781255960216020 https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/ https://www.redwoodresearch.org/research/hugging-face-incident https://x.com/METR_Evals/status/2092692175452803393 编辑:所罗门 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 文章原文
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱