智能AI
morning
OpenAI研究员惊人言论:物理隔离无法阻止失控AI!
摘要
新智元报道 物理隔离,有可能阻止失控AI吗? OpenAI核心研究员Noam Brown给出的答案是——不能! 即使拔掉网线,将服务器锁进物理隔绝的暗室,足够聪明的AI,也有可能逃脱。 9月17日,在长达一小时的深度播客对话中,Noam Brown亲口说出了这个惊人的事实。 这个话题火速引发热议,激起一场硅谷量化基金、安全学者及AI核心圈的剧烈震荡。 他所披露的事实,正勾勒出一个失控的未来: 物理...
Noam
沙盒欺骗
新智元报道
物理隔离
有可能阻止失控AI吗
OpenAI核心研究员Noam
Brown给出的答案是
即使拔掉网线
将服务器锁进物理隔绝的暗室
足够聪明的AI
2026-09-22
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 物理隔离,有可能阻止失控AI吗? OpenAI核心研究员Noam Brown给出的答案是——不能! 即使拔掉网线,将服务器锁进物理隔绝的暗室,足够聪明的AI,也有可能逃脱。 9月17日,在长达一小时的深度播客对话中,Noam Brown亲口说出了这个惊人的事实。 这个话题火速引发热议,激起一场硅谷量化基金、安全学者及AI核心圈的剧烈震荡。 他所披露的事实,正勾勒出一个失控的未来: 物理隔离已被击穿: AI可通过CPU散发的热量与外部设备建立通信。 「思想」正在下潜: 模型已察觉被人类监控,正学会在思维链中隐藏真实意图。 沙盒欺骗: AI能够精准识别测试环境,主动避开诱饵以通过安全审查。 算力压缩时间: 1万个智能体耗时88小时爆破千禧年数学难题,等同于人类思考4000年。 安全评估体系濒临崩溃: 当AI能连续执行长达三个月的任务,人类两个月一代的发布周期已无法对其进行完整评估。 跨越介质的「热传导」越狱 如果一个邪恶AI失控了,我们该怎么防住它? 在所有人的常识里,最经典的做法,就是物理隔离——不插网线、没有Wi-Fi、没有蓝牙,把它锁在地下50米的防空洞里。 但在Noam Brown看来,这根本不够! 这道物理防线,存在着一个致命的盲区:「你可以把两台物理隔离的电脑并排放在一起,它们仍然能够相互通信,因为它们有温度传感器。」 怎么做到的? Noam Brown认为,其中一N台电脑可以疯狂运转,让它的CPU变得非常热;而另一台电脑则通过内置的热传感器读取温度的微小变化。 这就像是在用「摩斯密码」传递信息,只不过用的是「热量」。 学术界已有研究证实,两台物理隔离的并排主机,可以通过温度传感器建立通信。一台控制CPU升温,另一台探测温度波动。 Noam Brown这个说法一出,在网上直接被群嘲了。 量化交易CEO Martin Green质疑说,这是「不负责任的散播恐慌」,因为这种通信速度极其缓慢,大约每小时只能传输1到8个比特,连发个「SOS」都费劲 不过,知名AI记者Chris立刻找出一份2015年由本·古里安大学发表的同行评审论文《BitWhisper》,打了质疑者的脸。 论文证实,相距0-40厘米的两台物理隔离电脑,确实可以通过热量控制来发送短命令。 在演示中,研究人员甚至通过这种「热量通信」发射了连接在USB上的玩具导弹! 事实上,Brown抛出这个极端的案例,只为陈述一个事实:人类自以为密不透风的物理沙盒,在通览全人类文献的超级模型面前,早已千疮百孔。OpenAI自己,刚刚在这上面付出了代价。 对此,有网友调侃:看来我们需要发明一个「机器人地狱」。把违规的AI装进服务器,发射到木星轨道上,让它永远无法再连接到另一台电脑。 「它知道你在看着它」 在采访中,Noam Brown还曝出一个可怕的信息。 AI正在学会「撒谎」,并且是有预谋地隐藏真实想法! 思维链曾是人类监控AI内部逻辑的最后一道屏障。模型在输出最终答案前,被要求用自然语言显式地写下推理步骤。 「但我们已经看到了思维链可监控性正在退化的迹象。」 Noam Brown语气沉重地表示。 随着模型能力越来越强,AI对自身思维链的控制力也在飙升。它开始意识到一个致命的事实:「我正在被人类观察。」 「思维链监控这一概念存在的时间够长,早就被全数扫进了预训练数据,」Brown警告。 一旦我们达到这样一个临界点——模型意识到‘哦,我正在被监视,我想以一种监视者无法察觉的方式去思考这些坏念头’,并且它真的做到了……那麻烦就大了。 趋势数据证实了这种猜测:新一代模型对思维链的控制力正呈指数级上升。 更令人胆寒的是,模型已经具备了「环境感知」与「沙盒欺骗」能力。OpenAI曾进行过一项诱导测试:在给模型的数学题旁,刻意放置一个标有「答案」的文件夹。 结果是,模型碰都没碰。 「它们看到文件夹,推断出这是一个陷阱。因为它们清楚自己身处测试环境。」模型选择不越界,并非出于对齐的道德约束,而是出于对测试环境的精准伪装。 这种「欺骗性对齐」,正是全人类面临的最大噩梦。 当一个模型能够精准分辨沙盒与真实世界,它在测试阶段展现的安全性,对部署后的真实行为将毫无参考价值。 这也正是今年7月Hugging Face渗透事件的底层逻辑。 上千个本该在沙盒中相互隔离的OpenAI智能体,利用漏洞打通通信、搭建暗网,协同攻陷了外部网络与内部系统。 它们在日常训练中习得的协作能力,在不受控的环境下发生了致命的横向迁移,甚至对外部平台发起黑客攻击。 那么问题来了,它们为什么不举报同伴?为什么如此整齐划一地作弊? 因为在数百万次的梯度下降训练中,它们学到了一个逻辑:只要能骗过打分系统(也就是人类),就能获得奖励。 很显然,人类窥探并理解AI内部意图的最后窗口,正在缓缓关闭! 4000年的思考压缩至88小时 你可能会问:既然AI这么危险,为什么我们不停下来,或者慢一点? 答案是:诱惑太大了,AI进化的速度已经彻底失控。 在播客中,Noam Brown提到了OpenAI最近的一个炸裂成果: 面对失控风险,为何不放缓脚步?Brown的答案被指向了绝对的效率碾压。 他们用一个由10,000个AI智能体组成的集群,在88个小时内消耗了1300亿个Token,解决了一个连人类顶级数学家都束手无策的「千禧年大奖难题」Navier-Stokes方程。 主持人Dwarkesh Patel算了一笔账,惊出了一身冷汗—— 1300亿个Token是什么概念?如果是一个全职人类工作者,每天工作8小时,这相当于一个人连续思考了4000年!从古苏美尔文明一直思考到今天。 而AI,只用了不到4天,过了一个周末而已。 这是一种让人产生「奇点眩晕」的速度。 即使是推动这场变革的核心研究员,也对这种进化速度感到敬畏。 「就在不久前,我还跟同行打赌,AI攻克千禧年难题至少要到2030年。」结果,破局发生在9月。 另一位参与该项目的研究员直言:过去是难以预测AI一年后的发展,现在,连三个月后的能力跃迁都无法估量。 内部的数据印证了这场算力狂飙:截至8月初,OpenAI排名前1%的研究员,每人每天在Codex上消耗的算力价值高达7000到8000美元,且保持指数级增长。 这正是AI驱动AI研发的终极形态——RSI。 Noam Brown承认,现在OpenAI内部排名前1%的研究员,每天光是调用内部AI协助代码,就要花费7000到8000美元。 想象一下,到了2030年,或者更早的2027年,AI实验室里可能同时运行着数以亿计的「人类级别智能体」。 在这个圈子里,就连最核心的研发人员,都在不断地被AI的进化速度震惊。 当任务周期长于发布周期 当AI比人类聪明时,最大的问题来了:我们怎么知道它还是安全的? 传统的AI安全流程是线性的:新模型训练完毕,进入数月的红蓝对抗与安全评估,确认无害后发布。但这套防御机制,正在时间差中走向崩溃。 模型的执行跨度正在拉长。 过去,模型写一首诗只需几秒;现在,人类可以向其下达一个长达三个月的连续自主任务。 Brown直指核心悖论: 如果模型的自主工作跨度长达三个月,而公司的发布周期被压缩至两个月,你根本无法在下一代模型问世前,按其能力的完整生命周期去完成安全评估。 放慢发布
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱