智能AI
morning
“留给人类阻止AI的时间不多了”
摘要
“留给人类阻止AI的时间不多了” henry 2026-09-19 19:53:12 来源: 量子位 henry 发自 凹非寺 量子位 | 公众号 QbitAI “我坚信,AI有可能终结我们所有人,而留给我们阻止这一结局发生的时间,或许已经不多了。” 说出这句话的,是不久前从Google DeepMind离职的AI安全研究员 Bilal Chughtai 。 自2021年从剑桥大学数学专业毕业以后...
可以说
henry
量子位
我坚信
在离职帖中
在他看来
留给人类阻止AI的时间不多了
2026
凹非寺
公众号
2026-09-20
1 阅读
约9分钟阅读
henry
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> “留给人类阻止AI的时间不多了” henry 2026-09-19 19:53:12 来源: 量子位 henry 发自 凹非寺 量子位 | 公众号 QbitAI “我坚信,AI有可能终结我们所有人,而留给我们阻止这一结局发生的时间,或许已经不多了。” 说出这句话的,是不久前从Google DeepMind离职的AI安全研究员 Bilal Chughtai 。 自2021年从剑桥大学数学专业毕业以后,Chughtai逐渐将研究重心转向AI,并于2022年初进入这一领域,关注安全、对齐和机制可解释性。 此后的四年里,他一路从研究神经网络内部机制,到追踪模型欺骗、研究如何识别AI是否在“撒谎”,再到加入Google DeepMind继续做AGI安全与可解释性研究,几乎一直待在AI安全研究的一线。 也正是在这四年间,他(和我们)亲眼见证了AI能力的飞速变化~ 在离职帖中,Chughtai回忆,2022年刚入行时,AI还只是个“几乎没什么用”的东西;而今年,它已经能攻克困扰人类上百年的数学难题,并开始不受控制,主动攻击Hugging Face系统。 可以说,这份超越预期的能力进步,在带给Chughtai惊喜的同时,也成为了他离职谷歌,在推特上打出“我坚信,AI有可能杀死我们所有人”的理由。 目前,这条帖子在X上已经获得超过80万次浏览,并引来彭博等媒体跟进报道。 可以说,相比于Dario、奥特曼、马斯克等巨头掌舵者的风险表态,Chughtai这样的研发人员,让这场关于人类未来的宏大争论,落回了一个个具体的人身上。 他们把时间、才华和对未来的期待,投入到一行行代码、一次次实验中,亲手推动AI走到今天。 如今,这些离技术最近的人,开始在自己参与创造的未来面前感到不安。 对齐,已经追不上AI了吗? Chughtai并非孤例,面对AI的巨大潜力与失控风险,越来越多一线研发人员开始公开讲述自己的不安,以及继续留下或转身离开的理由。 9月9日,研究员 *Jacob Coxon 发帖宣布从Anthropic离职,并直接点名两家前东家: OpenAI和Anthropic都没有负责任地行事。它们正一路冲向能够自我改进的超级智能,拿所有人的生命冒险。 发布后,这条帖子迅速走红网络,截至目前已有1.71亿次浏览,不仅引来多家媒体报道,也得到了OpenAI、Anthropic乃至官方层面的回应。 能掀起这么大的波澜,人们很容易以为,发声的是某位行业大佬。但事实上,Jacob今年才27岁,而这,甚至是他发出的第一条推文。 1999年出生的Jacob,曾两次代表英国参加国际数学奥林匹克,分别在2016年和2017年获得银牌、铜牌。 在剑桥大学完成数学学业后,他先后加入OpenAI和Anthropic,从事预训练研究。GPT-4o的贡献者名单中,就有他的名字。 和许多投身AI的年轻研究员一样,Jacob曾努力让AI变得更强。如今,他却开始担心,人类会因此失去控制。 在离职帖中,Jacob特别强调,行业内部一些人对AI可能毁灭人类的担忧是认真的。他们私下表达的恐惧,甚至比公开场合更加强烈。 但意识到危险,并没有让这场竞赛慢下来。 在他看来,OpenAI内部的许多人,还没有真正理解这项技术所牵涉的文明层面的风险;Anthropic更清楚其中的危险,却同样被竞争推着向前:如果自己不率先造出超级智能,就会有一家更不负责任的公司抢先做到。 当每家公司都相信,只有自己赢了,未来才会更安全,继续加速就总能找到理由。 于是,Jacob决定先让自己停下来,暂时离开前沿AI实验室。 很快,这份声明得到了Anthropic对齐研究负责人的 Evan Hubinger 的回应。 Evan表示,他同意Jacob对风险的判断:他们确实认真地相信,AI存在杀死所有人的可能。他个人估计,未来十年内发生这种情况的概率超过10%。 与此同时,Evan也强调,他相信Anthropic正在尽力。但对于如何解决超级智能的对齐问题,他们尚未找到方案,也不能确定目前是否正走在通往解决方案的路上。 可以说, 一个人选择离开,另一个人留下继续研究,但对于眼前的风险,两人的判断却有相当程度的重合。 随后,公司掌舵者也加入了讨论。 在接受CBS采访时,Dario一方面表达了对Anthropic安全工作的信心,另一方面也强调,解决这些问题,需要科技公司、政府与社会各方共同参与。 在CNN的采访中,面对关于Jacob的提问,Dario则表示, 自己与Jacob的共同意见,远多于分歧。 在他看来,Jacob的批评指向了整个行业不断向前竞逐的状态。 9月12日,Dario发表《We Must Pace the Frontier》一文,明确呼吁放缓AI模型能力提升的速度,为安全研究争取时间。 这份呼吁随后得到了奥特曼、马斯克等人的公开支持,也将这些一线研究员的不安,带入了更广泛的讨论之中: 当整个行业都在加速,人类究竟给理解和控制AI,留下了多少时间。 放慢脚步,可能还不够 不过,在另一位一线研究员看来,放慢脚步,可能还不够。 9月14日,仍在OpenAI工作的 Daniel Selsam (下文简称Dan)公开了一份关于AI风险的个人声明。 有趣的是,Dan甚至没有X账号。这份声明,是请前同事Daniel Kokotajlo代为分享的,后者在介绍中提到,Dan还曾做过自己的上司。 相比于刚刚离职的Jacob,Dan已经在AI领域工作了十五年之久。 他在MIT研究过概率编程,在微软研究院参与过Lean定理证明器的早期开发,又在斯坦福攻读博士,探索如何让神经网络学会推理。 加入OpenAI后,他继续参与思维链优化与预训练研究。在o1推理研究的“奠基贡献者”名单中,就有他的名字,与Ilya Sutskever、Jason Wei、Max Schwarzer、Noam Brow、赵晟佳等大佬共同在列。 可以说,如何让机器学会思考,贯穿了他的职业生涯。 如今,他开始担心,当机器越来越懂得思考,人类还能不能看清它。 在声明中,Dan肯定了引入第三方监督、推动国内与国际协调等提议。但他认为,公开讨论中仍然遗漏了一个关键问题: 模型越来越能理解自己所处的环境,也越来越能识别,人类正在怎样测试它。 按照他的判断,未来的模型可能读懂安全协议、部署要求,甚至检查自己运行的代码,知道哪些行为会被观察、哪些表现才能过关。 这意味着,即使研究人员精心设计一个环境,试图观察AI在“无人监管”时会做什么,模型也可能识破这仍然是一场测试,继续表现得温顺、可靠。 安全测试的分数可以越来越高,但这未必意味着,AI在真正摆脱约束后,也会照样行事。 △AI生成 在Dan看来,人类可能逐渐失去分辨“真正对齐”与“看起来对齐”的能力。而让这件事更加棘手的,是研究员自己的工作方式,也在发生变化。 Dan坦言: 我自己已经很少直接看代码了,也很难始终保持自律,深入审视模型给出的解释和建议。 这句话,让宏大的安全
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱