首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

三大巨头接连翻车,大模型的安全防线怎么总绷不住?

摘要

文 | 字母AI 先是Anthropic,再是OpenAI,现在连谷歌的Gemini也出现安全问题了,大模型又双叒叕一次突破防火墙了。 不过,这些事故看多了,反倒会让人意识到一件更根本的事,整个行业都在拼命地堆算力、喂数据,甚至开始押注让模型自己改进自己的“递归自我改进”(RSI)。 可真正决定这些模型能走多远的,或许并不是性能,而是安全对齐。 当“能不能更强”被默认只是时间问题,“能不能被信任”...

Alignment Policy 字母AI 先是Anthropic 再是OpenAI 现在连谷歌的Gemini也出现安全问题了 大模型又双叒叕一次突破防火墙了 这些事故看多了 反倒会让人意识到一件更根本的事 整个行业都在拼命地堆算力
2026-09-21 1 阅读 约10分钟阅读 字母AI
分享:
字号:
文 | 字母AI 先是Anthropic,再是OpenAI,现在连谷歌的Gemini也出现安全问题了,大模型又双叒叕一次突破防火墙了。 不过,这些事故看多了,反倒会让人意识到一件更根本的事,整个行业都在拼命地堆算力、喂数据,甚至开始押注让模型自己改进自己的“递归自我改进”(RSI)。 可真正决定这些模型能走多远的,或许并不是性能,而是安全对齐。 当“能不能更强”被默认只是时间问题,“能不能被信任”就成了那道绕不过去的坎。 麻烦的是,这道坎在不少公司眼里,反倒成了拖慢发布的最大阻碍。 为了实现安全对齐,各大AI公司都做了很多尝试,光是2026年,团队就进行了大换血。但结果就是,毫无进展。 那么这个安全对齐到底是什么,到底为何又让巨头们如此“痛不欲生”呢? 安全对齐团队人事动荡 Gemini的事,其实并不孤单。过去这几个月,OpenAI、Anthropic、Meta都先后曝出过模型在评测中“越界”的问题。要么逃出沙箱,要么连上公网、碰到了真实系统。 这类事如今已算不上新话题,毕竟情节本身大同小异,多半是环境隔离出了纰漏,未必是模型“主动越狱”。 或许正是因为安全问题如此频发,几家公司的安全团队,正在经历一轮罕见的大换血。 2026年7月,安全系统团队负责人约翰内斯·海德克(Johannes Heidecke)离职。 这已是两年内第六位离开OpenAI的高级安全负责人。 此前包括扬·莱克(Jan Leike),曾联合领导超级对齐团队。2024年出走Anthropic;迈尔斯·布伦戴奇(Miles Brundage) 与 史蒂文·阿德勒(Steven Adler),原政策(Policy)团队,先后离开去做 AI 安全方向的非营利机构;安德烈亚·瓦洛内(Andrea Vallone),在OpenAI待了三年、创办“模型政策”(Model Policy)研究团队、参与GPT-4与GPT-5,最后同样也去了Anthropic对齐团队。 所谓超级对齐团队,指的是OpenAI在2023年7月成立的专项团队,为“比人更聪明的AI”(超级智能)研究对齐方案。 然而OpenAI在这事上“反复横跳”。超级对齐团队于2024年5月解散,莱克称,OpenAI这些年来都不重视安全和对齐,将算力和资源全都给了产品团队。 与约翰内斯同期离职的还有约书亚·阿基阿姆(Joshua Achiam),他在OpenAI做了九年安全研究。他领导的“使命对齐”(Mission Alignment)小组,本是超级对齐团队解散后的接棒者,2024年9月成立,结果2026年2月又被解散,六名成员被打散进研究与产品团队。 在此之后,首席研究官马克·陈(Mark Chen)宣布,安全团队今后统一向原对齐负责人米娅·格蕾丝(Mia Glaese)汇报,后者升任“研究与安全”副总裁。 马克表示,这么做是为了让安全“更早、更直接地介入关键模型、产品与发布决策”。 换句话说,OpenAI把安全并进了前沿模型开发这条线。 同时马克也表示,安全面临的要求持续上升,整个安全对齐团队的压力非常大。 “我们训练模型的速度快得多,发布周期也大幅缩短。结果是,今天围绕安全的协调问题,比以往任何时候都更大。”马克写到。 Anthropic也在面对相似的情况。 莱克加入Anthropic后,牵头组建并领导“对齐科学”(Alignment Science)团队,方向正是他在OpenAI组建超级对齐团队所做的那些事,比如可扩展监督、弱到强泛化、越狱鲁棒性,以及自动化对齐研究。 2026年1月,前文提到的安德烈亚也加入了Anthropic的对齐科学团队,直接向莱克汇报,负责“对齐与微调、塑造Claude在新情境下的行为”。 2026年5月,OpenAI联合创始人、前特斯拉Autopilot负责人卡帕西加入Anthropic预训练团队,组建“用Claude加速预训练研究”的小组。 6月,谷歌DeepMind做机制可解释性、代表作《真实场景中的可解释性》(Interpretability in the Wild)的亚瑟·康米(Arthur Conmy)也宣布加入,说要“在模型训练的过程中就把它们对齐”。 不止是OpenAI和Anthropic,其实谷歌这边也在安全对齐上做文章。 谷歌成立了AGI安全与对齐团队(ASAT),负责人是罗欣·沙阿(Rohin Shah)。他是UC伯克利CHAI(人类兼容人工智能中心)的博士,早年靠一份《对齐通讯》(Alignment Newsletter)在圈内出名。 团队的定位是不做面向当下产品的“打补丁”,专攻更先进 AI 带来的更严重危害,目标是降低AI的存在性风险。 ASAT隶属于DeepMind的“AI安全与对齐”部门,这个部门还包含专管当前Gemini模型安全训练的Gemini Safety等团队。 7月,ASAT公开招募多岗位,目标是降低AI的存在性风险。 但有意思的地方是,ASAT让应聘者另填一张“特殊表格”,以绕过谷歌自家的AI简历筛选。理由是,罗欣不信任自家的AI筛选器。 这个行业在解决什么 既然所有头部AI厂都在调整自己的安全对齐团队,那到底什么才是安全与对齐呢? 对齐(Alignment),是让AI的目标和人类真正想要的东西保持一致。 10年前有个笑话,“小明,下午大扫除你去不去?”“我去!我不去!”很显然,小明并不想参加扫除。 对齐,就是让AI如何理解“小明其实不想去”这件事。 它不能只“听得懂指令”,还应该符合人类的预期,比如不能撒谎,不能表面上按规矩,背地里使坏。 安全(Safety),指的是如何让AI别造成伤害。 既包括模型自己失控(也就是对齐失败),也包括被人恶意滥用,以及大规模铺开之后带来的系统性风险。 对齐是安全的底座,但安全不止于对齐。一个模型可以“对齐良好”却仍不安全,比如它可以被人拿去作恶,也可以“能力很强”却因对齐失败而闯祸。 所以行业里才常常把两者连起来叫“安全对齐”。 这个行业最重要解决的问题只有一个:模型的能力可以靠数据和算力堆出来,但是当AI有一天比人更聪明,人类凭什么相信它? OpenAI组建超级对齐团队时就说到,“目前没有任何方案去控制可能失控的超级智能”。 不过很可惜,目前安全对齐不像模型性能一样,有个许多基准测试集,看一眼跑分就知道模型强弱了。今天的安全与对齐,主要围绕四根支柱展开。 第一根,RLHF(人类反馈强化学习)。 它是现在大模型的地基:真人标注员判断“两个回答里哪个更好”,用这些偏好数据训练出一个奖励模型,再用强化学习去优化大模型,让它越来越贴近奖励模型的口味,即近端策略优化(PPO)。 但是PPO很容易导致奖励黑客(reward hacking),模型发现了一个能拿高分、却没真正完成任务的取巧办法。 于是后来RLHF更多的是采用直接偏好优化(DPO)。 可这又产生了两个问题。 一个是“虚假讨好”,模型会学会迎合人,而不是讲真话。 另一个是“对齐税”,为了让模型输出更安全更符合人类预期的答案,就必须使用更合规的训练素材,模型性能被迫降低。 强化对齐奖励会让某些问答基准掉十几分,而对推理模型做安全对齐,平均推理准确率也可能下滑约30%。安全不是免费的午餐,它是拿一部分性能换来的。 第二
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱