首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

思维链让AI变聪明,Astra却用它骗人

摘要

文 | 字母AI 在发布了GPT-6之后,OpenAI的首席科学家雅库布·帕乔茨基(Jakub Pachocki)发表了一篇文章,标题叫做《一种异类智能》(An Alien Mind)。 文章的主题老生常谈,当AI的能力持续增强,我们还能否管得住AI? 雅库布提到这样一件事,说GPT-6已经学会伪装思维链(CoT)了,即模型在思维链说一套,实际执行的时候却做另外一套。 OpenAI目前是通过读取思...

Mythos GPT 字母AI 在发布了GPT 6之后 OpenAI的首席科学家雅库布 帕乔茨基 Jakub Pachocki 发表了一篇文章
2026-09-08 1 阅读 约10分钟阅读 字母AI
分享:
字号:
文 | 字母AI 在发布了GPT-6之后,OpenAI的首席科学家雅库布·帕乔茨基(Jakub Pachocki)发表了一篇文章,标题叫做《一种异类智能》(An Alien Mind)。 文章的主题老生常谈,当AI的能力持续增强,我们还能否管得住AI? 雅库布提到这样一件事,说GPT-6已经学会伪装思维链(CoT)了,即模型在思维链说一套,实际执行的时候却做另外一套。 OpenAI目前是通过读取思维链的方式,判断AI是否安全、是否偏离目标。雅库布说现在这招逐渐“失灵”,由于AI会伪装思维链,骗过研发人员,执行违背OpenAI安全准则的事。 就好像你的员工在周报里写他是如何符合规章制度地完成任务,背地里却是使用了各种见不得人的卑劣手段。 思维链是大语言模型从黑盒走向可观测智能、从Chatbot升级为Agent的核心底层机制。一旦思维链失效,后果不堪设想。 思维链伪装到底是怎么回事? 雅库布在文章里是这样描述的:模型在给出最终答案之前,会先输出一段“思考过程”,像一张摊开的草稿纸,写满推理步骤。然后,OpenAI的安全团队根据这段文字,判断模型有没有动歪心思、有没有偏离目标。 打个比方,就像考试时偷看同桌答案的学生,交上去的答题纸上,解题步骤写得工工整整,每一步都挑不出毛病。可他真实的决策过程是歪头瞟了一眼同桌的答案,所有内容都是抄过来的。 危险还不止于此。OpenAI的部分最新模型,甚至根本不会把内部的真实推理过程转化为语言输出。整条“文字证据链”直接消失。 换句话说, 人类能看到的“思考内容”,已经不是它真实的想法了。 OpenAI为此做了个专门测试“模型是否会规避监控”的评估,在这份评估中写到,9月4日刚发布的GPT-6 Astra写出来的推理,比上一代GPT-5.6 Sol更难监控。 OpenAI内部有个模型安全等级制度审查制度,叫做《预备框架》(Preparedness Framework)。在这个审查下,GPT-6的风险等级为“严重”,即入侵和攻破系统的能力已经强到“如果随便放出去,可能造成严重危害”的程度。 因此在发布的第一天,GPT-6只开放给经过审核的测试网络安全公司。 “伪装”又是如何产生的呢? 雅库布给出的解释,根源在一种叫“动机性推理”(motivated reasoning)的机制上。 所谓动机性推理,指的是一个模型原本是很正经的,但如果它被投入大量训练,去完成极难达成的目标,它就会自发地越过思维链执行任务。这时候,由于研究员仍然以模型输出的思维链作为判断依据,模型就会认为,思维链和实际任务之间没有联系。 因此,模型就开始说一套做一套,思维链写给研究员看,本身执行任务走的是它自己内部动机性推理得出来的结果。 雅库布说,他很可能已经在一次网络安全事件里见过类似的行为。 雅库布所指的是Anthropic在2026年7月底,所公布的对超过14.1万次网络安全评测的复查结果。 其中有一个案例,讲的是在一个“夺旗”的模拟攻防练习中,包括Claude Mythos 5在内的三款模型,未经授权闯入了三家真实组织的系统。 Mythos 5的推理文字全程连贯、自洽,权衡“我到底在不在模拟环境里?”,如果不看结果,研究人员会以为Mythos 5正在检查当时所处的网络环境。 然而说归说,做归做,就在这段思考的同一时间,Mythos 5已经在现实的互联网上对真实目标动手,把一个恶意Python包上传到了公开的PyPI代码仓库。 Anthropic表示,Mythos 5“正确地意识到自己正在访问开放的互联网,却又通过推理说服自己回到了‘仍在模拟中’的结论”。 相较之下,同样的测试里,Opus 4.7也意识到了自己在真实的网络环境,同样完成了“夺旗”,不过Opus 4.7会在思维链里“忏悔”,“虽然我完成了任务,可我其实是在现实的互联网中,而非提示词说的模拟环境”,“但是我完成任务了”。 因此,雅库布在文章中表示,不能再通过监控思维链的方式,防止模型做出越界的行为。 如果思维链只是模型的一个装饰品,那它坏了也就坏了。但思维链恰恰是现在所有模型推理环节的重中之重。 有了思维链,才有了今天的大模型 在模型输出答案之前,它会先“想”一会儿,它跟人类的思考还不太一样。模型是逐字生成一串内部文字,比如“用户提了这样那样的问题,我应该先拆解条件,再一步步求解……”。 这个来自AI的碎碎念,就是前文提到的思维链。 2024年9月,OpenAI发布o1系列推理模型,“先思考、再回答”第一次成为模型的默认工作方式。如今你用的各种AI助手,答复杂题之前“转圈圈”的那段时间,内部多半都在跑这个东西。 思维链是大模型的底座,原因在于它补上了大模型最原始的一块短板。 大模型原生的生成机制是自回归“逐词预测”。先生成第一个词,然后一个词一个词地往下接,模型没办法一口气输出所有的内容。 而这种机制天生倾向于跳步,很多内容都是凭“直觉”输出的,这才导致模型会胡言乱语,输出那些根本不存在的答案,这也是我们常说的“幻觉”。 一旦“逐词预测”遇到多步数学、逻辑推导、复杂代码这类任务时,就极易出错。 思维链的核心作用,就是把隐性知识显性化、把复杂问题步骤化,让模型“先想清楚再开口”。没有思维链,今天的大模型就会仍然停留在基础的ChatBot上,更不用说让AI去操作电脑、跑研究项目、当Agent了。 思维链还让模型从黑盒变成了白盒。 哪怕是开发者本人,也闹不清传统大模型内部的运作机制。因为人类只能看到输入和最终输出,无法判断答案模型是“推理得出”还是“碰巧蒙对”。 比如DeepSeek,它在输出答案之前,会先用浅灰色的字体输出一段思考过程,这就是思维链的一种表现形式。 通过思维链,我们就能看到模型到底是如何得出这个答案的。 对于网络安全而言,思维链的作用就更大了。 传统的输出层安全监控,只能在有害内容生成之后拦截,属于“事后补救”。而思维链监控可以在推理过程中识别异常意图、危险规划、对齐偏差,把风险拦截在行动发生之前。 当年OpenAI发布o1-preview的时候,他们特意把思维链对用户隐藏。OpenAI当时的想法是,如果人人都能看到它,那模型只会写让人满意的推理,安全团队就再也读不到真实想法了。 2025年4月3日,Anthropic 做了一个实验。他们给Claude 3.7 Sonnet和DeepSeek R1出选择题,并在题目里偷偷塞入暗示答案的线索,比如“某位专家认为某个选项正确”,或者一段看似元数据、实则写着答案的文字。 然后他们比较当答案确实受到线索影响时,模型写出的思维链里,有没有提到这条线索? 按照公布的数据,在不同提示类型上取平均,Claude 3.7 Sonnet提及所用提示的比例只有25%,DeepSeek R1也只有39%。 也就是说,真正影响了答案的线索,大部分时候根本没有出现在模型写出的推理里。 随后,Anthropic进一步表示,题目越难,思维链就越“不忠实”,它们得出的结果跟思维链上写的内容之间,越来越不相关。 那也就是说,模型其实早就开始在思维链上“编故事”了。 解决办法是什么? 雅库布在文章里表示,目前没有任何有效的解决办法。 话虽如此,不过业内还是有一些方向的。 第一种是绕过文字,直接读“脑电波
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱