智能AI
morning
GPT-6带火循环变压器,阿里数十个布局
摘要
GPT-6带火循环Transformer,阿里早已布局 一水 2026-09-05 23:07:08 来源: 量子位 GPT-6 Astra一发布,recurrent depth突然一夜火了! 最早是The Information爆料,Astra使用了这种「循环深度」技术: 让同一组Transformer层反复运行,在不增加同等规模参数的情况下,把计算做得更深 。 ??模型不必继续疯狂「长肉」,也...
GPT
计算冗余
Mythos
6带火循环Transformer
阿里早已布局
2026
量子位
Astra一发布
recurrent
depth突然一夜火了
2026-09-05
1 阅读
约9分钟阅读
一水
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> GPT-6带火循环Transformer,阿里早已布局 一水 2026-09-05 23:07:08 来源: 量子位 GPT-6 Astra一发布,recurrent depth突然一夜火了! 最早是The Information爆料,Astra使用了这种「循环深度」技术: 让同一组Transformer层反复运行,在不增加同等规模参数的情况下,把计算做得更深 。 ??模型不必继续疯狂「长肉」,也能让现有参数多干几轮活,还有这好事。 不出所料,争议很快到来。。。 由于循环发生在hidden state里,中间过程未必会写成人类可读的思维链,模型会不会因此更难监测? OpenAI也由此被AI安全专家集体讨伐,甚至一度逼得首席科学家Jakub Pachocki亲自下场回应。 Jakub Pachocki还透露,自己正在憋一篇小作文以完整解释整件事情。 边等小作文,边让我们把目光拉回循环Transformer本身: 多循环几圈,模型真的就会更强吗? 学界其实早已踩坑。 同等算力下,省了参数的循环模型,经常打不过普通Transformer。 卡住它的,是一个相当现实的问题: 「计算冗余」 。 有意思的是,阿里早在11个月前就发了相关论文,靶子正是直指这个问题。 一篇MeSH ,解决循环内部怎么管理信息,向行业老大难「循环空转」发起冲击。 一篇SpiralFormer ,死磕循环之间「以什么精度计算」的粒度问题,让每一轮算力都花在刀刃上。 下一代架构候选,先过「计算冗余」这关 循环Transformer之所以让大家上头,是因为它给大模型提供了一种新的「变强方式」。 过去Scaling靠堆参数,24层就得24套参数,现在8层参数跑3遍,也能完成24层深度的计算。 效果能不能追上,还需要实验说话,但需要存储的参数确实少了。 用计算深度换参数规模,这笔账要是算得过来,想象空间可就大了 。 其实在Astra之前,Claude Mythos就曾把循环架构带火过一轮。 当时最抓眼球的,是一项图搜索成绩。 在GraphWalks BFS的256K至1M上下文测试中,Mythos Preview拿到了80.0%,GPT-5.4是21.4%,自家的Opus 4.6则是38.7%。 Mythos Preview得分接近GPT-5.4的四倍。 这个测试,可以理解成给模型一张复杂的关系网,让它从起点出发,一层层找出相连的节点。 找到一批,记住结果,再继续往下找,很考验连续多步处理信息的能力。 巧的是,循环架构擅长的,恰恰也是在hidden state里连续处理多轮信息。 于是Mythos的成绩一出来,外界很快便把两者联系到了一起。 至于它到底有没有采用循环架构,官方没有明说,答案也就留给了外界猜测。 不过从Mythos到Astra,大家期待的其实是同一件事: 模型不用一直长大,也能靠内部多算几轮,把能力提上去 。 这也让循环架构成为下一代高效大模型的候选路线之一。 不过问题来了,多算几轮,和多算出点东西,还真是两回事!! 看看这张图就明白了。 横轴从左到右,是信息经过模型各个模块的过程,中间三个蓝色柱子对应三次核心循环,也就是core loop。 纵轴表示计算前后hidden state的相对变化幅度。 第一个core loop更新很大,后面两个却迅速缩小。 注意,柱子变矮,并不意味着模型少花了算力,矩阵运算和Attention照样要跑。 这正是计算冗余的尴尬: 循环次数增加了,后续计算带来的增量却越来越小 。 来自阿里及合作高校的研究团队,正是从这里入手一路深挖。 他们先查清循环为什么空转,再想办法让后面几轮真正干上活。 MeSH:同时解决「计算无分化」和「信息过载」 团队首先给出的解法叫MeSH,现已被ICLR 2026接收。 论文首版在2025年10月公开,等于11个月前,他们就在给循环Transformer做「体检」了。 论文拉到底,先看效果。 在Pythia-1.4B级别的实验中,循环结构通过权重共享,减少了约33%的非嵌入参数。加入MeSH后,零样本下游平均准确率反而从普通Transformer的49.50%提高到50.56%,领先1.06个百分点 。 少了三分之一的非嵌入参数,成绩反而更好。 而MeSH新增的路由器参数,仅相当于普通Transformer非嵌入参数的约0.005%。 相较基础循环模型,额外计算开销也只有约0.014%,属于花小钱,办大事。 MeSH是怎么做到的? 团队直接钻进模型内部,检查模型每一轮到底干了什么,结果一下子找到了三个「摸鱼证据」。 第一个证据,是后面的循环越来越不爱动 。 团队比较了hidden state经过每轮计算前后的变化幅度,结果发现第一个core loop承担了绝大部分更新,到了后面几个core loop,状态变化迅速缩小。 第二个证据,是前后几轮越来越像 。 团队使用CKA分析不同循环之间的表示相似度,然后发现相邻轮次的hidden state高度接近。 同一组网络转了一圈又一圈,吐出来的东西却差不多,啊这!! 更扎心的是,第三个证据显示hidden state还越算越「单一」 。 奇异值谱分析显示,循环进行之后,模型表示逐渐挤进一个低维空间。 原本可以从多个方向表达的信息,被压缩到少数几个方向上,表达越来越单一。 三个证据摆在一起,模型的摸鱼套路就很清楚了: 第一个core loop猛干,后面几个core loop合着纯纯陪跑。 为什么会这样?这篇论文给出了两个诊断。 一个是「计算无分化」 。同一组网络反复使用,又缺少明确的轮次信息,很难在不同阶段形成分工,容易沿用相似的计算方式。 另一个是「信息过载」 。同一份hidden state既要保存原始输入,又要装下前几轮结果,还得承担当前计算。长期记忆和临时加工全挤在一起,最后谁也干不好。 说到底,得重新研究循环之间怎么「交接工作」。 传统循环模型里,上一轮算完,直接把hidden state整份递给下一轮,再由同一组网络接着算。 虽然后来大家打过补丁,怕它算着算着忘了原题,就把最初的状态重新加回来,但不管算到第几轮、当前处理哪个token,信息的搭配规则都是写死的。 MeSH想了一招: 不如干脆给模型加一个可以动态存取的「资料柜」? 这个资料柜叫Memory Buffer,由多个记忆槽组成,用来保存原始输入和循环过程中积累的信息,不必全部挤在当前hidden state里。 接着,MeSH给资料柜配了两个管理员。 一个是Write Router ,负责决定这一轮的新结果,应该按什么权重分摊到各个记忆槽。 另一个是Read Router ,负责在下一轮开始前,按不同权重读取各个槽位,重新组合成新的hidden state。 而且,这些管理员各有各的工作方式。 每轮循环都有自己的路由器,每个token也能得到不同的读写权重。 新信息各存多少,历史信息各取多少,都由模型自己学习。 看到这里,关
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱