首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

万字详解GPT-6 Astra,Sebastian Raschka带你读懂循环变压器与隐藏的思维链

摘要

机器之心编译 过去两周里,「循环深度」这个词变成了 AI 安全讨论的焦点。 起因是 OpenAI 新旗舰模型 GPT-6 Astra 发布前两天,The Information 援引内部消息称,Astra 用上了一种叫 rec urre nt depth(循环深度) 、也就是 looped transformer(循环 Transformer) 的设计,而这种设计「会让模型的部分乃至全部推理过程变...

Astra GPT Transformer OpenAI 循环深度 Sol looped https com gpt
2026-09-15 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心编译 过去两周里,「循环深度」这个词变成了 AI 安全讨论的焦点。 起因是 OpenAI 新旗舰模型 GPT-6 Astra 发布前两天,The Information 援引内部消息称,Astra 用上了一种叫 rec urre nt depth(循环深度) 、也就是 looped transformer(循环 Transformer) 的设计,而这种设计「会让模型的部分乃至全部推理过程变得不可见」。 模型正式上线后,争议进一步升温,OpenAI 首席科学家 Jakub Pachocki 亲自出面澄清,说他想避免「一场由混乱的报道引发的、奔向不可监控性的竞赛」,并强调包括 Astra 在内的当前前沿模型,其计算图深度与 GPT-4 的差距仍在两倍以内。 在一片语焉不详的转述中,著名技术博主、《Build a Large Language Model (From Scratch)》的作者 Sebastian Raschka 写了一篇长文,把技术细节摊开讲了一遍。 他先给出自己使用 Astra 的观察,包括它在 3D 渲染和图形任务上不成比例的领先、通过 Codex/ChatGPT 应用直接操作本地软件的能力,以及 OpenAI 采购数万台 Mac 作为强化学习环境背后的训练逻辑。随后他从 2018 年的 Universal Transformer 讲起,一路梳理到今年的开放权重模型 Nanbeige4.2-3B、字节跳动的 Ouro 和谷歌的 Mixture-of-Recursions…… 而对于最受关注的那个问题,他给出了否定回答。在他看来,循环 Transformer 并不是思维链变短、变得难以监控的原因,更合理的解释是 能力更强的模型犯错更少、回溯更少 ,因此不需要那么长的草稿纸——GPT-5.6 家族里 Luna 比 Sol 多用 80% 的 token 才达到相近性能,没有人因此说 Sol 的可解释性更差。Astra 系统卡确实承认推理轨迹的可监控性出现了退步,但没有证据表明可以把这笔账记在循环架构头上。文章最后还介绍了几项新研究。 以下是博客全文: 博客地址:https://magazine.sebastianraschka.com/p/gpt-6-astra-looped-transformers-and 过去几周发生了很多事。我相信眼下大家最关心的,还是 OpenAI 的 GPT-6 Astra 。尤其是它的性能表现、其中的 循环 Transformer / 循环深度 设计,以及那个说 Astra 在 「隐藏」自己推理轨迹 (也就是思维链)的传言。 所以在这篇文章里,我想先谈谈对 Astra 的一些初步印象,以及我对这一切走向的看法。然后,我会详细讲清楚什么是「循环 Transformer」,以及它和隐藏思维链究竟有没有关系(或者说,到底有没有关系)。 最后,在讲完循环 Transformer 的基础之后,我想介绍几篇近期论文带来的新洞见。 1. GPT-6 Astra 使用印象 先说第一件事。在进入架构传言和相关研究文献之前,我先简单总结一下我对 GPT-6 Astra 的一些观察和零散发现。 上周,OpenAI 大张旗鼓地发布了新模型 GPT-6 Astra。过去几天我一直在用它。这是一个极其出色的模型,很可能是截至本文写作时我用过的最好的模型。但它究竟改进了什么?又是怎么做到的? 1.1 Astra 的基准测试表现 Astra 是我目前用过的最好的模型。 而且相对于其他模型,它在 3D 渲染和动画任务上好得不成比例。我的意思是,虽然它几乎在所有类别上都甩开了前代 GPT-5.6(写作、数学、编程等等),但在图形类演示上的领先尤其明显。 这一点在基准测试里也有体现。比如下图所示,GPT-6 Astra 在数学和编程上确实很强。 图 1:三个常见编程基准和一个高难度数学基准的结果选摘。更多基准结果见 Astra;发布博客:https://openai.com/index/gpt-6-astra/ 其中一个亮点(图中未展示)是, Astra 在 ARC-AGI-3 基准上拿到了 99.9% ,而 GPT-5.6 Sol 只有 7.8%。这项基准衡量的是逻辑谜题求解与泛化能力的混合表现。不过,数学、编程和计算机操作类基准更值得关注,因为它们更接近真实使用场景。 回到前图右下角的 Artificial Analysis Coding Agent Index v1.4,它把多项智能体编程任务混合在一起。在这项指标上,GPT-6 Astra 明显处在前沿,但并没有大幅甩开对手。下面这张更综合的 Artificial Analysis Intelligence Index 也反映了同样的情况,它混合的是多种类型的任务,而不只是编程任务。 图 2:Artificial Analysis Intelligence Index,来自 https://artificialanalysis.ai Artificial Analysis 这套基准的一大优势在于它是独立的,因此相比模型开发方自评的基准,可能更值得信任。 具体的测试框架(harness)取决于基准本身。例如 GDPval-AA 和 AA-Briefcase 对所有参与对比的 LLM 都统一使用他们自己开源的极简框架 Stirrup。而在上图这版 Intelligence Index v4.2 中,Terminal-Bench v2.1 用的是 Terminus 2,τ³-Banking 用的是 τ-Bench 框架。单独的 Coding Agent Index 则还会对比不同的编程智能体框架。 对于使用统一框架的评测来说,这样的比较更接近同一标准下的对照。但与此同时,模型在训练时通常都是围绕某一个主力框架来开发的,对其他框架的微调相对较少。而且,这个主力框架往往本身就是为了契合并放大该模型的长处而设计的。 所以,某些智能体评测可能低估了 Astra 在自家主力框架下的实际表现。至于这对它的 Intelligence Index 得分影响有多大,需要在相同任务上跨框架对比 Astra 才能知道。 顺带说一句:一位同事最近向我建议(Claude Code 负责人也有类似推荐), 把你现有的一部分 AGENTS.md 内容和 SKILL.md 文件删掉或归档,也许并不是坏事 。因为新一代 LLM 在理解提示词、解决手头问题上已经更高效了。额外的手把手指导反而可能不必要地束缚新模型,导致更差的方案。 当然,我不是说以后再也别用 SKILL.md 文件了。对某些工作流来说,它们能提升复用时的效率,因为模型不必再重新摸索一遍。我想说的是, 有些工作流根本不需要描述 ;而且那些「旧」描述可能已经不再是最优解, LLM 自己或许能想出更好的方案 。所以,也许是时候更新或者重新生成这些指令文件了。 1.2 计算机操作能力 GPT-6 Astra 在图像和渲染任务上似乎格外强。当这类任务涉及与图形用户界面交互时,它们同时也展示出了 计算机操作(computer use) 能力,也就是模型通过 Codex/ChatGPT 应用来操作你本地电脑上的
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱