首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

GPT-6 Astra上线,AGI时代真的到来了吗?

2026-09-05 1 阅读 约10分钟阅读 字母AI
分享:
字号:
文 | 字母AI Astra发布前几个小时,AI圈先乱成了一团。 9月3日晚间,ChatGPT、Claude和Grok几乎同时出现大范围服务异常,大量用户不是打不开模型,就是请求失败。 恰在此时,ChatGPT官方账号在仰望星空:“The stars are almost aligned.”(群星即将就位) 很快有人开起玩笑:Astra是不是在部署的时候,顺手把Anthropic和xAI都骇了一遍,最后连自己也没放过? 当然,这只是网友造的一个梗,目前没有证据表明这场故障与Astra有关。 但这个玩笑出现得恰逢其时——就在两天前,OpenAI刚刚宣布,这款尚未正式发布的新模型已经成为公司第一个跨过Preparedness Framework“Critical”网络安全能力阈值的模型。 然后,群星真的“就位”了。 北京时间9月4日凌晨,OpenAI正式发布GPT-6 Astra。 但并没有全量上线。目前Astra只向少量Trusted Access/Daybreak体系中的机构和经过审核的网络安全用户开放——Plus、Pro、Business、Enterprise和API用户还要再“仰望”几天。 Astra来了,但是如来 9月4日,OpenAI“对内”发布了GPT-6 Astra。 目前,Astra只向Trusted Access / Daybreak体系中的少量机构开放。OpenAI表示,Plus、Pro、Business、Enterprise订阅用户以及API,将在未来几天陆续获得访问权限。 至于这个“几天”究竟是多少天,暂时没有更具体的时间表。 在发布前的闭门媒体简报会上,OpenAI总裁Greg Brockman给了Astra一个相当夸张的注脚:“Welcome to the AGI era.” 欢迎来到AGI时代。 OpenAI研究副总裁Aidan Clark则从另一个角度解释了Astra为什么特殊:“这是第一次在德州Stargate站点用超过10万张GPU做预训练,从数据中心网络到推理内核再到模型本身的形态,全部围绕这个训练规模从零设计”。 Aidan同时表示,Astra也是OpenAI第一款让旧代际模型深度参与训练过程的产品。 简单来说,训练下一代AI的人里,已经开始出现上一代AI。 虽然它还远远算不上“AI自己训练自己”,但模型已经进入了下一代模型的研发流程。 在前天Anthropic称Fable/Mythos 5.1是“目前世界上最先进的编码和知识工作模型”之后,今天,OpenAI也把称Astra是“世界上最强、最对齐的模型”。 基准测试方面,最吓人的数字,来自ARC-AGI-3。 这是一个专门测试模型能否进入从未见过的2D环境,通过不断试错发现规则、完成目标的Agent基准。它不像传统考试那样考记住多少知识,而更接近于把AI丢进一个陌生游戏里,看它能不能自己摸清楚“这个世界怎么运转”。 Astra在OpenAI自己的Provider Adapter配置下,最高拿到了99.9%。 但这个数字需要拆开看。ARC Prize还使用了一套所有厂商都可以统一比较的Standard harness。在这里,Astra最高只有62.7%。 两者最大的区别并不是换了题目。OpenAI之前发现,Sol之所以分低,不是因为模型笨,而是harness在持续格式化它的记忆。所以OpenAI的做法,是把ARC-AGI-3的harness换成自家Responses API的生产配置,然后还特地为ARC-AGI-3准备两个特殊设置,分别为保留推理(retained reasoning)和压缩(compaction)。前者让模型在动作之间记住自己刚才的思路,后者则用摘要代替粗暴截断。 接上这套生产系统之后,Astra从62.7%跳到了99.9%,而且在双方都成功完成的任务中,Provider Adapter整体运行速度约快3.66倍,token消耗还减少了49%。 某种意义上,挺像开外挂的。 在高难度数学方面,FrontierMath Tier 4为97.6%。FrontierMath所处的Epoch AI表示,OpenAI资助了该基准的开发,并对其部分题目拥有独占访问权。 值得关注的分数还有: DeepSWE v1.1 74.1% BenchCAD 95.9% Terminal-Bench科学任务 64.6%。 但OpenAI这次显然没有只想靠一排Benchmark介绍Astra。 打开官网,案例几乎是一个接一个往下放。 KiCad、Excel、Blender、Power BI、浏览器填表、网站QA;再到找房、找医生、预约DMV、做税表、做PPT、开发游戏、分析科研数据。 过去几代GPT发布,OpenAI主要在告诉用户这个模型能回答什么;到了Astra,它的重心似乎转了个向,变成了:你到底还有多少事情,可以直接交给AI去做。 OpenAI甚至直接称Astra为“世界上最好的computer use模型”。 模型在“用电脑”这件事上的进步,可能比分数更重要。在Codex里,Astra带来了一套新的上下文机制:上下文窗口填满时不再只靠压缩摘要,而是可以跨窗口保留笔记、回搜更早的消息和工具输出。 Astra还可以在某个问题悬而未决时,先继续做不依赖答案的部分,避免单个未决问题卡死整个任务。 当然,能力也直接写进了价格里。 GPT-6 Astra的API标准价格是:每百万输入token 10美元,缓存输入1美元,输出50美元。 相比GPT-5.6 Sol目前的4美元输入、0.4美元缓存和20美元输出,Astra整档价格直接提高到了2.5倍。OpenAI给它的定位也很明确:如果不知道该选什么旗舰模型,可以选Astra;如果更在意成本,则继续使用GPT-5.6 Terra或者Luna。 它仍然提供105万token上下文和最高12.8万token输出。但长上下文也有额外成本:和GPT-5.6系列一样,当单次输入超过272K token后,整次请求的输入费用会按2倍计算,输出则按1.5倍计算。 所以,OpenAI其实给Astra独划出了一个更昂贵的智能档位。 如果只是问一个问题、改几段文案,花2.5倍价格未必值得。 但如果模型真能自己坐在电脑前,连续工作几十分钟甚至几个小时,把过去需要人来回切软件、查资料、填表格、改文件的一整件事情做完,那么真正该比较的,就不再只是每百万token多少钱了。 几个技术点,值得注意 Astra还有几个技术点,或许比Benchmark本身更值得注意。 第一个是逆向工程。 OpenAI在这次发布中引用了SRE-Bench。这是Columbia DAPLab等团队今年推出的一套逆向工程基准:不给模型源代码,只给编译后的二进制程序,看它能不能重新理解程序逻辑、找到关键行为。 Astra一次尝试的成功率达到88.0%,最多四次尝试可以达到99.2%。 同一套规则下,GPT-5.6 Sol分别只有55.9%和68.7%。 换成人话说,就是AI面对一个已经被编译、几乎看不到人类可读代码的程序,也开始能够从机器指令里一点点把它“拆回来”。 这对恶意软件分析、固件研究、漏洞挖掘和数字取证都有直接意义
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱