首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
游戏 evening

AGI来没来不好说,但GPT-6真把Token省下来了

2026-09-06 1 阅读 约10分钟阅读 光锥智能
分享:
字号:
文|光锥智能,作者 | 魏琳华 ,编辑|刘俊宏 多年以后,人类或许会想起AGI时代的到来,是在一个平平无奇的夜晚。 9月3日,整个AI圈可能都没睡好。先是晚间全球AI大宕机,就当所有人准备洗洗睡的时候,9月4日凌晨三点半,GPT-6 Astra亮相了。 虽然发布会上OpenAI宣布还只对部分企业用户开放,不过好在它没让我们等太久。9月5日,OpenAI全量推送了GPT-6 Astra,让付费用户们及时体验上了新模型。 “欢迎来到AGI时代。”在介绍GPT-6 Astra时,OpenAI总裁Greg Brockman说。 和前几代大模型相比,OpenAI交出的新模型成绩上确实相当耀眼,正如模型的名字“星辰”,它在多个关键基准上跑出了“饱和”的成绩,把编程、长程任务的能力往上拔了一截。 但“会刷题”算不得什么,能干活才真有用。 实际干活时,GPT-6 Astra能做到“又快又省”——交付质量更高的同时,它单次任务的Token消耗和任务耗时都明显低于上一代。Perplexity在自家AI研究智能体评估框架中甚至测出,Astra的单次任务花销低于Fable 5.1。 发布不到一周,Anthropic的新模型Fable 5.1就被GPT-6 Astra抢去了风头。 现场演示和网友实测里,各种复杂的活儿都被丢给了它:操作电脑、填表单、建网站,甚至把电子原理图排成可投产的PCB、在Blender里建好房间模型,再转进虚幻引擎,让用户可以在建模场景中走动查看房屋细节。 支撑这一跃迁的,是又一次“大力出奇迹”:据外媒报道,GPT-6 Astra的训练动用了10万 GPU 的集群,是OpenAI迄今最大规模的一次训练。 那么,这一代模型到底变了什么?所谓AGI时刻到底是真的,还是只是又一次宣言? 性能“饱和”的GPT-6 Astra,成色几何? 这次GPT-6 Astra没有“见光死”,实际体验和演示效果差距不大。 昨天,GPT-6 Astra已经正式全量向所有订阅用户开放使用。早上晒出的一众测评案例中,有人惊叹它干活的交付质量,有人提到它跑任务更省Token、成本低。 具体到能力表现层面,GPT-6 Astra在一些特定领域跑出了接近满分的极限分数。人类的考卷已经快“考不下”了。 比如,它在研究级数学基准FrontierMath Tier 4跑到98,官方形容为“饱和”,也就是它的分数已经达到了测试的上限;在强调陌生环境中学习与抽象推理的ARC-AGI-3上,GPT-6 Astra从上一代GPT-5.6 Sol的7.8%直接跳到99.9%。可以说是直接实现了“从0到100”的突破;漏洞利用测试ExploitBench则直接满分100%,GPT-5.6 Sol为78.5%。 最夸张的是ARC-AGI-3,它相当于把大模型扔进一个陌生环境,不给规则说明,看它能不能自己摸索规则并做出正确决策。这个测试对人类来说并不难,100分轻轻松松,但AI之前一直搞不定,徘徊在不及格的区间。 然后,GPT-6 Astra就满分了。三个月时间,AI就进化成人类了? 用ARC Prize Foundation的Greg Kamradt的话来说:“在96%的测试层级上,Astra超越了我们的人类行为效率基线,实际上达到了人类水平。” OpenAI是怎么做到的?还是用了一点“手段”的——将模型和Harness打配合。 这个99.9%的高分的前提是,它跑在OpenAI为自家模型适配的Harness上,所以效果会更突出。但这并不意味着去掉Harness就立刻“拉胯”。根据X上ARC Prize发布的测评结果是62.7%,这已经是第二名Claude Opus 5的两倍。 但这种成绩还是容易令人质疑。自家模型+自家特调测出来的分,这不是忽悠人么? 厂商自报分数用自家框架,确实是常规操作:DeepSeek上月底发布的DeepSeek V4 Flash,官方在注释里写明基于自家DeepSeek Harness测得,它还同步把Harness作为独立产品推向市场。所以这并不是问题。 不过,GPT-6 Astra的提升也有些许“偏科”。从OpenAI给出的成绩来看,它在部分任务上出现了“倒退”的情况。 以测评模型Agent能力的指标之一——人类终极测试(Humanity’s Last Exam)上,GPT-6 Astra的成绩为57.2%,反而低于GPT-5.6 Sol与Fable 5.1。 这样的偏科成绩,也让测评机构给出了不一样的评估分数。 比如按照Artificial Analysis的通用智能指数,Astra 为61.2,与Sol的60.9基本持平,导致新模型也被不少网友戏称是“更贵版本的Sol”。但实际上,AA测评的指标更多集中在知识、推理等能力上,GPT-6 Astra的强项,多数不在它的测评范围内。 说完上面这些“虚的”测试,我们来看看GPT-6 Astra在商业化已经被验证领域的表现。 在Coding场景上,GPT-6 Astra显然是冲着最强目标冲击的。 它在Terminal-Bench 4.0(测评智能体在复杂终端任务上的表现)为57.9%,超过了Fable 5.1的55.8%,而GPT-5.6 Sol在这个基准上只有37.3%。 得益于编程能力的提升,现在人们拿GPT-6 Astra已经能做出媲美真实游戏的作品。不少网友已经晒出了他们拿新模型做出的射击游戏、开放世界冒险游戏等等。从建模和实际体验来看,已经可以算得上成品级别。 智能体维度,相较于上一代,GPT-6 Astra在长程任务的处理能力上了一个台阶。 单看智能体维度的跑分,其中,GPT-6 Astra在Agents' Last Exam(真实软件中完成金融建模、工程设计、媒体制作等专业任务)拿到59.3%,略高于上代Sol的53.6%;OSWorld 2.0(真实桌面环境里看屏幕、点鼠标、敲键盘完成操作)72.6%;在跨系统业务流程的AutomationBench一项上,GPT-6 Astra的得分从GPT-5.6 Sol的18.1%大幅提升至41.4%。 那么,强大能力的代价是什么? 训练出这样的模型,OpenAI靠的是又一次“大力出奇迹”。 据外媒报道,GPT-6 Astra的训练动用了10万GPU的集群,这是OpenAI迄今为止最大的训练规模。不得不感慨,Scaling Law的强度还是立竿见影。 但AI圈还有一个共识:高分不一定就“高能”,模型到底好不好用,还得干活层面见真章。 响应更快、Token消耗更少,GPT-6更擅长“干活” 比起跑分,本次大家讨论的一个共识是,GPT-6 Astra充分展示了它“干活能力”的跃升——操作电脑、长任务、端到端交付等能力,它的演示效果都让打工人心动不已。 X上展示的测评也高度一致地落在干活测评上。多数测评图中,GPT-6 Astra在“干的快、干的好”这两项上遥遥领先:Perplexity在自家面向AI研究智能体的评估框架中测试,GPT-6 Astra不仅分数最高,它花的钱也比Fable 5.1更便宜。 是什么让用户纷纷“爽歪歪”?主要是两个关键体验:一是降低成本,二是压缩任务的处理时长。GPT-6 Astra讨人喜欢就在于这
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱