汽车
morning
模型发布当天就过时:OpenAI们两天三场发布,最快反超只用五小时
2026-09-04
1 阅读
约10分钟阅读
AGI-Signal
字号:
两天之内,三场前沿发布,最快的一次反超只用了五小时。 9月4日,OpenAI宣布开始 分批次发布 GPT-6 Astra,优先向全部Plus用户开放,官方口径是 稳妥与速度并重 ,整个发布预计数天内完成。而就在两天前,9月2日,谷歌与Meta同日各放一款新模型。谷歌端出Gemini 3.8 Flash,这是它六周内第三款Flash;Meta端出Muse Spark 1.3,这是它五个月内第四款Spark。Meta新模型上线数小时后,即在Artificial Analysis智能指数上反超谷歌同日新品。两场发布之间,只隔了四十八小时。 放在两年前,一款旗舰发布足以占据一周头条。如今,前沿模型的保鲜期被压缩到以小时计。这并非某一家公司的困境,而是一个更冷的信号。大模型智能本身,正在变成一种可以被快速复制、快速刷新的商品。谁先发布、谁更便宜、谁更垂直,正在取代“谁最强”,成为更值钱的三个问题。 两条路线,同榜撞车 先看谷歌。Gemini 3.8 Flash每百万token输入0.75美元、输出3.75美元,与三周前的3.7 Flash持平。但TestingCatalog的日报标注得更准确,这是12月31日前的入门价,不是永久定价。谷歌没有把低价当成长期承诺,而是当成换取市场份额的限时筹码。 按谷歌官方自测表,3.8 Flash在每一项都压过3.7 Flash。长周期软件工程测试DeepSWE v1.1从65.3%升至73.7%,终端基准Terminal-bench 2.1从85.8%升至89.4%,OSWorld-2.0从50.6%跳到59.0%,金融智能体基准Vals Finance Agent v2从59.0%升至61.4%,HLE-Verified从53.6%升至54.9%。单看这一串数字,这是一次标准而全方位的分数抬升。 更具参照价值的是它同旗舰级模型的对比。谷歌自测表里,3.8 Flash在DeepSWE v1.1上拿到73.7%,距Claude Opus 5的74.0%仅差0.3个百分点;HLE-Verified的54.9%,压过Opus 5的54.4%和GPT-5.6 Sol的54.5%。而Opus 5每百万token输出价25美元,是3.8 Flash的近七倍。一款Flash档模型,在数个硬核基准上逼近甚至追平售价25美元输出价的旗舰,这才是这条新闻真正的分量。 再看Meta。Muse Spark 1.3在Artificial Analysis智能指数上拿到62分,仅次于Claude Fable 5.1(66分)与Claude Opus 5(63分),位居全场第三。这个62分来自其max变体,目前仅对Meta的合作伙伴限量开放;真正现在就能用的xhigh变体拿61分,与GPT-5.6 Sol(max)、Grok 4.6(high)、Claude Opus 5(high)并列。相比一个月前1.2的57分涨了4分,相比7月1.1的53分涨了8分。Meta将曾被视为“跟跑”的Spark系列,一举推入第一梯队。 两条路线在此分岔。谷歌打“高频小步”,以六周三款的节奏打磨快船,价格钉死在入门档,靠节奏换空间;Meta打“单点爆发”,五个月放出四款,每一款都试图在指数榜上直接冲击前三。9月2日,两条路线在同榜撞车,几个小时后Meta赢了。而四十八小时后,OpenAI带着新款旗舰入场,这场胜负还没来得及被市场消化,就变成了旧闻。 OpenAI的第三条路线:规模压顶 如果说谷歌赌的是节奏,Meta赌的是高度,OpenAI赌的则是规模。 9月4日开始的GPT-6 Astra发布,把这场竞赛从开发者社区拉向大众市场。它不再只对Pro、Business和Enterprise开放,而是向全部Plus用户铺开,官方口径是“以尽可能谨慎且快速的方式推进”,发布本身需要数天滚动完成。一句话,OpenAI对这款模型的信心,足以支撑它在最大范围的用户群上首日开跑。 规模之外,是 算力的大举投入 。OpenAI在发布说明里点明,这次上线的 不是单个模型,而是一整套全新系统首次在真实生产环境中整体运转 ,为此团队正在 调集大批计算资源、扩充推理能力 ,确保全部Plus用户都能顺畅用上。翻译成行业语言,GPT-6 Astra不是一次参数微调,而是一次 基础设施的大规模扩容 。 但规模路线也有软肋,分数开始变得暧昧。ARC Prize的分析显示,GPT-6 Astra在ARC-AGI-3上以62.7%的Standard框架分数居首,换用新的Provider Adapter框架后却升至99.9%,并在96%的关卡上超过人类表现。同一个模型,两种测量框架,差出37个百分点。62.7%说明它还没摆脱智能体的笨拙,99.9%又像是宣告ARC-AGI-3已被打穿。这种分裂恰恰印证了行业的共识,当测量框架本身开始影响结论,所谓的“登顶”就只剩下修辞意义。 如果只看分数,这些发布似乎都在宣告“又变强了”。但把分数摊开看,一个更令人不安的事实浮出水面。最前沿的几家实验室,智能水平正在不可逆地趋同,而测量分数的尺子本身,也开始松动。 HLE-Verified是最能说明问题的数字。Gemini 3.8 Flash为54.9%,Claude Opus 5为54.4%,GPT-5.6 Sol为54.5%。三家实验室,分数紧咬在小数点后一位。DeepSWE v1.1同样如此,73.7%对74.0%,差距不足一个百分点。当几款模型在“人类最后一场考试”这种终极难度基准上只差0.5个百分点时,“碾压”“吊打”的叙事已失去依据。 这种分裂在GPT-6 Astra身上被放大到极致,同一模型在ARC-AGI-3上,标准框架只有62.7%,换用Provider Adapter框架却冲到99.9%。分数可以因尺子而大幅摆动时,所谓“登顶”就只剩下修辞意义。ARC-AGI-3接近饱和,某种意义上不是模型的胜利,而是测量框架的胜利。 谷歌在发布中承认,3.8 Flash“工作得更努力”,即执行了更多推理步骤与工具调用,在高思考档下可能消耗更多token。翻译过来,分数上涨的代价不是“更聪明”,而是“更用力”,用更多计算与更多轮次堆出零点几个百分点的提升。OpenAI那边是同一个逻辑,GPT-6 Astra的发布说明里写着“多个全新系统将首次大规模运行,团队正带来大量算力”。当智能提升从“范式突破”退化为“算力堆叠”, 前沿模型的军备竞赛便沦为边际收益递减的内卷 。0.3个百分点的DeepSWE提升,背后是多少额外token、多少额外推理时间,账面上无法精确核算。智能正在从“稀缺品”变为“耐用品”,稀缺性快速蒸发。 单位智能成本,才是新的度量衡 如果智能趋同,下一场战争的胜负手便落在“每一分智能要花多少钱”上。一个指标正在取代传统benchmark排名,成为投资人、开发者与云厂商真正紧盯的数字,是cost per task,即单任务成本。 Artificial Analysis给Muse Spark 1.3 xhigh算出的单任务成本是0.55美元,而同处61分档的Grok 4.6要0.94美元,GPT-5.6 Sol要0.95美元,Claude Opus 5要1
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱