智能AI
morning
奥特曼最后一战!4个月后,交付AGI
摘要
新智元报道 AGI已经有人宣布实现了。 就在本周三的财报电话会上,老黄撂下一句: 对于许多任务来说,我们可以说我们已经实现了AGI。 而同一天,一篇两个多小时的奥特曼长访谈也放了出来。他给的日期是2026年底。 对奥特曼来说,这4个月不只是一场技术冲刺。明年上市之前,他必须先把AGI这张牌打出来。 打不出来,等他敲钟的时候,前面已经站着一个先上市、市值高出一倍、还在盈利的对手。 这一仗,OpenA...
ARC
AGI
Opus
新智元报道
AGI已经有人宣布实现了
就在本周三的财报电话会上
老黄撂下一句
对于许多任务来说
我们可以说我们已经实现了AGI
而同一天
2026-08-30
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 AGI已经有人宣布实现了。 就在本周三的财报电话会上,老黄撂下一句: 对于许多任务来说,我们可以说我们已经实现了AGI。 而同一天,一篇两个多小时的奥特曼长访谈也放了出来。他给的日期是2026年底。 对奥特曼来说,这4个月不只是一场技术冲刺。明年上市之前,他必须先把AGI这张牌打出来。 打不出来,等他敲钟的时候,前面已经站着一个先上市、市值高出一倍、还在盈利的对手。 这一仗,OpenAI退无可退。 老黄先喊了,AGI已经实现! 那场电话会上有人问他,OpenAI这些公司这么玩命地追AGI,你怎么看。 老黄的回答是,这问题现在没什么好争的。整个行业连「智能」到底是什么都没谈拢,更别说拿哪把尺子去量AGI。 他手里握着的是另一样东西。 英伟达的AVO架构,在一项专门考「智能体能不能长时间自己干活」的测试 ARC-AGI-3 上,拿到了 100%满分 。 顺着这个成绩,他抛出了一个野心极大的预测: 在不久的将来,英伟达可能只需要维持4万名左右的人类员工,但他们将拥有40万,甚至400万名数字员工。 但那张满分卷,拆开只有一层壳 众所周知,ARC-AGI-3的玩法相当「不讲武德」。 把智能体直接扔进一个陌生游戏里,规则和目标一概不给,全靠自己按、自己看、自己猜。手里只有一块 64×64的网格 和几个按键,每个环境至少六关,第一关五步能过的,到第六关得走五十步。 人玩着都费劲,模型更没好到哪去。 关键在这儿:AVO用的模型,是Claude Opus 5。 然后英伟达给它套了个壳。权重一个参数没动,直接从30.16%跑到了满分。 在这里, 真正起作用的是两样东西。 一是持久记忆,上下文满了记忆也不清零,智能体从当前状态接着干,不用把同样的坑再踩一遍。 二是监督器,它自己不干活,只在旁边盯着整条搜索轨迹,一发现原地打转就把主智能体拽向别的策略。 不过,严格来说,这张满分卷其实并不算数。 英伟达官宣三个多小时后,ARC-AGI之父François Chollet发推表示: 在公开演示集上拿到100%,不等于在ARC-AGI-3基准上拿到100%。这就好比说你通关了一款电子游戏,其实你只是清掉了新手教程关。 按ARC Prize自己的说明,公开集本来就不是用来打分的,真正算数的是半私有集和私有集,而AVO的成绩单上这两项都没有。 更微妙的是,这已经是六周内的第三张满分卷。 Tycho在7月底率先拿下,VISTA在8月5日又拿了一次,AVO是第三个。三家的解法完全不同,但驱动的模型清一色是Claude Opus 5。 宣布AGI的人越来越多,但能造AGI的,似乎还是那两家。 而这张牌,还没有人真正打出来。 奥特曼凭什么敢说年底? 在专访中,奥特曼信心十足 : 到年底,OpenAI内部会出现一个他愿意称之为AGI的系统。 首席研究官Mark Chen则相对保守一些。在他看来,OpenAI距离AGI还差20%。 这话听着狂,但他们手里确实是有点东西的。 今年OpenAI内部定过一个非常明确的目标:造出一个可以真正干活的自动AI研究实习生。 而这个「AI自动化实习生」,就是Astra。 给Astra一个实验想法,它能在OpenAI的代码库里自己写代码、跑实验、交结果。 把一篇论文扔给它,Astra可以完成过去一名顶级人类研究员一周左右的工作量。 16个智能体,开了场圆桌会 不久前的一场内部演示上,几十位大客户高管亲眼见了一回。 大屏幕上,16个AI智能体把一道研究级数学题拆成一堆子问题。 它们各自领活,中途互相核对,最后拼出一份完整的证明。 这完全看着,已经是一支配合默契的团队在开闭门会了。 第二个演示更震撼。 Astra打开常见的桌面软件,在不同应用之间来回横跳,建文件、改内容、调度任务,快得根本不像人在敲键盘。 看到的人无不感慨,Astra这次彻底打通了「持久化智能体」。 而奥特曼更是预言,「我预计这会是第一个真正发明出重要新东西的模型。这是非常AGI的一件事」。 注意「发明新东西」这个措辞,它的意思是凭空造出全人类目前还不知道的东西。 9个月手搓芯片,Astra亲自下场 最近, OpenAI首颗自研芯片「墨西哥辣椒」(Jalapeño),直接把老黄的旗舰GPU按在地上摩擦。 这背后的头号功臣,正是GPT-Astra。 它直接上手,从电路设计一路干到软件。 芯片这头,下场优化了底层电路。软件那头,编写和优化了最底层的核心Kernel,并且还顺手把三大开源模型调校了一遍。 结果就是,BF16乘法器性能暴涨56%,矩阵单元面积反而缩小了10%。 「注意力机制」和「MoE」这两个核心模块,比人类专家手写的版本还要快1.5到1.8倍。 各位,AI这是在物理层面动电路啊。 有意思的是,英伟达那边干的是同一件事。 AVO压根不是为打游戏做的,它的主战场是给GPU写底层代码。 今年3月英伟达发过一篇论文,核心思路是把「改代码」这一步整个交给一个能自己干活的智能体。 实测里,它连续自主运行了 7天 ,全程无人干预,探索超过500个优化方向,最终提交40个有效内核版本。 跑出来的核心代码,比英伟达自家闭源的版本最快3.5%,比业内最前沿的开源实现最快10.5%。 AI正在造AI 现在,把这两件事连起来看,奥特曼那句话就有底了。 每一次模型迭代,都要烧掉大量人类研究时间。但如果Astra开始接管这一环,整个研发速度就会发生质变。 这个循环一旦转起来,剩下的就是速度问题。 最后一战,已经全面打响 实际上,我们在外面能用到的GPT-5.6和Fable 5,都是上一轮的产物。 而爆料显示,两边真正的下一代,其实都已经练完了。 OpenAI:Astra后面,还排着一个Bel OpenAI这边,据长期追踪前沿模型动态的leo等人爆料,今年的预训练排得相当密: Spud(Sol) : 3月完成预训练,对应现在公开的GPT-5.5、5.6系列; Doug : 4到5月完成,在它上面继续做强化学习等后训练,就是即将登场的Astra,也就是外界口中的GPT-6; Bel : 8月刚刚结束预训练,总参数超过10万亿,规模接近当年的GPT-4.5。 爆料称,OpenAI内部把Bel视为「GPT-6之后的基础模型」,甚至有可能成为某个跨过AGI门槛的模型的基座。 Anthropic:Fable 5.1已经在灰度了 Anthropic这边,有人在8月18日发现,Claude网页版上一部分选了Fable 5的账号,被悄悄切到了一个新模型上。 这是Anthropic发布前的老规矩,Fable 5自己当初也是这么灰度出来的。 紧接着代号被扒了出来。 claude-melon-eap,疑似是 Fable 5.1 ; claude-marshmallow-eap,疑似是 Opus 5.1 。 并且,两个新模型据称都已经在小范围跑起来,随时可以推给所有人。 至于为什么都压着不发,网友的分析是,谁先发,谁就会在几天后被对方盖过去。 尤其是Anthropic还被曝出,将在2027年初直接拿下领先位置。 胜者拿走一切 这恰好把眼下这场战争的时间窗口圈了出来。 2026年剩下的4个月。 有机构做过测算, Anthropic有 88%的概率先于OpenAI上市 ,
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱