智能AI
morning
突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA
摘要
新智元报道 你敢信,OpenAI第一次做芯片,竟然把英伟达全系干趴下了?! 就在刚刚,OpenAI首颗自研芯片Jalapeño「墨西哥辣椒」,交出了首批实测成绩单—— AI推理性能,全面反超英伟达GB200和GB300。 实测速度直接起飞! Jalapeño一秒能狂吐1459个Token,英伟达GB200只有535个,连一半都不到。 「辣椒」跑完一个任务只要1.65秒,GB300却得花将近6秒, ...
GPT
OSS
而Vera
Rubin是3
新智元报道
你敢信
OpenAI第一次做芯片
竟然把英伟达全系干趴下了
就在刚刚
OpenAI首颗自研芯片Jalapeño
2026-08-26
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 你敢信,OpenAI第一次做芯片,竟然把英伟达全系干趴下了?! 就在刚刚,OpenAI首颗自研芯片Jalapeño「墨西哥辣椒」,交出了首批实测成绩单—— AI推理性能,全面反超英伟达GB200和GB300。 实测速度直接起飞! Jalapeño一秒能狂吐1459个Token,英伟达GB200只有535个,连一半都不到。 「辣椒」跑完一个任务只要1.65秒,GB300却得花将近6秒, 整整3.6倍的差距 。 最狠的是,哪怕把GB300逼到它自己最快的解码速度, Jalapeño的吞吐也依然是它的104.3倍。 而Jalapeño的标称功耗只有700W,GB300是1400W,整整一半。 著名半导体分析师Dylan Patel更是直接放出狠话,「被掀翻的不只是Blackwell, 就连英伟达Rubin芯片也被超越了 」! 一时间,整个AI圈都炸了。网友们纷纷惊叹,OpenAI简直杀疯,英伟达也被击败了。 奥特曼的表态则是霸气又克制,「 我们造了一颗芯片,快得离谱 」! 一颗「辣椒」,干翻了英伟达旗舰 这可不是OpenAI自说自话。 SemiAnalysis钻进实验室实测了一趟,写下的结论是—— Jalapeño把他们此前测过的每一颗英伟达、AMD、谷歌的芯片,全干趴下了。 差距有多大?英伟达最新那颗Vera Rubin吃掉的电,够喂将近三颗Jalapeño。 测试中,OpenAI挑了三个公开模型来跑:GPT-OSS 120B,还有一款670B和1T的模型。 这一轮测试,覆盖了从中型到万亿参数的MoE架构。整体结果如下: 每瓦特AI工作负载提升1.5–1.9倍 端到端延迟降低1.7–3.6倍 在高度交互式工作负载上,性能提升2.1–4.1倍 前面提及的1459个Token/s,是在GPT-OSS 120B上测的。 换算成出词间隔,两个Token之间只隔0.69毫秒。 人正常朗读一秒钟大概吐五六个字,而它一秒甩出1459个,眼睛跟不上,屏幕也刷不过来。 绿色是Jalapeño,蓝色是现有最强。三个模型上分别快2.7倍、4.1倍和3.8倍 1.65秒对5.99秒的那四秒差距,放在聊天里还能忍,放到Agent身上就是另一回事,因为一个任务要连着走几十步,差值是要乘上去的。 然后说那个全网都在转的104.3倍。 它的准确意思是,把GB300推到自己最快的解码速度,也就是每秒169个Token,在那一个点上,Jalapeño的吞吐是它的104.3倍。 三个模型上都是这个走势,GPT-OSS到53.7倍,1T模型到56.1倍。 同一个模型,随着要求的出词速度往上抬,领先幅度从1.7倍一路涨到104.3倍 换句话说,对手跑到极限开始喘的地方,正是它还在从容巡航的地方。 如果按各自最好的工作点算峰值,差距会温和很多,三个模型上分别是1.9倍、1.7倍和1.5倍。 真正拉开距离的是高交互场景 左图横轴是出词速度,右图横轴是完整请求的延迟。绿色的Jalapeño在整条曲线上都压着蓝色的GB200 SemiAnalysis这边,则是把供电、散热、网络全算进去,然后再摊到每颗芯片头上。 结果,Jalapeño每颗1.125千瓦,GB200是1.87千瓦,而Vera Rubin是3.3千瓦。 在这个口径下跑GPT-OSS,Jalapeño每兆瓦每秒吐出约5300万个Token,GB200 NVL72只有约1000万。 紫色那条一骑绝尘的就是Jalapeño,横轴是交互速度,纵轴是每兆瓦每秒吐出的Token数 成本方面,每芯片每小时的总拥有成本,Jalapeño是1.56美元,跟H100的1.55美元几乎一样,而Vera Rubin是3.61美元。 绿色是Vera Rubin,紫色是Jalapeño。过了每秒200个Token,紫色一路走到绿色够不到的地方 最要命的是,这些成绩还不是Jalapeño的全部实力。 它连投机解码和Token预测都没开,也没做prefill和decode的分离部署,而图上其他每颗芯片跑的都是各自最优配置,该开的优化一个不落。 SemiAnalysis估算,光投机解码这一项就能把每Token成本再压掉2/3以上。 一颗Jalapeño,还能跑起「毁灭战士」 九个月,GPT‑Astra一路干到了流片室 这么一颗东西,从设计到流片OpenAI只用了九个月。相比之下,业内常见的时间是18-36个月。 做过ASIC的都知道,这个周期里最磨人的活是验证。仿真得一轮轮重跑,改一个地方就得从头再来。 OpenAI之所以能「开挂」,是因为它把自家最强的模型请进了流片室—— 协助开发Jalapeño的模型叫GPT-Astra,也就是外界一直在传的GPT-6! 在整个过程里,GPT-Astra基本上成了团队的最强辅助。 它帮着探索实现方案,把「设计-测量-验证」这一整圈往死里压,还顺手微操了算术电路。 微操到什么程度呢?SemiAnalysis挖到的数字是,AI辅助设计让SIMD单元面积减少8%,矩阵引擎面积减少10%。 同时,这些模块在时序和功耗上都比初版更好。 计算die居中,两侧各三颗HBM4,上方那条是 I/O 小芯片 主计算die约840平方毫米,而EUV光刻机的掩模版极限是858平方毫米,这块硅离物理天花板只差18平方毫米。 可以说,基本上把光刻机能画的地方占满了,一点没留。 粉色那行是Jalapeño,最右边三列是每瓦HBM带宽、每瓦FLOPs和算力带宽比 每瓦HBM带宽这一项,Jalapeño是22,第二名Rubin是11.1,GB300只有5.71。它比第二名高出整整一倍。 而每瓦FLOPs它是19.1,Rubin是19.4,两者几乎打平,可Rubin要烧1800瓦以上,Jalapeño只要700瓦。 这还只是用A0步进跑的。B0已经在晶圆厂里了,每瓦性能比A0还要再高约25%。 就这样, 靠着Codex加GPT-Astra这对王炸组合 ,OpenAI在短短两个月内,把三个原本压根没排进计划的开源模型,一路爆改到了高性能状态。 更吓人的是,在最吃性能的「注意力」和MoE模块上,AI手敲的代码跑起来,直接比人类顶尖专家快了1.5到1.8倍。 AI设计芯片,芯片跑AI,AI再回头优化芯片上的AI。 这个飞轮,OpenAI已经转起来了。 CUDA护城河,死了? 一直以来,英伟达最深的护城河一直是CUDA。 将近二十年攒下来的软件栈养出了全世界工程师的肌肉记忆,换一次硬件就得推倒重来。 而SemiAnalysis在文章里下了一句相当重的判断, 说CUDA的护城河可能已经死了 。 理由,就是速度。 他们还补了一个更扎心的对照,英伟达的Rubin其实比Jalapeño早一个月完成CoWoS流片。 可到现在为止,外界能看到的Rubin成绩只有CoreWeave工程样片那点数据,英伟达并没有像OpenAI这样把第三方放进实验室随便测。 所以问题出在软件起步的速度上,英伟达的硬件本身没毛病。 而从零开始甚至还让OpenAI占了便宜,不用背历史包袱,架构可以完全按白纸来画。 SemiAnalysis最后那句写得很有画面感—— 他们说GPT-5.6 Sol这类跑在英伟达GPU上的OpenAI模型,被用来设
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱