智能AI
evening
OpenAI 自研「辣椒芯片」首测超英伟达,会让 ChatGPT 更便宜吗?
摘要
做芯片很难,第一代产品就做到有竞争力更难。OpenAI 这次交出的答案,至少在大模型推理这件事上,已经足够夸张。 今天,OpenAI 正式公布了其首款定制推理芯片 Jalapeño(墨西哥辣椒)的首批实测性能数据。 在基于自己开源模型 GPT-OSS 120B 的公开基准测试 InferenceX 上,Jalapeño 的每千瓦峰值吞吐量和 Token 延迟都比现有的硬件系统表现要好。 要知道,对...
OpenAI
Jalapeño
DeepSeek
tok
Kimi
GB200
GB300
SemiAnalysis
GPT
OSS
2026-08-26
1 阅读
约10分钟阅读
张子豪
字号:
做芯片很难,第一代产品就做到有竞争力更难。OpenAI 这次交出的答案,至少在大模型推理这件事上,已经足够夸张。 今天,OpenAI 正式公布了其首款定制推理芯片 Jalapeño(墨西哥辣椒)的首批实测性能数据。 在基于自己开源模型 GPT-OSS 120B 的公开基准测试 InferenceX 上,Jalapeño 的每千瓦峰值吞吐量和 Token 延迟都比现有的硬件系统表现要好。 要知道,对大多数芯片来说,吞吐和延迟往往是一道只能二选一的难题。而除了针对 OpenAI 的大模型优化明显,芯片在 670B 的 DeepSeek R1 和 1T 的 Kimi K2.5 上表现也更出色,对手都是英伟达 GB200/GB300 等市面上最强的商用 AI 系统。 奥特曼在 X 上毫不客气地评价:「我们造了一颗芯片,快得离谱。」 知名科技 Newsletter SemiAnalysi 创始人 Dylan Patel 更给了极高的评价,「第一代芯片通常毫无竞争力,但 OpenAI 正在打败英伟达 Blackwell,甚至 Rubin。」 更巧的是,OpenAI 并不是这几天唯一一家谈芯片的公司。 小米刚刚一口气公布三颗自研芯片,苹果昨天发布首颗 2nm M6,接下来一个月,高通、联发科、苹果和华为的新一代旗舰芯片还会继续扎堆登场。 从数据中心到手机,AI 芯片正在成为所有科技巨头共同争夺的一块地盘。 一份近乎「不讲理」的成绩单 先看 Jalapeño 的数据,OpenAI 这次采用 InferenceX 测试,统一设置为 8K 输入、1K 输出,使用标准单 token 预测,没有开启推测解码。对照系统包括英伟达 GB200 和 GB300。 OpenAI 将 DeepSeek R1 与 Kimi K2.5 标为 MXFP4,在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三个模型上的结果显示: 峰值吞吐量,每瓦的 AI 工作量是对比系统的 1.5 到 1.9 倍, 端到端延迟降低了 1.7 到 3.6 倍, 对于高交互性工作负载,其性能更是提升了 2.1 到 4.1 倍。 在最极端的对比项里,差距被拉得相当大,GB200 此前最佳的单用户速度(约 535 tok/s)下,Jalapeño 的每千瓦吞吐是前者的 53.7 倍。 跑 DeepSeek R1 时,Jalapeño 单用户可达 700 tok/s,对标系统只有 169 tok/s。而 Jalapeño 标称功耗仅 700W,实测持续功耗不超过 550W。 对于规模化推理服务来说,芯片最终拼的除了跑得多快,还有花同样的电、占同样的数据中心容量,能服务多少用户。 换成云计算生意里的语言,就是一句很直接的话:「每瓦吞吐,最后都会变成成本和收入。」 ▲跑 DeepSeek R1 时,Jalapeño 单用户生成速度最高约 700 tok/s,GB300 为 169 tok/s。 更值得注意的是 OpenAI 这颗辣椒芯片的达成方式:没有多 token 预测(MTP)、没有投机解码、没有 prefill-decode 分离,就这样赢过了软硬件优化的英伟达对手芯片。 SemiAnalysis 长篇技术博客里也验证了测试过程,并确认 Jalapeño 跑出的 GSM8k 精度与英伟达芯片持平。 ▲文章链接:https://newsletter.semianalysis.com/p/openai-jalapeno-better-than-nvidia 当然,X 上的讨论也没少泼冷水。daily.dev 的开发者社区就指出,那个疯传的「104.3 倍」只是特定等速解码场景下的单一数据点,而且测试模型和对比基线都是 OpenAI 自己挑的。 SemiAnalysis 也承认,Jalapeño 还没跑过多轮长上下文的 AgentX 测试;真正的对手应该是同样用 HBM4 的 Vera Rubin 而非 Blackwell。 即便如此,最终的共识依然是:第一代自研芯片就站上帕累托前沿,这在行业里没有先例。Meta 和微软折腾多年始终难产的 AI ASIC 项目,是最好的反证。 非 OpenAI 模型独家专用,是通用推理引擎 外界一度认为 OpenAI 造芯是给自家模型开小灶,SemiAnalysis 则提到 Jalapeño 是通用推理芯片。测试表现最好的三个模型里,DeepSeek R1 和 Kimi K2.5 根本不在 OpenAI 最初的投产计划内。 团队还提到用 Codex 两个月就把它们优化到了高性能,并且在这颗芯片上成功运行了游戏《Doom》,移植全程只用了 Codex 提示词。 硬件上,Jalapeño 采用台积电 N3P 工艺,最新的 B0 步进单计算 die 提供 13.4 PFLOPS 的 MXFP4 算力。同工艺、同尺寸的英伟达 Rubin 计算 die 是 17.5 PFLOPS(NVFP4),但 Jalapeño 的 TDP 只有 700W,Rubin 是 900~1150W。 再看设计逻辑。要理解 Jalapeño,得先知道大模型推理其实是两种完全不同的活:处理 prompt 的 prefill 阶段吃算力,逐字生成回答的 decode 阶段吃显存带宽,而数据在核心间、芯片间搬来搬去的通信开销则在两边拖后腿。 多数系统擅长其中一种,却会在等待数据时把优势浪费掉。 Jalapeño 的核心思路,是尽可能让数据待在原地,减少搬运。 芯片的核心和 HBM 都被切成一一对应的切片,每个核心切片对自己那片 HBM 拥有低延迟的本地视图;KV cache 和模型权重被显式地安置在原地,生成过程中不再挪窝。 切片之间需要同步时,可以走一条专用的高带宽集合通信网络,通用通信则交给另一张简化的 NoC。对比 GPU 里层层穿越的复杂内存体系,这套「极简内存层级」省掉了大量的延迟和功耗。 这套方法论可以总结成两步:硬件负责把理论上限拉到最高,AI 负责找到逼近上限的写法。 结果是它在各种批量、各种形状下都更接近硬件的屋顶线(roofline),尤其是 GPU 最不擅长的小批量、低延迟场景,而这些又恰好是 agentic 工作负载最在意的地方。 系统层面同样贯彻这个思路,OpenAI 没有采用目前热门的优化路线:PD 分离(prefill 和 decode 分池部署),理由是真实流量里输入输出的比例全天都在漂移,固定分池必然一边闲置一边排队,KV cache 跨池搬运还会平添功耗和延迟。 统一池子里,128 颗芯片组成一个机架(CPU 托盘叫 Katsu、ASIC 托盘叫 Vindaloo、交换托盘叫 Chana,都是一串咖喱菜名),16 个机架再用铜缆加光交换织成 2048 颗芯片的单一 scale-up 域。 整个请求从进来到出去,数据都不需要使用 PD 分离的转移。 真正的秘密武器是:用 AI 造芯片 如果 Jalapeño 的故事只到这里,它仍然只是一颗性能很强的 ASIC 推理芯片。 真正让这件事有点反常识的,是 OpenAI 连「怎么造芯片」这件事本身,也开始交给 AI 加速。 Jalapeño
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱