智能AI
evening
OpenAI失去了「CUDA内核之神」
摘要
编辑|Panda 今天,一条前两天的推文开始热传,内容只有 5 个词:Scott Gray 已离开 OpenAI。 这位有着「CUDA 内核之神、全球最强 GPU 程序员」称号的著名工程师成为了 OpenAI 今年流失的又一位重量级人才。他本人虽然没有发推确认,领英页面也尚未更新,但其在 𝕏 和 Bluesky 上的个人简介均已从「GPU Geek at @OpenAI」改成了「 F orme r...
OpenAI
Gray
GPU
Scott
CUDA
cuBLAS
内核之神
全球最强
程序员
update
2026-08-17
1 阅读
约10分钟阅读
机器之心
字号:
编辑|Panda 今天,一条前两天的推文开始热传,内容只有 5 个词:Scott Gray 已离开 OpenAI。 这位有着「CUDA 内核之神、全球最强 GPU 程序员」称号的著名工程师成为了 OpenAI 今年流失的又一位重量级人才。他本人虽然没有发推确认,领英页面也尚未更新,但其在 𝕏 和 Bluesky 上的个人简介均已从「GPU Geek at @OpenAI」改成了「 F orme r GPU geek at @OpenAI」,并且还在前面增加了一句「目前 独立 ,正在探索一些神经科学启发的 AI 方法」 一位在 OpenAI 待了十年的工程师,用一行简介宣布了自己的离开。 好巧不巧。刚好十年前的 8 月 16 日,OpenAI 发布了一篇题为《Team update》的博客,介绍当月加入的五位全职成员。名单上有 Dario Amodei、Filip Wolski、Jack Clark、 Scott Gray 和 Zain Shah。 https://openai.com/index/team-update-august/ 十年后的今天,Dario 是 Anthropic 的 CEO,Jack Clark 在 Anthropic 负责政策,而 Scott Gray 把 OpenAI 标记成了「former」。 截至目前,OpenAI 没有就 Scott Gray 的离职发布任何声明,Gray 本人也没有发文具体说明。目前所有报道的共同信源,都是他社交账号简介的改动,以及随后在 X 上扩散的一条爆料帖。具体离职日期、去向、是否已有新公司,均无公开信息。 值得一提的是他账号上的另一个细节。Gray 最后一条原创 𝕏 推文停在 2023 年 11 月 20 日,内容是一句话:「 OpenAI is nothing without its people. 」那是 Sam Altman 被董事会解职后的第三天,超过七百名员工联署要求董事会辞职,这句话在当时的 OpenAI 内部被反复复制粘贴,算得上是一次集体效忠。在那之后,他虽然回复了一些推文(回复也已在 2025 年 2 月之后停止),但再未更新原创推文。 Scott Gray 简介 我们此前有一篇文章专门介绍过 Scott Gray,参阅《 CUDA 内核之神、全球最强 GPU 程序员?OpenAI 的这位幕后大神是谁 》。这里再简单盘点一下。 他的声名起于 Nervana Systems 时期。当时绝大多数开发者依赖 NVIDIA 的 CUDA C/C++ 和 cuBLAS、cuDNN 等官方库,多层软件抽象屏蔽了硬件细节,也构成了性能天花板。Gray 的判断是必须绕过这些抽象层,于是他写了 maxas,一个针对 Maxwell 架构的汇编器,让开发者可以直接书写 SASS 机器码,手动分配寄存器、管理内存延迟、控制指令流水线。 为了证明这条路走得通,他用 maxas 手写了一个 SGEMM 内核。在 GM204 GPU 上,该内核达到硬件理论峰值的 98%,并且比 NVIDIA 官方闭源、同样由专家手写的 cuBLAS 快 4.8%。随后的 maxDNN 把同一套方法论推广到卷积:在 AlexNet 的所有卷积层上稳定达到 93% 至 95% 的计算效率,而同期 cuDNN 的效率在 32% 到 57% 之间大幅波动。 这是他后来一切工作的方法论底色: 不接受抽象层给定的性能上限 。 2016 年 8 月的那篇 OpenAI 团队更新里,官方对他的介绍只有两句技术评价,大意是他此前在 Nervana 专注于优化深度网络在 GPU 上的性能,而他在稠密线性代数与卷积上的汇编级优化「至今仍是最快的」。同一段还提到, 不写代码的时候,他通常在读神经科学及相关领域的最新研究 。 看起来,十年后他的新方向「 神经科学启发的 AI 方法 」,其实是回到了那个一直没变的兴趣。 加入 OpenAI 后,他的角色从「优化者」变成了「使能者」。2017 年,他与 Alec Radford、Durk Kingma 一起发布了 块稀疏 GPU 内核 。不同于移除单个权重的非结构化稀疏,块稀疏把权重矩阵切成固定大小的块并整块置零,专门的内核在计算时完全跳过零值块,速度可以比处理稠密矩阵的 cuBLAS 或处理通用稀疏矩阵的 cuSPARSE 快上几个数量级。这套内核当时被开源,直接催生了后续一系列稀疏注意力工作。 OpenAI 块稀疏内核示意图,https://cdn.openai.com/blocksparse/blocksparsepaper.pdf 顺着这条线往下,2019 年的《Generating Long Sequences with Sparse Transformers》作者是 Rewon Child、Scott Gray、Alec Radford 和 Ilya Sutskever——把注意力的时间与显存开销从 O(n²) 降到 O(n√n),论文明确把「 快速注意力训练内核 」列为三项贡献之一。 再往后,他的名字出现在 GPT-3 的作者名单、《Scaling Laws for Neural Language Models》的作者名单、DALL·E 的作者名单和 OpenAI Five 的技术报告里。 在这期间,他还收获了「 CUDA 内核之神 」的称号。那是在 2025 年 9 月,前 OpenAI 员工 Rohan Pandey 在 𝕏 上发帖称,公司里大约只有一个人负责推理侧的 CUDA 内核,同事们把他写的注意力内核叫作「the Bob kernel」,这个内核每天在数十万张 GPU 上执行数以万亿次计。帖子火了之后,评论区普遍猜测「Bob」就是 Scott Gray。 相关帖子还提到:全世界能为训练过程(尤其是反向传播)写出高性能 CUDA 内核的人,可能不到一百个。因为这项技能要求同时精通并行计算理论、GPU 硬件架构和深度学习算法,而大多数从业者停留在应用层或推理优化层。 而现在,Scott Gray 离开了。 2026 年,OpenAI 已流失不少人 OpenAI 今年流失了不少人才。据 𝕏 博主 Chubby 盘点,OpenAI 今年已有 12 位高级 leader 离职,覆盖运营、商业、产品、研究、安全、伦理和硬件。 前些天,在 OpenAI 工作八年、曾任 CFO 与 COO 的 Brad Lightcap 在 𝕏 上宣布离职,称要「start something new」;两天后,去年 12 月才上任的首席营收官 Denise Dresser 宣布离开,由 Wiz 前总裁兼 COO Dali Rajic 接任。 商业与产品线上,应用业务 CEO Fidji Simo 在 4 月因健康原因休假,7 月卸任全职转为兼职顾问;前 CMO Kate Rouch 在 4 月因治疗需要卸任;企业业务 CTO Srinivas Narayanan 同在 4 月宣布离开。研究与产品侧,主导 OpenAI for Science 的 Kevin Weil、Sora 负责人 Bill Peebles 在 4 月同日宣布离职,Wei
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱