智能AI
morning
老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了
摘要
老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了 听雨 2026-08-05 13:53:38 来源: 量子位 听雨 发自 凹非寺 量子位 | 公众号 QbitAI CUDA又双叒叕被创了… 这回动手的,还是英伟达亲手喂大的AI。 一家成立仅一年的小公司,用AI编程Agent, 只花10小时 ,就搭出了一套「类CUDA软件」。 停停停。 你是说这套英伟达花了近20年搭起来的软件帝国,就这么被...
量子位
CUDA
老黄垒20年的CUDA护城河
AI刚刚用10小时凿开了
2026
凹非寺
公众号
QbitAI
CUDA又双叒叕被创了
这回动手的
2026-08-05
1 阅读
约9分钟阅读
听雨
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了 听雨 2026-08-05 13:53:38 来源: 量子位 听雨 发自 凹非寺 量子位 | 公众号 QbitAI CUDA又双叒叕被创了… 这回动手的,还是英伟达亲手喂大的AI。 一家成立仅一年的小公司,用AI编程Agent, 只花10小时 ,就搭出了一套「类CUDA软件」。 停停停。 你是说这套英伟达花了近20年搭起来的软件帝国,就这么被复刻了?? 不止如此。DeepSeek也在尝试少写一点底层CUDA。 他们已经开源了一套名为TileKernels的GPU算子库,用TileLang来编写,省去了大量手写底层CUDA代码的工作。 不过类似的 「CUDA危机」 ,咱也不是第一次听了。 每隔一段时间,CUDA都要被拎出来鞭打一番,动辄替代了、击穿了、护城河又被颠覆了… 真的是这样么? 10小时「复刻」CUDA 提起英伟达,很多人的第一反应是GPU。 H100、Blackwell、Rubin,靠着一代代性能更强的芯片,英伟达吃下了这一轮AI浪潮的最大红利。 但英伟达真正难以撼动的优势,其实不是硬件,而是 软件 。 芯片可以买,参数可以追,制程也会迭代。真正让客户用了英伟达之后很难再换走的,是 围绕GPU建立起来的整套软件生态 。 而 CUDA ,就是这套软件帝国的核心。 CUDA全称Compute Unified Device Architecture,由英伟达高管Ian Buck带队,花了近20年打造。 它常被叫作编程语言,但更准确地说, CUDA是一整套围绕英伟达GPU建立的软件平台 。 如果简单拆成三层,最底下是 内核层 ,直接让芯片干活的Kernel、编译器和运行时。 中间是 库层 ——cuBLAS、cuDNN等经过高度优化的计算库,以及调试、验证和性能分析工具。 最上面,则是PyTorch、TensorFlow等开发框架,企业积累的海量代码和工作流,以及围绕CUDA成长起来的开发者生态。 △ AI生成 这么说可能有点抽象,但你可以把英伟达GPU想象成一家工厂。 CUDA最底层负责告诉机器每一步怎么干,中间层提供现成的生产工具,最上层则是一整套已经运转多年的生产体系。 所以,对客户来说,买到的不只是英伟达的一块卡,而是一座开箱即用的工厂。 现在,一位名叫 Jeremy Nixon 的老哥,带着AI Agent来了。 Nixon是AI软件初创公司 Infinity 的创始人,此前也在Google Brain当研究员。 他的团队开发了一套名为 Ignition 的AI研究Agent,专门给不同AI芯片编写底层软件。 它可以生成GPU Kernel、运行测试、寻找错误、测量性能,再根据结果自动改写代码。 人类工程师负责给出高层方向,剩下那些琐碎又费脑子的工作,就交给Agent反复循环。 就这样,Infinity用Ignition为AI芯片初创公司d-Matrix搭建了一套类CUDA软件。 只花了10小时 。 啊?? 那些过去需要芯片软件工程师反复调试的底层代码,现在真能交给AI了? 还真不能说完全是炒作。 AI Agent确实很适合这种具有明确反馈的编程任务。 代码能不能编译,结果算得对不对,性能有没有提高,都可以通过实际运行得到答案。 于是,Agent能够形成一个完整闭环: 写代码→编译→运行→测试正确性和性能→根据反馈继续修改 不过,Infinity主要攻入的是CUDA的第一层:为不同芯片生成和优化推理Kernel,并围绕这些Kernel搭建底层软件能力。 它正在开发一套面向多种芯片的通用推理库,但这不等于它在10小时内复制了CUDA近20年积累的完整生态。 但是… 但是! 你实际上并不需要复制一个CUDA,就可以拿下 1500万美元的融资 。 这家公司目前的估值也已经来到了 1亿美元 。 有没有威胁到英伟达不知道,反正资本是相当买账的。 (doge) 推理侧,第二战场启动! 如果说AI Agent是攻城的武器,那 推理市场 就是城墙上的缺口。 大模型的计算主要分成两段: 训练 是造模型,需要上万块卡协同跑几个月; 推理 是用训好的模型回答问题,小集群甚至单卡就能跑。 在训练侧,CUDA目前依然近乎无解。 大规模训练对性能、稳定性和集群协同极为敏感。芯片之间的通信、显存的调度、程序出错后如何恢复,任何一点效率损失,放大到数千乃至数万块芯片上,都会变成真实的时间和成本。 因此,企业选择训练平台时往往极其保守。 其他芯片即使纸面参数不错,只要软件不够成熟、集群不够稳定,省下来的硬件成本,很可能从开发和试错成本里加倍偿还。 但在推理侧, 游戏规则变了 。 韩国AI芯片公司Rebellions首席商务官 Marshall Choy 就认为: 在推理侧,CUDA不再是决定因素。这将是一场开源软件的竞争。 为什么竞争者都盯上了推理? 因为训练在乎「极致性能」,而推理在乎的是「每个回答的成本」。 训练需要上万块卡协同,推理可以拆分到小集群甚至单卡;训练不敢换芯片,但推理可以。 反正只要能跑、便宜,客户就愿意试。 更关键的是,推理软件可以跨芯片运行。如果推理框架能支持多种芯片,用户就能在不同硬件之间切换,不用重写代码—— CUDA最大的锁定效应,就此失效。 这就给专用推理芯片留下了机会。 推理任务并不都需要CUDA从训练到集群协同的全部能力。针对特定模型、特定场景重新设计的芯片,只要能够跑得更快、更便宜或者更省电,就有机会从英伟达手里切下一块市场。 比如 d-Matrix ,本身就是一家主打推理的芯片公司。 这家公司成立于2019年,主攻生成式AI推理芯片。 联合创始人兼CEO Sid Sheth 曾回忆,他们很早便判断, AI推理带来的机会最终会超过训练 。 Infinity用AI Agent花10小时搭建的类CUDA软件,服务的正是d-Matrix的推理芯片。 于是,「10小时事件」的完整故事就连起来了: 新芯片想进入推理市场,但缺少成熟软件;AI Agent快速生成和优化底层Kernel,把原本可能耗费数月乃至数年的适配工作压缩到小时或天。 Sid还明着放话: 虽然英伟达在训练领域保持主导地位,但在推理方面,护城河有所削弱。 盯上这个缺口的,也不止d-Matrix一家。 主攻推理的Rebellions、d-Matrix,押注晶圆级芯片的Cerebras,亚马逊的Inferentia、谷歌的TPU、AMD的MI300X…… 各路芯片厂和云计算巨头,早已在推理市场排兵布阵,准备从英伟达手里抢下一块肉。 对这些公司来说,他们不需要立刻替代英伟达。 他们只需要证明,在某些推理任务中,不依赖英伟达的全套硬件和CUDA生态,也能跑得更快或者更便宜。 这就足够了。 英伟达护城河,到底颠没颠覆 答案可能是… 还差得远 。 前面也说了,10小时重写的是「一块芯片的适配代码」,而CUDA生态还有20年积累的库、调试工具、社区、几百万
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱