数码硬件
morning
DeepSeek们狂造芯片 英伟达终于不香了?
摘要
不是哥们,DeepSeek要自己搞芯片??? 事情是这样,前段时间,路透社报道说浓眉大眼的DeepSeek已经悄摸做了一年的AI芯片了,正在接触芯片设计、晶圆代工和存储厂商。 但这消息出来没几天,OpenAI就把自己和博通搞的Jalape?o芯片集群端了出来。完事儿同样也在这段时间,Anthropic也说要开始组建自己的芯片团队了。。。 不是你们一个个的,一边疯狂买英伟达产能,一边又公开表示也要下...
Agent
GPU
众所周知
在Prefill阶段
个字节的数据
Token
不是哥们
DeepSeek要自己搞芯片
事情是这样
前段时间
2026-09-02
1 阅读
约10分钟阅读
世超
字号:
不是哥们,DeepSeek要自己搞芯片??? 事情是这样,前段时间,路透社报道说浓眉大眼的DeepSeek已经悄摸做了一年的AI芯片了,正在接触芯片设计、晶圆代工和存储厂商。 但这消息出来没几天,OpenAI就把自己和博通搞的Jalape?o芯片集群端了出来。完事儿同样也在这段时间,Anthropic也说要开始组建自己的芯片团队了。。。 不是你们一个个的,一边疯狂买英伟达产能,一边又公开表示也要下场搞芯片。难道老黄卖给他们的GPU不香了吗? 经过一番研究我发现,还真是不香了。。。 而这一切都是因为: 推理芯片。 这个所谓的推理芯片,其实也不是啥新词。很多年前谷歌第一代TPU就在研究推理了,前几年各种研究推理芯片的初创公司也不少,像什么Groq、Cerebras、SambaNova,这些可以说是各有绝活。 但是之所以大家现在感到陌生,原因也是显而易见:这个行业在前几年一直都是不温不火,属于大厂们鸟都不鸟的领域。 那么问题来了,前几年大厂对此不甚上心,今年偏说婉婉类卿,为啥突然间大伙都夏侯惇坐飞机,高看一眼了呢? 因为划不来啊。。。这事在当年还没谱。 众所周知,大模型是个发展很快的行业,今天爆火的模型、技术方向,可能过两个月就无人问津了。今年的OpenCLaw小龙虾现在在哪发财咱都不知道,更别说前两年的大模型厂商了。 毕竟那时候旗帜鲜明反对LLM的都大有人在(你小杨哥YannLecun)。。。大模型能走多远都不好说,所以模型厂商们更不可能专门为推理造芯片了。 毕竟英伟达的卡又不是不能用,训练起来也嘎嘎好使,花时间研究推理芯片那不是闲的嘛。唯一搞推理的谷歌TPU,最开始也不是为大模型准备的,因为那时候大模型都还没出生呢。 但事情的转机,发生在两年前的这个时候。 2024 年 8 月,Google DeepMind 团队发表了一篇里程碑式论文,他们发现只要延长思考时间,模型的正确率就会直接暴涨。 9月开始,OpenAI 的o 系列就开始让原子弹爆炸了;翻过年,DeepSeek-R1 等深度思考模型又给了世界一顿中国震撼。 然后从去年到今年,大家逐渐认识到,AI Agent、多 Agent 协作集群、几十万字的超长上下文分析,已经成了大模型落地工作的标配。深度推理和 Agent 这套技术路线,基本得到了整个行业的确认。 随着技术路线的确认和发展,压力最大的除了前端兄弟,还有 GPU。。。。 随便打开一个AI对话框,我们在这里输入文字,AI就会返回文字,这看起来非常自然丝滑。 但从AI的视角看,你告诉AI“扮演一个猫娘”,它需要先理解“这句话到底说了个啥?”这一步就被称为Prefill。而AI读懂以后,开始学猫娘说话输出给你的过程,叫Decode。 在Prefill阶段,AI要把一整句话拆成一个个token,然后分别理解这些tokens的含义,这个过程和AI的训练阶段非常相似。 模型怎么才能判断这些token的含义呢,这就涉及到了矩阵。 而纵观天下硬件,最适合算矩阵的算中之霸,就是GPU。 然鹅,对GPU来说, 发送问题的Prefill阶段,和输出回答的Decode阶段,计算过程却完全不同。。。 在Prefill阶段,我们一次性提供了数据,GPU可以自己切分、所有核心一起并行计算,这就很舒服。 用下面图片中的简化公式感受一下:假设我们输入的token需要一个4096参数的矩阵,那么计算出来每从内存搬运 1 个字节的数据,GPU 就可以用这笔数据,执行上千次运算。 但一进入 Decode 阶段 ,形势就出了问题。 众所周知,现在的大模型都是自回归的,说白了就是要知道上一个词才能算出来下一个词。所以原本Prefill阶段4096行的输入矩阵,到了Decode阶段,会暴跌成只有1行。 经过同样的计算, 每搬运 1 个字节的数据, GPU 就只能算一次。。。 这下就坏菜了。。。 在芯片内部,两个数据相乘的能量消耗非常少。但要把一个数据从显存搬到GPU里,消耗的能量和时间往往是前者的几十倍甚至上百倍。 所以要把一颗芯片的算力拉满,理想的情况一定是,搬一次数据进核心,然后在本地反复算上几万次。 最忌讳的就是搬一次算一次,下次要用再临时去搬。 所以在Decode阶段,一个 70B参数140GB 权重的大模型,每向用户输出一个 Token,芯片就必须把这 140GB 从 HBM 显存里完整读入一遍,再吐一个字又重读一遍。 哪怕用上 3 TB/s带宽的顶级显存,输出速度也只有每秒21个token。。。 换句话说,老子花这么多钱买显卡,结果芯片有 80% 的时间在发呆等数据传过来,这nm谁受得了。 更要命的是,除了推理时间变长,为了记住前面几十万字的思考过程,模型必须把所有历史 Token 的特征全部缓存在显存里,每多思考一步,显存里要搬运的数据量(KV Cache)也跟着爆炸。(这就是为啥显存和内存都纷纷涨价) 过去显存还算够用的时候,各大厂商还能靠纯软件手段来轻松绷住。 比如搞连续批处理,把几十个用户的请求攒起来摊薄搬运成本;还有梁圣的潜在多头注意力机制,压缩 KV Cache来减少GPU的搬运量。 但这些都治标不治本。。。 GPU 在本质上是通用芯片而不是推理芯片,它就不是给来Decode的啊! 实际上,谷歌在很多年前就发现了这个问题。他们当时想到的办法非常简单粗暴, 既然通用 GPU 这么拉,那我为什么不专门造一颗只为推理的芯片? 于是,第一代 TPU就诞生了。它用来解决数据搬运问题的核心技术,叫作脉动阵列(Systolic Array)。 把芯片内部比作一个工厂,HBM显存是厂外的中央仓库,SRAM是流水线旁的小筐,计算核心就是打螺丝工位。普通的 GPU 算矩阵,就像一个工人每拧一颗螺丝,就要回显存仓库里拿一个零件,拧完再送回仓库。 而谷歌的脉动阵列,就是把打螺丝的过程变成了流水线,而且是个二维的流水线。 他们把上万个乘法计算单元(PE)焊成一个方阵,矩阵的权重数据一旦进了流水线,就像接力棒一样在工位之间横向传递计算,算出来的结果再依次传到下一层计算。 由于数据在相邻的核心之间直接传递,数据每进一次核心,就会在里面连续传递、复用几十上百次,根本不需要退回外部显存,压根就不需要中途再去搬运数据。 所以TPU的这波杀招也成了谷歌能摆脱英伟达卡脖子,在Gemini2.5时代一秒就能脉动回来的关键之一。(当然现在Gemini又拉了) 以前技术路线没定,TPU这种专用方案在大模型上没显出太大优势,大家也就继续买GPU。 而当现在深度推理让推理负载暴增,TPU的思路开始真正香了起来,包括谷歌都开始把TPU专门分出来训练版和推理版。 于是各大模型厂在这段时间都纷纷觉醒:是时候砸钱做专用的推理芯片了。 当然,吃够了英伟达卡脖子窒息play的大模型厂们,这一次没人愿意再当被动的买家。。。 比起 每年把几十上百亿美元ATM给老黄,你还得看人家脸色,有这钱养一个芯片团队开销简直就洒洒水。 不过真要自己做了,大家也没有只按谷歌的 TPU 的路线去抄。毕竟模型都是自家的,怎么也得自己调教开发才能找到最适合的硬件啊! 拿 Anthropic 来说,脉动阵列虽然快,但大量的杂活就不能脉动回来了。 所以 Anthropic不仅搞脉动流水线,
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱