首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

大模型厂商,正忙着自备“干粮”

2026-09-02 1 阅读 约10分钟阅读 飞向TAI空
分享:
字号:
图片来源:unsplash 2026年年中以来,越来越多独立模型厂商传出将下场“亲手”打造AI芯片。 6月末,起步最早的OpenAI已经拿出了首款自研AI推理芯片Jalapeño,这款芯片从架构设计到流片仅耗时9个月,创下了专用集成电路(ASIC)领域最短开发周期纪录。 7月上旬,路透社报道称DeepSeek正在开发自研AI芯片,项目已启动约一年,且与芯片设计、代工、存储等供应链企业进行了讨论。 几乎同一时间,“大模型第一股”智谱也被曝出在推进自研芯片项目,已向多家国内芯片设计公司初步询价。 8月初,一向“精打细算”、被认为不热衷“堆算力”的Anthropic也正式对外证实,公司正在组建内部芯片研发团队,为Claude大模型量身打造定制化AI芯片。 8月末,OpenAI放出了Jalapeño的评测数据,称其在推理能力上能够比肩甚至超过英伟达目前的主力产品GB200、GB300。 芯片研究机构SemiAnalysis甚至在最新发布的报告中评价称,Jalapeño可以直接对标英伟达新一代产品Vera Rubin,甚至可能在未来冲击后者的最强护城河CUDA 。 模型厂商尝试自研芯片显然已非个例,但按照以往的理解,这两个赛道的逻辑、打法迥然不同,本就面临盈利难题的独立模型公司,要砸重金、组团队做自己不熟悉的事,风险不小。那么,这些公司究竟为何盯上自研芯片?又为何会在这个节点纷纷入局?它们“造芯”的方式有何不同?芯片企业如何看待客户变竞对的现状?这场“造芯运动”又会给行业带来哪些影响呢? 推理时代到来 科技巨头布局自研芯片并不罕见,美股七姐妹中除英伟达外,微软、谷歌、亚马逊、Meta均拥有成熟的自研AI芯片,苹果、特斯拉也正积极研发、建厂。中国互联网大厂中,阿里巴巴的平头哥和百度的昆仑芯已实现商业化,字节跳动也在加速自研芯片量产进度,腾讯亦有针对特定场景的专用AI芯片布局。 对于业务覆盖广、家底丰厚的巨头来说,自研芯片既可用于自家AI的降本增效,摆脱对外依赖,应对算力短缺和供应链掣肘,同时也能对外销售,在云业务中形成收入。 但独立模型厂商的处境却有所不同。 它们没有云业务和成熟的客户生态网络,自研芯片的市场前景天然受限。它们也难以承受训练芯片开发的巨大耗资和超长周期,自研芯片对于自身模型的绝对性能提升有限。 也正因为此,虽然芯片短缺、供应链风险在本轮AI浪潮启动时就已显露,但除了“找钱”能力最强的OpenAI,其他独立模型厂并没有着急行动。 真正推动他们走上自研芯片之路的,是推理时代的到来。 AI Infra企业清程极智联合创始人师天麾此前曾对我们表示,今年以来Agent、长上下文和AI应用大规模落地,让模型调用量激增,Token越烧越快,从“交互式用量”进阶到“生产级用量”,推理计算需求随之指数级增长,并在资本支出上超过模型训练。 与此同时,虽然算力供给也在快速增加,但显然无法跟上推理需求的增速。而且,推理时代的来临也在改变着模型和芯片的模样。 专攻AI推理芯片的云天励飞董事长兼CEO陈宁对我们表示,在训练时代,算力的核心任务是训练超大模型,通用GPU优势明显。但推理面向的是大量不同的模型、应用和服务等级,有的追求低延迟,有的追求高吞吐,有的需要长上下文,有的要控制功耗和成本。随着应用规模扩大,很难用一个指标,甚至一种硬件形态解决所有问题。 他认为,推理时代一方面让芯片的技术路线更加多元、专业分工更加细化,另一方面也将每Token成本、能效、延迟和吞吐等推理指标与模型公司的商业化效率联系在了一起。 “近期包括DeepSeek在内的模型公司被传出探索自研芯片,这些芯片更多是对既有算力体系的补充,而不是简单替代通用平台。但这种趋势说明了一件事:当AI进入大规模使用阶段,算力成本和软硬协同的重要性正在上升。”陈宁分析称。 实际上,从目前传出的消息来看,OpenAI、Anthropic、DeepSeek和智谱在开发的都是AI推理专用芯片,初期定位多是自用,聚焦降低推理成本,提升推理效率。 AWS此前曾做过估算,在模型生命周期中,推理可能占据高达90%的成本。而相比于训练的集中投入,推理开支是每天都要出的账单,且需求越多,花销越大。这也意味着,当推理规模足够大时,如果模型厂商的自研推理芯片能大幅降低推理成本,这个经济账就能算得过来。 实际上,从各家模型厂商的财务状况也可看出它们面临的压力和做出的努力。 上述计划造芯的公司都在近两年迎来了用户规模的持续扩大和ARR(年度经常性收入)的快速增长,但同时上涨的还有推理计算成本,再加上高昂的研发费用,导致除Anthropic今年Q2实现调整后营业利润外,其他公司都仍在亏损。 实际上,在自研芯片之外,这些公司也在想各种办法。 以智谱为例,该公司8月31日公布的半年报显示,公司在从本地化部署向云端MaaS的转型中毛利率承压,今年上半年的整体毛利率从去年同期的50.0%下降至26.4%,提升核心业务的盈利能力成了重要课题。在这方面,智谱押注的开放平台及API业务的毛利率虽然远低于传统业务,但已从去年同期的-0.4% 提升到了24.6%,其中最关键的影响因素就是大规模部署性价比更高的国产推理芯片,通过“All-in-Infra”优化推理成本,其单位Token推理成本今年半年内压降了约八成。不过,智谱在总收入涨近400%的同时,扣非亏损幅度也扩大了12.1%,想在研发支出不降的情况下改善利润,必然还需进一步降低推理成本,提升毛利率。在这种情况下,探索自研推理芯片也在意料之中。 AI学会了为自己造芯 在如何造芯片方面,独立模型厂商也在进行新的探索。 首先是架构、系统方面的“反主流”尝试。 OpenAI是目前唯一拿出成品且给出了部分技术细节的公司,其芯片设计也被认为将对其他模型厂商自研芯片形成影响。 根据OpenAI自身发布的信息和SemiAnalysis等机构的分析,Jalapeño的设计主要围绕以更低能耗提供更快、更多的推理算力。但即使与自家模型协同设计,也需要克服推理时数据传输、内存带宽、KV Cache占用和搬运开销等导致的迟滞和耗损。 在这方面,Jalapeño抛弃了PD分离(预填充-解码分离)、推测解码、软件管理暂存器+异步DMA等常规做法,在硬件架构、内存与互联等方面做了堪称激进的尝试,核心就是尽可能避免资源闲置,减少传输损耗。 不过,值得注意的是,SemiAnalysis最新报告分析称,Jalapeño虽然目前名义上仍是自用,但从设计上已充分考虑了通用性、兼容性,包括支持“小”矩阵维度的计算引擎,能够适配各类尺寸的模型,为计算核心配备了L1缓存和乱序执行能力,让芯片在小批量处理时也能接近理论峰值性能等。这款芯片也能兼容其他模型和工作负载,显示出了OpenAI进军商业化市场的野心。而目前来看,这种通用性设计,未必会成为其他独立模型厂商的第一选择。 另一方面,用AI设计AI芯片已成了模型厂商造芯最鲜明的特点之一。 OpenAI方面表示,设计Jalapeño时最大化利用了AI辅助工具,大幅加快造芯速度,完成了创下最短纪录的9个月开发周期。此外,OpenAI还利用Codex来编写和优化Jalapeño的底层内核代码,让新模型能快速适配自研芯片,极大降低了从英伟达CUDA
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱