智能AI
morning
华为汪涛:华为要打造AI算力底座,只做好一颗芯片远远不够
摘要
华为汪涛:华为要打造AI算力底座,只做好一颗芯片远远不够 梦瑶 2026-09-19 16:28:51 来源: 量子位 乔不迟 发自 凹非寺 量子位 | 公众号 QbitAI 华为今年全联接大会,最重磅的首先是 一组芯片时间表 。 昇腾960DT研发进度比原计划 提前三个季度 ,单芯片算力实现倍增,960DT支持2 PFLOPS FP8、4 PFLOPS FP4,HBM容量最高288GB、带宽9....
只做好一颗芯片远远不够
量子位
PFLOPS
华为汪涛
华为要打造AI算力底座
2026
乔不迟
凹非寺
公众号
QbitAI
2026-09-19
1 阅读
约9分钟阅读
梦瑶
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 华为汪涛:华为要打造AI算力底座,只做好一颗芯片远远不够 梦瑶 2026-09-19 16:28:51 来源: 量子位 乔不迟 发自 凹非寺 量子位 | 公众号 QbitAI 华为今年全联接大会,最重磅的首先是 一组芯片时间表 。 昇腾960DT研发进度比原计划 提前三个季度 ,单芯片算力实现倍增,960DT支持2 PFLOPS FP8、4 PFLOPS FP4,HBM容量最高288GB、带宽9.6TB/s。 对应的昇腾960超节点做到4096张NPU卡,最高8EFLOPS FP8算力、超过1PB HBM容量。 华为轮值董事长汪涛把后续路线一并摊开: 2028年昇腾970、2029年昇腾980,未来几年保持 “一年一代” 的演进节奏。 会后,汪涛接受量子位专访时把这个变化说得很直白: 从今年开始,950、960、970、980连续几代,未来几年我们坚持一年一代,走入了快速演进的节奏。这也是国内半导体制造、封装的上下游配套全部打通之后才实现的。 但华为这次想讲的,显然不只是一颗更快的芯片。 围绕960,华为把NPO光互联、超节点、CANN生态和韬定律一起摆上台面,给出的答案很明确: AI算力竞争已经越来越像一场系统工程。 单芯片倍增,但华为押注的是整套系统 先从这次核心的新产品说起——昇腾960。 相比上一代,960把算力、内存容量和带宽继续往上推,同时产品节奏明显加快。 按照华为披露,960DT比原计划提前三个季度准备就绪,960PR版本也将继续提前。 更值得注意的是昇腾芯片的 研发周期 。 汪涛专访时透露,960芯片已经在实验室测了好几个月。 “芯片从立项到产品化往往要三年,我们任何一次发布,都是产品已经在实验室反复测试、有准确交付时间之后才做。” 从950、960到后续的970、980,华为接下来几年计划保持一年一代快速演进的节奏。 AI大模型的训练和推理规模正在迅速扩大,单颗芯片再强,也很难独自承担万亿、十万亿参数模型的计算需求。 华为把突破口放到了“规模算力”上: 910C是384卡,950做到1024卡,960进一步扩到4096卡,并通过跨物理节点的统一内存编址,让多颗NPU互联起来更接近一台逻辑计算机。 汪涛提到,华为从仿真训练里看到,在同样十万卡集群下,4096卡超节点组成的集群相对传统八卡服务器组成的集群,MFU可提升2.75倍。 MFU可以简单理解为大模型真正吃到多少理论算力,集群越大,通信、同步、故障越容易把峰值性能吃掉。 汪涛因此反复强调, AI基础设施已经进入系统工程阶段。 只做好一颗芯片远远不够,只做一台服务器也不够,最后要交付一个高可用度的复杂系统才有价值。 这种系统工程能力,也是华为给自己总结的核心优势。 一个大规模超节点同时涉及芯片、通信、IP网络、光互联、供电、散热、软件和故障管理,单点性能强并不代表系统能长期稳定运行。 谈到华为在这一轮算力竞争中的位置,汪涛的判断很鲜明,“要做好这么大的超节点集群,需要通信技术、IP、光模块、算力、系统,华为干了30年, 每个领域都有长期大规模研发投资 。把这些能力全部聚在一个团队里,似乎 只有华为 。” 这也是昇腾960超节点值得关注的地方:当先进制程短期内仍然构成约束,华为选择继续提升单芯片,同时把竞争战线扩大到整个系统。 NPO落地,华为把30年光技术融入超节点 960超节点这一代最硬的新增技术,是 NPO(近封装光学) 。 NPO可以理解为一种用光来承担芯片间高速数据传输的技术。 过去高速数据传输主要依赖电信号,距离一长,损耗和功耗都会上升。 NPO把负责光电转换的“光引擎”往芯片附近推进,相当于“让电少跑一点,让光早点接手”,从而降低高速互联的传输损耗和功耗。 这也是为什么4096卡超节点开始需要NPO——卡越多,芯片之间的数据交换越频繁,互联能力就越容易从配角变成 决定整个系统效率的关键 。 而昇腾960是 业界首个 采用NPO光引擎的超节点。 华为用这套NPO架构做的具体产品,就是Hi-ONE光引擎。 单引擎集成36路200G,总传输容量7.2Tbps,并把光源直接内置。 汪涛在圆桌上把Hi-ONE的领先性概括为 “三个第一” : 第一个规模商用的,大家还在实验室阶段;第二个最大的带宽,36路200G集成;第三个唯一内置光源的。 值得注意的是,华为没有直接一步走向CPO(共封装光学)。 CPO把光引擎和主芯片封在一起,理论上还能进一步缩短距离,但今天 可靠性、良率、成本和维护 都还没到华为认为适合大规模商用的状态。 汪涛解释得很具体:“CPO把光引擎和主芯片放一起,光引擎坏了整个主芯片就报废,可用度差,故障成本极高,对封装厂要求也高。现在NPO的TCO至少比CPO低40%以上。 当前NPO是工程、成本各方面综合最佳选择。 ” 他对CPO的态度很开放,“未来CPO如果解决了可靠性、良率问题,华为也可能转向CPO,以进一步降低高速信号传输损耗。” 昇腾960超节点用约5500个Hi-ONE,替代原本约4.8万个800G光模块,功耗降低超过550kW, 系统无故障运行时间提升一倍,系统可用度为99.8%。 器件数量大幅减少,本身就意味着更少的故障点、更低的布线复杂度和更可控的系统功耗。 这也是“超节点+集群”路线能真正落地的前提之一: 华为需要的不只是把更多芯片连起来,还要确保系统规模变大以后,不被光模块、供电、散热和故障率反过来影响效率。 CANN跨过拐点,华为补上软件生态 硬件往前跑,生态要同步跟上。 CANN进入常态化开源社区运营,月活开发者超过5200人,外部开发者占比达到61%; 昇腾也进入PyTorch官方支持路线,开发者可以直接在PyTorch社区获得相关支持。 汪涛对此的表述反而很克制:“经过八年努力,我们今天只敢说 CANN生态跨过了拐点。 ” 华为下一步想把适配动作进一步前置,在模型进入预训练阶段时就和模型厂商协同,把昇腾适配、性能优化等工作尽可能提前完成,不是等一个模型发布后再迁移到昇腾。 很高兴看到中国涌现出一批十分优秀的大模型企业,既有头部互联网,也有大模型初创企业,他们的优异产品和强大的创新能力显著提升了中国人工智能的全球影响力。华为的使命是为这些优秀企业构建坚实的算力底座,做好他们坚强的后盾和伙伴。 汪涛表示,未来我们会看到越来越多模型基于昇腾原生训练,这样模型开源发布走向千行万业之后,就基本不需要再做适配和优化。 这背后对应的,是华为对自己在AI产业链中位置的一次明确划分。 汪涛直言: “华为的核心使命是打造算力底座。” 这句话其实给昇腾、超节点、CANN乃至整个AI基础设施业务划出了一条清晰边界: 华为希望把更多资源放在 芯片、互联、系统和软件底座 上,为模型厂商和互联网公司 提供算力支撑 。 “盘古会继续服务华为自身产品智能化,但华为并不打算在每一层都和伙伴竞争。灵衢协议已经开放,CANN代码也持续开源,华为想把更多研发资源放在芯片、超节点和算力底座
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱