首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

AI算力之争不靠堆卡!浪潮信息捅破智算「能力天花板」,还瓦解了「产能焦虑」

摘要

AI算力之争不靠堆卡!浪潮信息捅破智算「能力天花板」,还瓦解了「产能焦虑」 克雷西 2026-09-22 10:22:06 来源: 量子位 克雷西 发自 凹非寺 量子位 | 公众号 QbitAI AI算力的竞争,多年来就一个字——堆。 堆卡、堆机柜、堆发电机……似乎计算卡足够多、集群足够大,就能站在食物链顶端。 但算力「够不够用」这个问题,已经不再能单靠堆卡来解决,它开始分化出越来越多的层面。 第...

克雷西 量子位 前沿模型的参数规模 上下文长度 推理深度在同时变大 Token需求在爆发 IDC报告显示 到2030年 Capability AI算力之争不靠堆卡
2026-09-22 1 阅读 约9分钟阅读 克雷西
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> AI算力之争不靠堆卡!浪潮信息捅破智算「能力天花板」,还瓦解了「产能焦虑」 克雷西 2026-09-22 10:22:06 来源: 量子位 克雷西 发自 凹非寺 量子位 | 公众号 QbitAI AI算力的竞争,多年来就一个字——堆。 堆卡、堆机柜、堆发电机……似乎计算卡足够多、集群足够大,就能站在食物链顶端。 但算力「够不够用」这个问题,已经不再能单靠堆卡来解决,它开始分化出越来越多的层面。 第一个问题关于 智能上限 ,也就是你的算力能撑起多强的智能。 前沿模型的参数规模、上下文长度、推理深度在同时变大,Agent可能连续运行几个小时甚至几天。 模型在一台机器里装不装得下、跑得快不快、长时间跑起来稳不稳,都需要被重新考量。 另一个问题是 智能规模 ,这个问题更直击灵魂——你的算力能以多低的成本生产多少智能? Token需求在爆发,但推理负载是多元的,Prefill和Decode的计算特征不同,堆同一种算力已经覆盖不了这些差异。 智能上限和智能规模,两个问题各自独立,又相互关联,只解决其中一个,无法突破全部的算力瓶颈。 刚刚的AICC(人工智能计算大会)2026上,IDC发布了 《2026年中国人工智能计算力发展评估报告》 ,把这两个方向拆开讲了一遍。 「一分为二」的算力缺口 Agent大爆发以后,AI对算力的需求正在发生质变。 过去,人们使用大模型时,算力调用更像是「脉冲式」的,用户问一个问题,系统返回一个答案,只调用一次算力。 但在Agent接管任务之后,情况变了。一个人类意图可能触发几十次、几百次连续推理;多个Agent组成协作网络之后,系统连续运转的时长,还能进一步增加到几个小时甚至好几天。 原本一次次短暂发生的算力请求,开始变成持续不断的计算负载,并 进一步给基础设施带来新的压力 。 这种长流的压力,可以拆解出三个影响因子。 第一个是任务执行次数,IDC报告显示,到2030年,全球每年的AI推理任务将增长4000万亿次; 第二个是单任务Token消耗量,过去一次简单问答只消耗几十个Token,现在一次多轮任务决策要消耗几十万个; 第三个是多智能体协同的「放大系数」,一个用户操作会被拆解成多条Agent指令,Agent之间传递上下文、汇总结果又拉长了整条任务链路,进一步放大了前两项的增长。 三个因子以乘法的形式叠加在一起,将算力需求的增长曲线拉到了前所未有的高位。 IDC数据显示,从今年到2030年,全球Token消耗量的复合增长率将达到4822.6%,Agent吃掉的Token正在急剧膨胀。 但 算力的供给增长速度,却滞后于需求的变化 。 IDC报告显示,全球AI算力需求满足率从2024年的79%一路下滑,2027年预计跌至71%,即便此后上游半导体供应链压力有所缓解,到2030年也只能恢复到77%左右。 百分比的波动看起来不大,但需求基数在急速膨胀,到2030年,算力缺口的绝对值将达到3809亿美元,扩大到2024年的将近十倍。 过去,弥补这种缺口的方式主要是靠「大力出奇迹」,也就是通过集群规模的扩展,堆叠更多的算力。 但 Agent时代的推理负载种类繁多,对算力设施的要求也不尽相同 。 Prefill阶段是高并行、高计算密度的任务,Decode阶段要逐Token串行处理、更吃内存带宽,Attention需要频繁访问不断增长的KV Cache,MoE包含稀疏计算和大规模路由调度,多模态模型还有独立的Encoder模块…… 这些负载各有各的计算特征,还会随着上下文长度、输出长度和并发规模动态变化。 Agent任务中,首轮对话的上下文可能只有一两万个Token,经过上百轮对话后会扩展到三四十万个,系统瓶颈在计算、显存、带宽和通信之间不断转移。 所以, 单纯堆料非但带不来线性的容量增长,反而会造成资源配比失衡 ,让一部分算力长期闲置,另一部分却持续过载。 实际上,这个缺口包含的是两个方向的问题。 一个是 能力上限 。 前沿模型的参数规模、上下文长度、推理深度在同时变大;一台机器装不装得下、跑不跑得快、长时间能不能跑稳,三个问题同时压了过来。 另一个关乎 产能 。 Token需求在爆发,但负载类型各异,不同推理阶段需要不同特征的算力,靠一种算力一招鲜吃遍天的路数,已经走不通了。 浪潮信息首席AI战略官刘军,把这两个方向概括为 Capability 和 Capacity 。 Capability AI Compute是 能力型智算 ,支撑前沿模型去碰那些过去碰不了的问题。 如今,AI已经能从靶点出发发现新的药物分子、完成筛选和设计并推进到临床试验,能求解困扰学术界几十年的NS方程和孪生素数猜想,能自主设计AI芯片并不断迭代性能…… 这些任务的共同特征是推理链条长、模型规模大、对算力系统的承载能力和稳定性要求极高。 Capacity AI Compute是 容量型智算 ,让智能的供给更充足也更便宜,让更多人和企业用得起。 算力也是同一个道理,光有能力上限的突破不够,让足够多的人用得到,才能真正落到实处。 捅破「能力天花板」,瓦解「产能焦虑」 面对这两层问题,浪潮信息在AICC2026上发布了两款产品——超节点AI服务器 「元脑SD200 Ultra」 和多元算力机组 「元脑HC2000」 。 突破单节点智能上限 SD200 Ultra解决的是前沿模型装不下、跑不快、跑不稳的问题。 「装得下」是从0到1的一步,模型需要先能运行,才有讨论性能的空间,SD200 Ultra通过 「紧致扩展」 解决这个问题。 它延续了去年SD200采用的3D Hyper Mesh架构,整机内的 芯片数量从64颗增加到了128颗 ,显存和扩展存储也相应提升到了8TB和64TB。 SD200 Ultra将足够多的计算、存储和通信资源压缩进一个物理边界内。 目前全球最大的开源模型Kimi K3有2.8万亿个参数,SD200 Ultra可以单机装下并高效运行。 不仅如此,SD200 Ultra 支持在单机上部署10万亿参数的模型 ,提前为未来更先进的开源模型做好了基础设施准备。 跑起来之后,人们便开始追求速度。 128颗芯片要协同工作,跨芯片的数据交换每秒高达数十万次,传统方式依赖软件调用和缓冲区中转来搬运数据,延迟开销很大。 SD200 Ultra分两层解决这个问题。 第一层是 「统一寻址」 ,通过全局统一编址、虚拟影子设备注册和跨域地址翻译,让128颗芯片的显存形成一个统一的地址空间,远端资源的访问从消息通信加数据搬移变成了地址空间内的直接访问。 第二层是 「对称直连」 ,在统一寻址的基础上,通过对称内存技术实现GPU显存直连,GPU可以像访问本地显存一样直接读写远端GPU的显存,由GPU发起通信,跳过地址转换和封包中转,通信路径大幅缩短。 最终,SD200 Ultra的All to All通信时延缩短到0.69微秒,达到国际主流超节点产品相当的水平。 除了通信之外,计算也需要优化。 以K
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱