首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

零GPU跑通DeepSeek!中国超算用CPU打了一场翻身仗:16节点顶80张显卡

摘要

快科技8月7日消息,据报道,全球排名第一的国产超算“灵晟”成功完成纯CPU架构下的MoE模型分布式推理部署。 该超算仅用16个计算节点即可流畅运行DeepSeek-V3/R1-671B满血模型,在并发数batch_size=2048时,输出吞吐量与80张主流GPU集群相当。 这意味着纯国产CPU架构首次在大模型推理领域实现了对GPU集群的正面抗衡, 彻底颠覆了“跑大模型必须用GPU”的传统认知。 ...

快科技8月7日消息 据报道 全球排名第一的国产超算 成功完成纯CPU架构下的MoE模型分布式推理部署 该超算仅用16个计算节点即可流畅运行DeepSeek 671B满血模型 在并发数batch_size 2048时 输出吞吐量与80张主流GPU集群相当 这意味着纯国产CPU架构首次在大模型推理领域实现了对GPU集群的正面抗衡
2026-08-08 1 阅读 约2分钟阅读 红茶
分享:
字号:
快科技8月7日消息,据报道,全球排名第一的国产超算“灵晟”成功完成纯CPU架构下的MoE模型分布式推理部署。 该超算仅用16个计算节点即可流畅运行DeepSeek-V3/R1-671B满血模型,在并发数batch_size=2048时,输出吞吐量与80张主流GPU集群相当。 这意味着纯国产CPU架构首次在大模型推理领域实现了对GPU集群的正面抗衡, 彻底颠覆了“跑大模型必须用GPU”的传统认知。 灵晟超算最独特之处在于其纯CPU架构路线。它没有采用堆砌GPU或专用加速卡的传统方案,而是在自研的LX2 CPU中直接集成了矩阵加速单元,支持多精度计算,让每颗CPU都能同时处理超算科学计算与AI推理任务。 这种片上融合的设计消除了CPU与加速卡之间数据搬移的开销。不过计算能力只是第一步,大模型推理的真正瓶颈在于内存带宽,模型参数需要频繁在计算单元和内存之间搬运。 为此LX2 CPU集成了首颗国产高带宽内存(HBM),总带宽达4TB/s,相比传统CPU内存带宽提升10倍。搭配自研的“灵启”高速网络,支持微秒级时延与10万节点组网,扫清了计算、带宽和通信三大障碍。 实测显示,经优化后MoE推理时延从1440微秒大幅降低至980微秒。 该团队还引入了DeepSeek多token预测加速技术,进一步提升了输出速率。 此次突破表示,灵晟超算不再只服务于传统科学计算,已正式纳入国产AI大模型的生产服务体系。 值得一提的是,今年6月23日,灵晟超算在德国汉堡ISC2026大会上正式登顶全球超算TOP500榜单,这是时隔九年中国超算再次排名全球第一。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱