首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍

摘要

PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍 思邈 2026-09-24 22:17:48 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号QbitAI 随着大模型对算力需求持续攀升, GPU卡的采购成本、供给约束持续加剧。 AI推理的竞争正在悄然发生转向:不再单纯比拼“谁能够买到性能最顶级的硬件”,而是转向“谁可以把手中已有的算力资源用得更值”。 很多GPU卡...

内核补齐 Meta 该图由是石科技提供 量子位 算子优化与通信重构 并行与容量调优 tok PCIe显卡被低估了 通信重构 DeepSeek推理吞吐翻近7倍
2026-09-24 1 阅读 约9分钟阅读 思邈
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍 思邈 2026-09-24 22:17:48 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号QbitAI 随着大模型对算力需求持续攀升, GPU卡的采购成本、供给约束持续加剧。 AI推理的竞争正在悄然发生转向:不再单纯比拼“谁能够买到性能最顶级的硬件”,而是转向“谁可以把手中已有的算力资源用得更值”。 很多GPU卡,开源框架能够完成模型加载、权重下载、服务拉起,实现“能跑起来”,但实际压测性能往往远低于官方宣传水平。模型本身没有缺陷,硬件也可正常工作,性能损失的核心,来自模型框架与硬件之间存在的性能鸿沟。 这类GPU卡没有高速卡间互联,同时不在主流开源框架官方验证矩阵中。直接使用社区默认部署方案,会出现算子自动回退至低效通用实现、集合通信沿用NVLink硬件的调优参数、显存与并行配置沿用其他硬件默认值等一系列问题。硬件本身具备的算力潜力,被软件层的适配短板所禁锢。 是石科技(METASTONE)是一家“独立第三方全栈算力运营商”的科技企业。不绑定任何特定大模型厂商,致力于为客户提供涵盖硬件、组网、调度、优化与运营的一站式全栈算力交付服务。 凭借源自国家级计算中心的丰富经验,公司确保了算力集群高达99.95%以上的安全稳定运行(SLA)。目前,是石科技已纳管超过20000P的算力资源,运营10多个智算中心,拥有2个国家级超算中心。团队成员曾荣获3项戈登·贝尔奖,具备深厚的超大规模集群全栈技术服务实力等。 是石科技自研Meta-Infer高效部署引擎,是面向异构加速芯片的企业级高性能大模型推理引擎,尝试通过纯软件优化手段弥合这道硬件-框架之间的缝隙,在不改动模型结构、不修改任务语义的前提下,充分挖掘GPU卡架构硬件的推理能力,为行业提供一种可能性: 依靠软件优化,成本更低的GPU卡,有机会在部分推理业务指标上,逼近原本需要更高端GPU才能实现的服务能力。 Meta-Infer高效推理引擎的整套优化逻辑,分为两大关键阶段: 算模协同,释放被硬件差异屏蔽的高性能路径; 通算重构,打通瓶颈,充分榨干硬件资源。 最终将沉淀为Meta-Infer高效推理引擎的四项核心能力: 内核补齐、算子优化与通信重构、并行与容量调优、缓存复用 。 1、内核补齐 主流推理框架内置了大量高性能算子,但对于不在官方验证清单的长尾硬件,框架不会报错,只会静默绕开加速路径,降级运行低效通用逻辑。 很多高性能内核并非缺失,只是元数据、页尺寸、硬件内核适配不匹配,导致无法被触发执行。 Meta-Infer高效推理引擎,通过内核补齐完成适配修复: 对齐硬件与框架之间的元数据定义,修正页尺寸配置,解锁原生高性能算子路径; 替换不适配硬件的老旧计算内核,切换为面向目标硬件深度调优的实现; 扩大通信快路径的生效阈值,让更多规模的通信任务避开慢速回退逻辑。 △该图由是石科技提供 以DeepSeek-V4.1-Flash为例,在8张PCIe-Only显卡环境的社区Day0基线版本中,输入吞吐仅1932 tok/s。 经过算模协同阶段的修复适配,补齐sparse-MLA Prefill快路径,替换FP8稠密GEMM慢内核,扩大PCIe-IPC通信快路径覆盖范围,吞吐直接提升至5850 tok/s。 这一阶段的提升,并不是创造全新算法,而是把硬件与框架本就具备、却被适配问题锁住的性能释放出来。 △该图由是石科技提供 △该图由是石科技提供 同样的思路也复现在DeepSeek-V4-Flash、GLM5.3等模型上:修正注意力头补齐的冗余计算,对KV缓存标记逻辑做向量化加速,适配硬件特性重构算子拆分逻辑,拓展CUDA计算图覆盖范围,让更多请求批次可以进入加速图执行。仅仅完成算模协同,多款模型就拿到20%-33%不等的吞吐增益。 完成硬件适配、解锁加速路径之后,性能瓶颈会进一步转移到通信开销、并行调度、显存分配、重复计算等环节。PCIe-Only架构卡间通信带宽远低于NVLink,如果直接套用面向高速互联硬件的默认策略,GPU会花大量时间等待通信完成,算力资源被闲置浪费。 2、算子优化与通信重构 依托算子优化与通信重构,Meta-Infer高效推理引擎对注意力、投影等关键算子做算子融合,压缩单步计算耗时;将计算任务和集合通信做时间重叠掩盖,把统计类计算嵌入通信间隙并行执行;改写集合通信逻辑适配PCIe带宽特性,降低消息传输带来的等待开销。 3、并行与容量调优 在此基础上开展并行与容量调优,放弃框架全局固化的并行参数,针对Prefill预填充、Decode生成不同运行阶段差异化配置张量并行、上下文并行策略;结合硬件显存特性,动态调整静态显存占比、KV缓存容量参数,规避显存溢出与算子回退;面向不同业务负载,灵活匹配流水线、张量并行的组合形态,让高并发短请求、超长上下文请求都可以拿到最优执行配置。 4、缓存复用 面向长文本、视频生成场景,缓存复用能力提供风险感知的缓存复用机制,根据实时生成状态动态判断缓存复用与刷新时机,在不牺牲输出质量的前提下削减重复计算与显存读写。 在DeepSeek-V4.1-Flash的实践中,完成算模协同之后,经过通算重构的全套调优:注意力算子融合、合理裁剪投机解码草稿长度、计算通信重叠、区分Prefill/Decode并行策略、重新调校显存容量参数,输入吞吐从5850 tok/s进一步提升至13274 tok/s,整体实现6.87倍吞吐提升,并且支持1M超长上下文。 这套方法论具备通用性,覆盖文本大模型、长上下文、视频生成多类任务: DeepSeek-V4-Flash:经过全套优化输入吞吐从14546 tok/s提升至22584 tok/s,提升1.55倍; GLM5.3:输入吞吐自3236.78 tok/s提升至6222.72 tok/s,提升1.92倍;P95首Token时延从141.6秒下降至46.6秒,上下文支持上限从27万Token拓展到105万Token; 在相同并发点配对比较下,B300的输入吞吐约为这台8卡整机的4.9–5.6倍(DeepSeek-V4-Flash,B300侧按SGLang cookbook推荐参数配置,C8输入33,937 / C256 60,486 tok/s),GLM-5.3 ¹上这一比值为3.5–4.7倍(B300侧C8输入16,384 / C64 23,503 tok/s)。 MiniMax H3视频生成模型:依托稀疏注意力、自研风险感知缓存复用、Turbo LoRA多手段组合,15秒参考图生视频端到端生成速度提升2.48倍,峰值显存与原始稠密基线保持持平。 △该图由是石科技提供 单机8卡整机配置,文生视频最高吞吐达到基线的5.33倍,参考图生视频达到基线的4.98倍,在不明显损失画质的前提下大幅缩短视频生成耗时。 把这组整机吞吐放到顶级GPU的同一把标尺上,差距比直觉更小:在统
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱