智能AI
morning
SlideSparse:布局稀疏边界
2026-08-01
1 阅读
约10分钟阅读
微软研究院AI
字号:
(本文阅读时间:10 分钟) 结构化稀疏被认为是提升大模型推理效率的重要方向之一。为了支持这类计算模式,如今的 GPU 中引入了稀疏张量核( Sparse Tensor Core ),能够为 2:4 结构化稀疏提供最高 2 倍的矩阵运算吞吐。其中, 2:4 稀疏要求每 4 个连续权重中恰有两个为零。尽管这一机制具备显著的加速潜力,但 50% 的剪枝率对于大语言模型而言往往过于激进,即使经过微调,仍可能带来明显的精度损失和能力退化。 而 6:8 等温和稀疏模式则能够在保持模型能力的同时实现有效压缩。但是, 6:8 虽然保持了模型能力,却无法获得硬件加速。当前稀疏张量核仅支持 2:4 这一种格式,不符合该格式的稀疏权重只能回退到稠密计算。也就是说, 6:8 模型中 25% 的零元素在推理时并未带来任何计算或带宽上的节省 —— 算法层面的稀疏优势无法转化为部署上的实际收益。在量化精度已经覆盖了从 16 bit 到 4 bit 的丰富选择的同时,稀疏方向上, 50% 与 0% 之间存在一大片尚未被硬件覆盖的空白地带。 近日,微软亚洲研究院提出了 SlideSparse , 首次在 NVIDIA GPU 上使 6:8 、 4:6 、 8:10 等温和稀疏模式也能利用稀疏张量核加速,为这一长期存在的技术空白提供了解决方案 。相关论文已 被 ICML 2026 接收 。 图 1 : SlideSparse 将 6:8 稀疏权重转换为 2:4 兼容格式(左), A100 上不同模型的端到端加速(右)。 论文信息已整理至文末,欢迎点击相关链接,了解更多技术详情。 滑动窗口分解:让温和稀疏适配稀疏张量核 SlideSparse 的基本思路是将不满足 2:4 约束的稀疏块,分解为若干满足 2:4 约束的重叠子块。研究员们将这一策略称为 " 计算套利 " ( Computational Arbitrage ),通过适度的数据膨胀换取硬件层面的加速能力,从而释放稀疏张量核的计算潜力。 以 6:8 稀疏为例,一个长度为 8 的权重块中包含 6 个非零元素和两个零元素。由于两个零元素的位置可以任意分布,因此无法直接拆分为两个符合 2:4 约束的子块。 对此, SlideSparse 采用滑动窗口策略:使用 3 个大小为 4 、步长为 2 的窗口依次滑过这 8 个元素(第一个窗口覆盖位置 0-3 ,第二个覆盖 2-5 ,第三个覆盖 4-7 )。相邻窗口之间共享两个位置。当某个窗口内的非零元素超过两个时,多出的非零元素恰好位于与下一个窗口的重叠区域内,则可以被下一个窗口容纳。这一过程本质上利用了经典的 “ 抽屉原理 ” ,可确保所有非零元素均能被合理分配。 图 2 : SlideSparse 对 6:8 稀疏模式进行滑动窗口分解。 3 个步长为 2 的重叠窗口覆盖全部 8 个位置。非零元素超出单个窗口容量时,可通过重叠区域分配给相邻窗口。 经过变换后,原本的 8 个元素扩展为 12 个,维度膨胀 1.5 倍。但与此同时,所有生成的子块均满足 2:4 约束,可以直接由稀疏张量核执行。由于硬件能够提供两倍吞吐,因此最终可获得约 1.33 倍的理论加速比。论文进一步证明,对于任意 (2N−2):2N 稀疏模式,采用 N−1 个滑动窗口既是充分条件也是必要条件,因此这一膨胀因子已经达到理论最优。 值得注意的是,权重侧的滑动变换在离线阶段完成,不会增加推理开销。输入侧所需的对应重排操作( Activation Lifting ),本质上只是索引映射。研究员们将其融合至推理过程中已有的逐 token 量化 kernel 内,实现了极低的额外开销。而整个系统都集成于 vLLM 推理框架中,仅需少量修改即可启用。 将稀疏扩展为新的推理优化维度 过去几年,大模型推理加速主要沿着量化方向持续演进:从 16 bit 、 8 bit ,到 4 bit 甚至更低精度,各类压缩配置均逐步获得硬件支持。 相比之下,稀疏优化的发展长期受到硬件约束。目前主流 GPU 仅支持 2:4 稀疏格式,使得开发者不得不在“无稀疏”和“ 50% 剪枝”之间进行二选一。但 25% 、 33% 等温和稀疏比例往往能够更好地兼顾模型性能与压缩率,因此一直被认为是极具潜力的设计空间。 SlideSparse 的出现改变了这一局面。通过将更多稀疏模式映射到稀疏张量核上执行, SlideSparse 将稀疏优化从过去的两个极端状态扩展为一系列可灵活选择的配置,使稀疏压缩真正成为与量化压缩并列的重要推理优化维度 。 图 3 :推理加速的二维空间。横轴表示量化精度(最高 8× 加速),纵轴表示稀疏度(最高 2× 加速)。灰色点标记已有硬件支持,绿色点为 SlideSparse 新增支持的中间稀疏级别。 量化与稀疏本质上是两个相互独立的优化方向,可以组合使用。在未来的大模型部署过程中, 开发者不仅可以调整计算精度,还能够根据任务需求灵活选择不同稀疏比例,实现更加细粒度的性能 - 效率权衡 。 跨平台验证 SlideSparse 的加速能力 为验证方案的通用性,研究员们对 SlideSparse 在 6 款 GPU ( A100 、 H100 、 B200 、 RTX 4090 、 RTX 5080 、 DGX Spark )、 5 种精度( FP4 、 INT8 、 FP8 、 BF16 、 FP16 )、 5 个模型( Llama3.2-1B/3B 、 Qwen2.5-7B/14B 、 BitNet b1.58 (2B) )上进行了评测,覆盖数据中心、消费级和嵌入式三类平台。 图 4 : SlideSparse 在不同 GPU 平台上的端到端推理加速表现。上行为 Decode 阶段,下行为 Prefill 阶段。 实验结果表明,在计算密集的 Prefill 阶段, 6:8 稀疏能够充分发挥稀疏张量核的计算能力。在 A100 上, Qwen2.5-7B 模型实现了 1.33 倍的端到端加速,与理论上限高度一致。 在消费级 GPU 上, SlideSparse 同样展现出稳定收益。例如,在 RTX 4090 的 FP8 配置下, 6:8 稀疏可实现约 1.18 ~ 1.19 倍的加速。 Decode 阶段由于受到访存瓶颈限制,加速幅度相对较小,但仍可获得 1.07 ~ 1.21 倍的性能提升。 在实际服务场景测试中, Qwen2.5-14B 模型的首 token 延迟由 390 ms 降低至 291 ms ,进一步验证了 SlideSparse 的实际部署价值。 研究员们还对系统效率进行了深入分析。通过对比实测结果与理论预期发现,多数配置下的整体效率均超过 100% ,表明融合 kernel 的设计有效消除了滑动变换带来的额外开销,并在部分硬件平台上进一步释放了潜在性能。 图 5 :算法效率分析。在数据中心 GPU 上,效率均超过 100% ,表明融合 kernel 有效消除了额外开销。 重新释放温和稀疏的部署潜力 稀疏张量核是现代 GPU 中重要的硬件加速能力,但其应用长期受限于 2:4 结构化稀疏这一单一格式。对于能够更好兼顾模型性能与压缩率的温和稀疏配置而言,硬件支持始终存在缺口
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱