智能AI
morning
ExFold:统一专家折叠,无需培训 MoE 预填充解码加速
摘要
arXiv:2608.24938v1 Announce Type: new Abstract: Mixture-of-Experts (MoE) models scale capacity for strong quality while keeping per-token compute bounded through sparse expert activation. Yet low-late...
expert
the
experts
and
folding
while
token
prefill
decode
only
2026-08-27
1 阅读
约2分钟阅读
Juntong Wu, Yifei Liu, Junyi Chen, Siqi Fan, Chaoran Feng, Minghao Li, Liujie Zhang, Weihang Chen, Li Yuan
字号:
arXiv:2608.24938v1 公告类型:新 摘要:专家混合 (MoE) 模型可扩展容量以获得高质量,同时通过稀疏专家激活保持每个代币计算的限制。然而,低延迟 MoE 服务越来越具有挑战性,因为它跨越两个具有根本不同瓶颈的推理阶段:预填充由令牌式专家计算主导,而解码则受到来自批量激活专家集的内存流量的限制。然而,现有的免训练加速方法仅优化单个资源代理,即每个令牌执行的专家或批量激活的专家,并且丢弃排除的专家的贡献或仅将其隐式近似。在本文中,我们提出了 ExFold,一个统一的免训练专家折叠框架,用于联合加速 MoE 预填充和解码。 ExFold 将预填充和解码视为一个预算输出近似问题:仅执行特定于阶段的受限专家集,同时使用校准的标量投影仪将预算排除专家的贡献投影到保留的专家上。受到许多专家输出方向一致但幅度不同的观察的启发,ExFold 在未标记数据上校准成对标量投影矩阵,并在推理时使用它来将排除的专家贡献折叠到保留的专家中。在这种观点下,预填充加速变成了令牌级的Top-K折叠,而解码加速变成了批处理级的专家池折叠。这两个阶段的不同之处仅在于如何选择保留的专家,而排除的贡献则通过一种共享的折叠机制来恢复。我们将 ExFold 作为 vLLM 中的即插即用插件实现,具有轻量级专家折叠 CUDA 内核,可提供高达 1.41 倍的 TTFT 和 2.45 倍的 TPOT 加速,同时保留约 99% 的原始平均质量。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱