开发者生态
morning
LLM推理的有效前沿
2026-09-02
1 阅读
约4分钟阅读
philipkiely
字号:
在人工智能行业,我们借用了经济学家的“有效前沿”这个词。我们用它来讨论管理权衡,最常见的是模型成本和功能之间的权衡。如果一个模型在给定的成本或尺寸下提供了最高程度的智能,那么它就是“前沿模型”。 ✕ 有效前沿显示了在资源有限的环境中在两个有价值的结果之间进行权衡时的最佳组合范围。我们在推理工程方面也拥有高效的前沿。大多数情况下,这表示为延迟和吞吐量(决定成本)之间的权衡,尽管我们也可以用质量换取吞吐量(通过量化、蒸馏和修剪)或用智能换取速度(以推理水平的形式)。推理工程师可以使用两种类型的技术: 在两个因素之间进行权衡以沿着有效边界移动部署的技术。这些技术可以拓展给定部署的整个前沿,创造更高的整体效率,可以分配给任何最有利的结果。两种技术都很有价值。能够通过权衡来瞄准有效边界上的任何一点是很有用的。放弃每个用户的速度可以为批量工作负载构建高吞吐量、低成本的管道。当对延迟敏感的用户有很高的支付意愿时,牺牲吞吐量来提高速度是有意义的。当然,拓展整个边界是非常有用的。提高效率可以创造收益,这些收益可以分配给更低的延迟、更高的吞吐量或两者的组合。本文详细介绍了哪些推理工程技术可以让您瞄准前沿上的一个点,以及哪些技术将整个前沿推出。在本文中,我们假设我们正在运行 GLM-5.3 或 Kimi K3 等 LLM 进行代理编码,并启用 KV 缓存重用和最佳 KV 感知路由。管理权衡的技术在生产中达到某个目标通常不是发现一些新颖的方法,而是根据流量的性质找到正确的配置集。 ✕ 权衡管理技术可让您在有效边界上取得成果。在实践中,有效边界非常参差不齐。微小的变化可能会产生巨大的影响,而不是结果之间的平滑、连续的界限。这些截止点通常不直观,必须通过扫描凭经验发现。批次大小调整 延迟和吞吐量之间最明显的权衡来自于批次大小调整。批次是同时处理的请求数。虽然令牌级连续批处理意味着等待批处理启动不会产生任何延迟,但配置的批处理大小决定了每个用户的延迟和总体吞吐量。对于小批量,每个用户的延迟非常好,但每个 GPU 生成的总令牌很少。这意味着每个代币的成本相当高。增加批量大小会产生相反的效果:每用户延迟更差,整体吞吐量更高,成本更低。并行策略当今的法学硕士要测量数千亿或数万亿个参数,并且必须分布在多个 GPU 上。它们在 GPU 之间共享或并行化的方式可以提高延迟或吞吐量。 ✕ 并行性将大型模型拆分到多个 GPU 上。对于延迟敏感的部署,重点关注增加张量并行度 (TP)。虽然 TP 的全对全通信成本高昂,但它可以有效降低延迟,因为这些操作在高带宽 NVLink 互连上速度很快。专家并行 (EP) 有助于降低延迟和吞吐量。较低程度的 EP 通常与更好的延迟相关,而宽 EP(包括跨整个 GPU 机架的 EP)通常支持更高的吞吐量。另一种提高吞吐量的并行技术是注意力数据并行(ADP)。该技术复制注意力层以进行并行计算,从而以牺牲每个请求的速度为代价来提高系统吞吐量。量化 量化,或者运行权重、激活和/或 KV 缓存值精度较低的模型,可以改善延迟和吞吐量。量化模型拓展了服务权衡的有效边界。然而,量化在质量和服务效率之间引入了一系列新的权衡。这是一个特别锯齿状的前沿,可以在很大程度上提高服务效率,同时几乎不降低模型质量,特别是在使用 MXFP4 和 NVFP4 等微缩放浮点数格式时。推动前沿技术这些技术成为头条新闻。提高整体性能是推理工程中最有趣的部分。 ✕ 突破前沿的技术可以创造普遍收益。最好的部分是这些技术通常是复合的。例如,将性能提高一倍
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱