智能AI
morning
校准,然后路由:针对分类 LLM 服务的学习请求路由的测量研究
摘要
arXiv:2609.16206v1 Announce Type: new Abstract: Disaggregated LLM serving places compute heavy prefill and memory heavy decode on separate GPU pools. Systems such as DistServe, Splitwise, and Mooncake...
the
and
length
with
pools
each
router
run
three
traces
2026-09-17
1 阅读
约2分钟阅读
Srikanta Datta Tumkur, Jay Iyer, Mehar Simhadri, Sai Pavan Kumar, Sai Kapil Kumar, Ramesh Nampelly
字号:
arXiv:2609.16206v1 公告类型:新摘要:分解的 LLM 服务将计算量大的预填充和内存量大的解码放在单独的 GPU 池上。 DistServe、Splitwise 和 Mooncake 等系统可以快速实现这种分离,但路由仍然决定哪些实例处理每个请求。我们研究了一个路由器,它使用精确的提示长度、预测的输出长度、准入后 KV 缓存压力和 SLO 类来估计每个实例的额外完成时间。我们在离散事件模拟器中开发该策略,并在八个 NVIDIA A40 GPU 上对其进行验证,每个 GPU 运行一个 vLLM 引擎,并使用 NIXL 在池之间传输 KV 缓存。所有工作负载都在测量的饱和度下运行。在三个混合的突发到达轨迹中,经过校准的路由器实现了 0.864 的最高平均吞吐量,而循环、最少负载和长度启发式的平均吞吐量为 0.835 到 0.847。它还显示了迹线之间的最低方差。它在所有三个轨迹上都击败了循环法和长度启发式,并且在两个轨迹上击败了最少负载。第三次,它落后了 0.003,在运行噪声范围内。硬件校准很重要:模拟器导出的常量会花费 4.5 个有效点和大约 40% 的尾部延迟优势,从而将计分器减少到仅比队列计数多一点。优势随着解码池大小和流量异构性而增长,但在具有三个实例的池中消失,其中队列计数通常就足够了。在极度稀缺的情况下,贪婪成本最小化将请求集中在最便宜的得分实例上,盲目扩散表现更好。通过校准成本,学习的路由器与使用六个 GPU(而不是七个)的循环赛的吞吐量相匹配。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱