智能AI
morning
KV缓存应该放在哪里?针对长期会话的 GPU、CPU 和 SSD 的放置策略
摘要
arXiv:2609.16215v1 Announce Type: new Abstract: GPU high bandwidth memory is scarce and expensive, and KV caches consume much of it as chats, agent loops, and document question answering accumulate st...
and
reuse
GPU
question
frequency
agent
document
answering
with
predictor
2026-09-17
1 阅读
约2分钟阅读
Srikanta Datta Tumkur, Jay Iyer, Mehar Simhadri, Sai Pavan Kumar, Sai Kapil Kumar, Ramesh Nampelly
字号:
arXiv:2609.16215v1 公告类型:新 摘要:GPU 高带宽内存稀缺且昂贵,KV 缓存在聊天、代理循环和文档问答累积状态时消耗大量内存。 Mooncake、LMCache、FlexGen、InfiniGen 和 AttentionStore 等系统通过 CPU DRAM 和 SSD 扩展 GPU 内存。更难的问题是哪些块属于每一层,何时移动或驱逐它们,以及预取是否有帮助。我们在涵盖 GPU HBM、CPU DRAM 和 SSD 的离散事件模拟器中研究这些选择,并根据随机森林执行时间预测器进行校准。我们比较了聊天、代理和文档问答工作负载的新近度、重用频率、预测重用以及带有预取前瞻的 EWMA 预测器。分层支持每个 GPU 的并发会话数增加 73.02 倍,并将每个会话的成本降低 62.04 倍。这些收益来自 1+8+64 的层级容量,而不是布局策略。在我们的设置中,解码在批量大小为 1 时受到计算限制,因此放置位置几乎不会影响吞吐量。它主要改变 PCIe 迁移流量和首次令牌的时间。新近度产生的迁移流量比聊天重用频率少 2.30 倍。重用频率对于代理和文档问答表现最佳。现有的预测重用策略与新近度字节相同,使其代理推荐有效地新近度。真正的 EWMA 预测器会改变行为,但在工作负载预测方面仍然落后于重用频率,预计会有所帮助。预取并不能证明其带宽成本是合理的。在策略和缓存大小网格中,即使是了解未来请求的预言机也永远无法在迁移流量上进行预取。特定于工作负载的放置可以减少数据移动,但在实施时不支持预测的重用和预取建议。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱