首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

KVBoost:块级键值缓存重用与偏差引导重新计算以实现高效的大型语言模型推理

摘要

arXiv:2608.21362v1 Announce Type: new Abstract: Transformer-based large language models (LLMs) incur high prefill latency because key-value (KV) tensors must be recomputed for each request. Existing p...

KVBoost and prefix content models hash boundary based high for
2026-08-25 1 阅读 约2分钟阅读 Srihari Unnikrishnan
分享:
字号:
arXiv:2608.21362v1 公告类型:新 摘要:基于 Transformer 的大型语言模型 (LLM) 会产生较高的预填充延迟,因为必须针对每个请求重新计算键值 (KV) 张量。现有的前缀缓存系统降低了这种成本,但需要提示共享前导连续前缀,从而限制了共享内容出现在任意位置时的有效性。我们提出了 KVBoost,这是一种用于 HuggingFace 兼容解码器模型的块级 KV 缓存重用系统,无论内容位置如何,都可以重用。 KVBoost 引入了双哈希键控方案,将位置身份(前缀哈希)与内容身份(内容哈希)分开,支持精确和近似缓存匹配。为了解决独立缓存块的注意力边界错误,KVBoost 采用两种修复策略:SelectiveRecompute(重新编码边界区域)和 CacheBlendRecompute(在探测通过后识别并重新计算高偏差标记)。该系统进一步结合了非对称 KV 量化 (int8/int4)、自适应块边界分割和固定内存预算下的重要性加权驱逐。在 Qwen/Qwen2.5-3B 上对 1,000 个错误定位样本进行评估后,KVBoost 将首次标记时间缩短了 4.49 倍(142.4 毫秒 vs. 639.1 毫秒),并且比前缀缓存性能高出 16%,且准确度没有损失(99.2% vs. 99.1%)。 KVBoost 提供实用的、受内存限制的推理加速层,与基于 RoPE 的模型兼容,无需进行架构修改。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱