智能AI
morning
KV Cache不用「精挑细选」?随机删除媲美最强基线,推理吞吐最高再提43%
摘要
大模型越来越会 “想”,也越来越能把 GPU 显存 “想满”。 在数学、科学问答和代码生成等任务中,reasoning model 往往会生成数千乃至数万 token 的长推理链。随着生成持续进行,每个历史 token 对应的 Key-Value 表示都会进入 KV Cache,显存占用随序列长度不断增长。对于长推理部署来说,KV Cache 很快会变成真正的系统瓶颈。 一种直接的解决思路是 KV...
Random
Attention
reasoning
token
Cache
eviction
signal
head
Prompt
https
2026-09-20
1 阅读
约10分钟阅读
机器之心
字号:
大模型越来越会 “想”,也越来越能把 GPU 显存 “想满”。 在数学、科学问答和代码生成等任务中,reasoning model 往往会生成数千乃至数万 token 的长推理链。随着生成持续进行,每个历史 token 对应的 Key-Value 表示都会进入 KV Cache,显存占用随序列长度不断增长。对于长推理部署来说,KV Cache 很快会变成真正的系统瓶颈。 一种直接的解决思路是 KV Cache eviction:给缓存设定固定预算,推理过程中不断判断哪些历史 KV 值得留下,其余永久删除。 过去几年的很多方法,核心都围绕同一个问题展开: 怎样更准确地判断一个 KV 将来还有没有用 ? 有的方法累计历史 attention,有的观察最近 query 的 attention,有的显式考虑 redundancy,还有工作进一步利用 value magnitude 或 key statistics。虽然打分方式不同,它们共享一个直觉:只要 importance signal 更准,就应该能留下更有价值的 KV。 来自 Salesforce AI Research 和 UIUC 的一项最新研究,却选择从一个近乎 “反算法” 的问题出发: 这些精心设计的 selection signal,本身到底贡献了多少? 研究团队提出 Random Attention:完整保护输入 Prompt,对后续模型自己生成的 reasoning trace 不计算内容相关的重要性分数,而是在每个 KV head 内独立随机保留。 结果有些反直觉。Random Attention 在四个模型、六个数学、科学与代码推理任务上整体可以媲美论文中表现最强的基线;在主结果表的 60 个 baseline comparison 中,它显著领先 31 个,显著落后只有 1 个。更进一步,在 vLLM 的 32k-token serving 测试中,由于省掉 scoring pass,Random Attention 相比最强基线 TriAttention 的吞吐还能再提高 32%–43%。 但这篇工作真正有意思的,并不只是 “随机方法居然很强”。作者进一步把这个结果拆开,试图回答两个更基础的问题: 过去方法的收益究竟来自 “选得准”,还是来自它们恰好保护了某些关键内容?而 reasoning trace 又为什么能够承受如此激进的随机遗忘 ? 论文标题:Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning 论文链接:https://arxiv.org/abs/2609.03430 项目主页:https://arthur-heng.github.io/Random-Attention-page/ 代码:https://github.com/SalesforceAIResearch/Random-Attention 不判断哪些 KV 重要,先把问题留下来 Random Attention 的方法本身非常简单,只有两条规则。 第一, 完整保护 Prompt 。System prompt、chat template 和问题描述对应的 KV 都不会被 eviction。第二, 其余模型 reasoning 部分的 KV 随机保留 。每个 KV head 都独立给候选位置生成随机分数,再留下 Top-K。 图 1:传统 KV eviction 依赖内容相关的 importance score 选择保留位置;Random Attention 只保护 Prompt,其余 reasoning KV 在不同 KV head 内独立随机保留。 从实现上看,这甚至只需要一次随机数生成和一次 Top-K。值得注意的是,“随机” 并不意味着所有历史 token 位置在任意时刻都同样容易留下。一个位置如果想留存得更久,就要连续通过多轮随机 eviction,因此它的留存概率会随时间呈几何衰减。最终形成的其实是一种很自然的 soft recency bias:较新的 reasoning 几乎总能留下,较老的信息则以稀疏、且不同 head 各不相同的方式散落在 cache 中。 也正因为如此,作者把 Random Attention 同时看作一个可部署的方法和一个 null baseline:如果一个更复杂的 selection signal 在相同 cache budget 和相同保护规则下都无法稳定超过随机选择,那么就需要重新审视这个 signal 到底提供了多少额外信息。 这里需要说明的是,论文主要比较的是 SnapKV、R-KV、VaSE、TriAttention 这类无需额外训练、在 decode 阶段直接执行 eviction 的方法,并没有系统比较需要额外训练或蒸馏的 learned selector。因此,文章的结论也并不是 “所有学习型 KV selection 都没有价值”。 随机删除,为什么还能媲美最强基线? 实验覆盖 Qwen3-4B、Qwen3-14B、Qwen3-32B 和 Phi-4-reasoning,任务包括 MATH500、GPQA-Diamond、AIME 2025、AIME 2026、HMMT 和 LiveCodeBench。主实验大约采用 4× KV Cache compression,LiveCodeBench 约为 3×,最大生成长度统一为 32k tokens。 在整体结果上,Random Attention 并没有因为 “随机选择” 而明显落后。图 2 左图汇总了约 4× KV Cache compression 下的平均准确率:尽管不计算任何内容相关的重要性分数,其整体表现仍与实验中的最强基线保持接近。 图 2:Random Attention 在约 4× KV Cache compression 下与实验中的最强基线保持相近准确率;在 32k-token vLLM serving 中,相比 TriAttention 吞吐提升 32%–43%。 效率上的差距则更加明显。在相同的 cache budget 和 serving kernel 下,Random Attention 在四个模型上相比 TriAttention 整体提升达到 32%–43% 。核心原因也很直接:Random Attention 不需要额外执行 scoring pass,只需要完成随机选择和后续的 cache compaction。 论文还进一步测试了更激进的压缩设置,将 compression factor 从 2× 一路提高到 16×。在 Qwen3-4B 和 Phi-4-reasoning 的数学、科学任务上,2× 压缩时各方法都接近 full attention;随着 cache budget 逐步收紧, Random Attention 仍然与 TriAttention 保持接近,而 VaSE 的性能下降得更加明显 。 这说明 Random Attention 的竞争力并不局限于主实验采用的约 4× 压缩设置,在更高压缩率下依然能够
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱