智能AI
morning
RBS-Attention:长上下文大语言模型的半径有界稀疏预填充
摘要
arXiv:2609.20971v1 Announce Type: new Abstract: Long-context large language model inference is increasingly limited by prefill, where dense self-attention processes the entire prompt before generation...
and
prefill
the
block
attention
dense
selection
branch
times
speedup
2026-09-21
1 阅读
约2分钟阅读
Chuxu Song, Jiuqi Wei, Zhencan Peng
字号:
arXiv:2609.20971v1 公告类型:新 摘要:长上下文大型语言模型推理越来越受到预填充的限制,其中密集的自注意力在生成开始之前处理整个提示。稀疏区块选择可以降低这种成本,但是区块质心可能会在许多不相关的令牌中隐藏高度相关的令牌。我们将这种故障模式称为均值稀释,并提出了 RBS-Attention,这是一种具有两个互补选择分支的免训练稀疏预填充方法。质心基础分支捕获平均相关性,而救援分支使用最大关键块半径及其提示、层和头部相关的分布来识别有低估风险的块。独立地对两个分支进行阈值处理并组合它们的掩码可以控制救援块的贡献,同时保留常规的块稀疏 FlashAttention 执行。在 H100 GPU 上,RBS-Attention 在 Qwen3-30B-A3B-Instruct-2507-FP8 上以 128K 速度实现了 20.65$\times$ 独立预填充注意力加速、11.92$\times$ vLLM 预填充注意力加速和 5.97$\times$ 端到端首次令牌时间加速。在密集 Qwen3-32B 模型上,它获得了 88.65 的总体 RULER 准确度,而密集注意力模型的总体准确度为 89.52; LongBench-v2、InfiniteBench 和 Video-MME 提供额外的质量评估。支持实验测量实际保留,比较匹配密度的选择器,并表征块大小、阈值和内存行为。总之,这些结果支持半径自适应双分支选择作为长上下文预填充的有效方法。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱