智能AI
morning
BF1:针对高效长上下文 Transformer 的因果二元稀疏注意力改造
2026-08-24
1 阅读
约2分钟阅读
Hina Dixit
字号:
arXiv:2608.20427v1 公告类型:新 摘要:即使使用高度优化的精确内核实现,密集因果注意力在长上下文中仍然昂贵。我们研究 BF1,一种确定性的块对齐二元稀疏注意力路线,它结合了一个小的精确局部邻域、一个全局第一个块和对数间隔的历史块。该路线与先前的对数稀疏和扩张注意力模式有关;我们的贡献是正确性门控预训练模型改造、匹配的拓扑控制研究以及将每层稀疏性与整个模型延迟联系起来的系统表征。对于固定的块宽度,每个转换层使用 O(n log n) 选定的令牌交互,并具有 O(log n) 图形通信深度。在 NVIDIA RTX PRO 6000 Blackwell GPU 上,优化的 BF16 实现跨越了 2K 和 4K 令牌之间的密集注意力,并在 32K 时达到了 10.91 倍的每层预填充加速。对 28 个 Qwen3-0.6B 注意力层中的 8 个进行改造,在 8K、16K 和 32K 时,第一个 token 的热整个模型时间分别降低了 7.7%、11.3% 和 15.3%,而其余的密集层则保持完整模型渐近二次。在匹配的 1,000 步、16.384M 令牌适应协议下,BF1 在三个训练种子中排名第一:平均报告困惑度为 1.68639,匹配的静态随机非局部图为 1.69154,密集持续训练为 1.69258,等预算局部滑动为 1.81505。在种子 1234 处,打包报告配对区间将 Dense-CT 置于 BF1 之上 0.3169-0.4055%,将静态随机图 17 置于 BF1 之上 0.2441-0.3642%。这些结果将 BF1 确立为具有真正长上下文系统价值的可重复稀疏算子和选择性改造原语。本文评估了数值正确性、选择交互缩放、内核性能、部分模型推理和匹配的下一个令牌语言建模。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱