首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

现代 Transformer 是隐式混合体:从功能差异化到有原则的混合架构设计

摘要

arXiv:2609.02986v1 Announce Type: new Abstract: Hybrid architectures combining Full Attention (FA) and Linear Attention (LA) are increasingly prominent, yet their allocation remains heuristic. We seek...

and positional retrieval head RoPE modeling Hybrid Attention allocation Transformers
2026-09-04 1 阅读 约2分钟阅读 Runlin Shi, Bojian Yin, Guoqi Li
分享:
字号:
arXiv:2609.02986v1 公告类型:新 摘要:结合完全注意力(FA)和线性注意力(LA)的混合架构越来越突出,但它们的分配仍然是启发式的。我们寻求基于 RoPE 的 Transformers 学习到的高层职能组织的循证基础。行为探针不能产生完整的分类法,因此我们提出了两个干预指标:RoPE 频率重要性评分 (RFIS),测量每个频率如何影响头部的注意力分布;以及 RoPE 位置依赖性 (RPD),隔离对旋转位置调制的依赖性。在 Qwen3 系列模型和 Llama3.1 上,RFIS 建议并由 RPD 验证由显着中低频段分隔的检索和定位头的完整分类。受控变形金刚表明,该边界遵循训练长度位置尺度;我们将其称为全球定位带 (GPBand)。该分析提出了零样本长度外推失败的潜在原因,并得出两个原则:位置建模应仅在本地运行,通过与位置无关的检索进行全局访问;并且这两个功能都应该在头部粒度上进行分配,并进行特定于层的分配。我们在 Head-wise Hybrid Architecture (HwH) 中实例化它们,使用 NoPE FA 进行全局检索,使用 LA 进行局部位置建模。由于 FA 与 LA 的比率低于 1:3,HwH 保留了强大的语言建模和常识推理,同时改进了检索,并大大加强了 Transformer、LA 和分层混合基线上的零样本长上下文外推。消融验证了原则和组件角色,强调原则性混合架构设计是通向未来基础模型的一条有希望的途径。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱