智能AI
morning
注意力感知路由:MoE 中的路由和注意力耦合
2026-09-21
1 阅读
约1分钟阅读
Despoina Kosmopoulou, Anastasios Tsetsilas, Efthymios Georgiou, Giannis Karamanolakis, Swastik Roy, Alexandros Potamianos
字号:
arXiv:2609.20974v1 公告类型:新 摘要:在专家混合语言模型中,路由器通常利用有限的上下文信息,根据令牌的隐藏状态来选择专家并对其进行加权。我们提出了注意力感知路由(AAR),它通过从注意力权重滑动窗口中提取的时间和频谱特征来增强路由器,这些特征代表了模型上下文状态的摘要,与隐藏状态分离。保持基本变压器完全冻结,我们只训练路由参数,将路由隔离为唯一变量。与 OLMoE 上仅路由的 SFT 基线相比,AAR 将 GSM8K 提高了 +3.37 个百分点。除了性能之外,我们还表明路由和注意力形成了一个耦合电路:第 l 层的路由变化通过残差流传播,以放大第 l+1 层的注意力池,重塑注意力,而无需对注意力机制本身进行任何直接更新。此外,AAR 减少了长发散生成,错误答案变得更短,而正确答案的长度保持不变。最后,AAR 对深度非常敏感:跨层不加区别地应用它会降低事实检索的性能,而当它被引入到网络更深处时,数学推理的增益仍然存在。这种敏感性暴露了跨深度的检索推理张力,并使层选择性 AAR 成为不同层注意力所携带的路由相关信息的受控探针。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱