智能AI
morning
TinyCeNN-LM:使用受 CeNN 启发的细胞循环层对预训练注意力进行质量门控转换
摘要
arXiv:2609.21139v1 Announce Type: new Abstract: Replacing attention in a pretrained language model is a compatibility problem: a plausible substitute may alter representations expected by later layers...
layers
and
NLL
attention
conversion
with
are
quality
gated
recurrent
2026-09-21
1 阅读
约1分钟阅读
Kabeh Mohsenzadegan, Vahid Tavakkoli, Kyandoghere Kyamakya
字号:
arXiv:2609.21139v1 公告类型:新 摘要:在预训练语言模型中替换注意力是一个兼容性问题:合理的替代可能会改变后面各层所期望的表示。 TinyCeNN-LM 引入了一个 \emph{质量门控后训练转换} 框架,该框架使用受 CeNN 启发的细胞循环层,具有有限的本地处理、紧凑的循环内存、路由、融合和接受或回滚验证。研究了三种实现:Integrated Memory、MemoryFusion 和 PDelta3-GDN2-CLVR+Local32。仅当表示和 NLL 标准通过固定阈值时,严格的 PDelta3 转换才接受层。在 SmolLM2-135M 上,第 0-2 层被接受,累积 $\Delta\mathrm{NLL}=+0.01209$,而第 3 层被拒绝,尽管 NLL 可接受,因为表示保真度失败。在 Qwen3.5-0.8B 上,全注意力层 3、7 和 11 被接受,最终 $\Delta\mathrm{NLL}=+0.02073$。集成内存将复杂度保持在 $-0.07\%$ 到 $+0.93\%$ 之间,同时将总缓存减少高达 $6.01\%$。采样的 200 项下游健全性检查为转换后的 Qwen 版本提供了 $28.5\%$--$32.0\%$ 的总体准确性。结果支持保守的、质量控制的结构转换,而不是普遍的注意力替换或加速。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱