首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

LoKiFormer:具有解耦知识记忆的局部感知注意力,用于高效的大型语言模型预训练

摘要

arXiv:2608.12419v1 Announce Type: new Abstract: Large language models (LLMs) have achieved remarkable breakthroughs across various applications. However, their architectures remain inefficient in pret...

knowledge attention LoKiFormer that and models architectures two limitations sequence
2026-08-14 1 阅读 约1分钟阅读 Qiuwu Chen, Zimo Liu, Yuchen Li, Ying Sun, Yifan Zhang, Zhijie Qiu, Zeng You, Ryan Dong, Simeng Ma, Yaofo Chen, Mingkui Tan
分享:
字号:
arXiv:2608.12419v1 公告类型:新 摘要:大型语言模型(LLM)在各种应用程序中取得了显着的突破。然而,由于两个主要限制,它们的架构在预训练中仍然效率低下:(i)自注意力缺乏对局部性的明确归纳偏差,导致序列内部局部信息的冗余建模; (ii)专家混合(MoE)隐式地将知识存储与计算路径耦合起来,阻碍了对序列外部全局知识的灵活访问。为了克服这些限制,我们提出了 LoKiFormer,一种新颖的 LLM 架构,它通过两个专用模块增强了标准解码器:1)局部融合注意力(LFA),它将卷积融合与注意力结合起来,显式捕获局部模式并允许注意力在信息更丰富的表示上运行; 2)知识内存模块(KMM),引入参数化键值内存,将全局知识显式存储在可寻址槽中,将存储与计算解耦并实现直接知识检索。这些模块共同使 LoKiFormer 能够在两个层面上实现更高效、更有效的信息集成。实验结果表明,LoKiFormer 在预训练中的收敛速度比基线模型快 1.33 倍,凸显了其相对于现有 LLM 架构的优越性。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱