智能AI
morning
EntropyMoE:无分词器 LLM 的熵感知稀疏专家路由
摘要
arXiv:2608.06398v1 Announce Type: new Abstract: Recent byte-level large language models (LLMs) have made tokenizer-free modeling increasingly competitive by grouping bytes into dynamically sized patch...
patch
the
byte
and
computation
dense
EntropyMoE
for
dynamic
expert
2026-08-10
1 阅读
约1分钟阅读
Bo Liu, Muxuab Yu, Yu Zhang, Pengfei Gao, Yongping Zhang
字号:
arXiv:2608.06398v1 公告类型:新 摘要:最近的字节级大型语言模型 (LLM) 通过将字节分组为动态大小的补丁,使无标记器建模变得越来越具有竞争力。然而,现有的字节补丁架构仍然对每个补丁应用相同的密集前馈计算。这种统一计算无法使模型容量适应补丁语义和粒度的变化。我们通过 EntropyMoE 解决了这一限制,这是一种专为动态字节补丁设计的专家混合 (MoE) 架构。 EntropyMoE 用 Top-K 专家层替换了全局 patch Transformer 中的密集前馈模块。每个动态补丁作为专家路由的基本单元,其字节覆盖范围决定了其对工作负载核算的贡献。路由器直接从补丁熵中选择专家,使用动态补丁构建的相同粒度信号来组织稀疏计算。补丁熵和长度共同定义了调节专家专业化的特征空间。实验表明,EntropyMoE 在匹配的密集和稀疏基线中实现了最低的每字节保留位数,同时保持了相当的下游精度。这些结果将补丁熵确立为稀疏条件计算的有效路由坐标,并将专家混合模型扩展到基于分词器的表示之外。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱