智能AI
morning
通过基于幅度的专家掩蔽对混合专家模型进行深度感知灵敏度分析
摘要
arXiv:2608.13565v1 Announce Type: new Abstract: Mixture-of-Experts (MoE) architectures scale large language models (LLMs) while preserving computational efficiency through sparse activation. Despite t...
masking
layers
expert
the
experts
and
MoE
while
layer
300
2026-08-17
1 阅读
约2分钟阅读
Pradeep Kumar Sharma, Shantanu Godbole, Hritvik Shrivastava
字号:
arXiv:2608.13565v1 公告类型:新 摘要:专家混合 (MoE) 架构可扩展大型语言模型 (LLM),同时通过稀疏激活保持计算效率。尽管它们被广泛采用,但各个 MoE 层的相对重要性仍然没有得到充分表征,特别是对于模型压缩而言。本文提出了在 XLCoST 跨语言代码翻译基准上使用基于量级的专家屏蔽对 Qwen3.6-35B-A3B 模型(40 MoE 层、每层 256 名专家、top-8 路由)进行系统性逐层敏感性分析。我们在三台 H100 GPU 服务器上进行了一项多阶段研究,涵盖 100、300 和 500 个即时评估等级。我们的中心发现是层敏感性强烈依赖于深度:早期层(0-9)和中间层(10-29)对于专家掩蔽非常脆弱,而后期层(30-39),尤其是非常后期层(35-39),可以容忍低幅度专家的侵略性掩蔽。 30% 的平坦全层屏蔽仅保留 300 个提示规模的 150/300 个良好+相似输出,而后期重点策略保留 249-255/300 个,同时屏蔽 640-1,145 个专家。在稍后的 500 个提示保留验证切片中,狭窄的极晚策略(第 35-39 层 @ 50%)在测试的候选者中实现了最强的质量/屏蔽专家权衡,保留了 419/500 Good+Similar 输出,同时仅屏蔽了 10,240 名专家中的 640 名。我们还描述了每个代币的 top-k 路由宽度从 8 个活跃专家减少到 6 个,这表明在 100 个提示探针上观察到的挂钟大幅减少,没有 Good+Similar 损失,尽管它还没有与积极的专家屏蔽完全结合。这些发现为深度感知的 MoE 专家掩蔽提供了经验基础,并为体重手术、基于激活的专家评分和基于训练的恢复建立了实用的路径。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱