智能AI
morning
揭示扩散语言模型扩展定律,人大高瓴团队与蚂蚁集团发布LLaDA MoE v2
摘要
本文介绍的工作由中国人民大学高瓴人工智能学院李崇轩、文继荣教授团队与蚂蚁集团共同完成。朱峰琪是中国人民大学高瓴人工智能学院的博士生(蚂蚁集团实习生),导师为李崇轩副教授。 扩散语言模型的快速发展,正成为大语言模型领域备受关注的技术方向:凭借双向上下文建模与多词元并行解码的独特优势,这一新兴范式已从前沿学术探索逐步成长为大语言模型的重要技术路线之一,受到学术界与产业界的持续关注。随着模型规模与训练算...
LLaDA
MoE
30B
A3B
FLOPs
定律指引
Qwen3
万词元
IsoFLOP
次幂增长
2026-08-11
1 阅读
约10分钟阅读
机器之心
字号:
本文介绍的工作由中国人民大学高瓴人工智能学院李崇轩、文继荣教授团队与蚂蚁集团共同完成。朱峰琪是中国人民大学高瓴人工智能学院的博士生(蚂蚁集团实习生),导师为李崇轩副教授。 扩散语言模型的快速发展,正成为大语言模型领域备受关注的技术方向:凭借双向上下文建模与多词元并行解码的独特优势,这一新兴范式已从前沿学术探索逐步成长为大语言模型的重要技术路线之一,受到学术界与产业界的持续关注。随着模型规模与训练算力不断增大,如何高效地扩大规模成为亟待回答的问题 —— 最优超参数如何随算力调整、有限算力在模型与数据间如何分配、稀疏专家架构如何随规模演进,都需要扩展定律给出科学的答案。 在自回归模型上,扩展定律已相当成熟,支撑了一代又一代大模型的训练;然而,离散扩散语言模型采用掩码去噪目标,监督信号仅落在被掩码的位置,每个预测又都基于受损序列而非因果前缀,自回归的扩展经验无法直接照搬。混合专家架构作为大模型扩容的主流选择,与扩散建模结合后的扩展规律仍缺乏系统刻画,大规模扩散语言模型的训练仍在很大程度上依赖经验与试错。 为此,高瓴人工智能学院李崇轩、文继荣团队与蚂蚁集团 首次系统 刻 画了混合专家扩散语言模型的扩展定律,并据此从头训练了 30B-A3B 的新一代扩散语言模型 LLaDA MoE v2 。该工作将扩展定律贯穿超参数配置、算力分配与架构设计,标志着扩散语言模型从 “经验驱动” 迈向 “定律指引” 的关键一步:LLaDA MoE v2 激活约 3B 参数,仅用同规模自回归模型 Qwen3 30B-A3B 约 65% 的预训练词元,即在知识、推理、代码等多项基准上逼近 Qwen3 水准,且仅经有监督微调便在 8 项推理与代码基准中的 7 项超越现有领先扩散模型,实现扩展效率与智能的双重突破,标志着扩散语言模型迈入 “定律指引、稀疏并行、高效扩展” 的规模化 时代。 论文标题: LLADA MOE V2: SCALING MIXTURE-OF-EXPERTS DIFFUSION LANGUAGE MODELS 论文链接:https://arxiv.org/pdf/2608.03457 团队预计近期将开源推理代码以及 LLaDA MoE v2 模型权重。 在优化超参数方面,联合团队在 158M 至 3.6B 的模型规模与 至 FLOPs 的算力跨度上系统搜索批量大小与学习率,拟合出扩散语言模型专属的超参数扩展定律:最优批量大小随算力的增长比自回归模型更陡,最优学习率随算力的衰减更快。在 FLOPs 算力下,自回归定律预测的最优批量大小约为 102 万词元,而新定律给出 343 万词元 —— 这一差异源于掩码去噪目标下,名义词元仅在被掩码时才贡献监督信号,有效监督强度的下降改变了梯度噪声水平与优化稳定性。该定律在 FLOPs 的外推验证中与实测最优配置高度吻合,为大规模训练提供了可靠的超参数标尺。 图 1:LLaDA MoE v2 的超参数扩展定律:最优批量大小(左)与最优学习率(右)随训练算力的扩展曲线,红色虚线为本文拟合定律,蓝色虚线为自回归模型参考定律 在算力分配方面,团队通过 IsoFLOP 分析刻画了固定算力下模型规模与训练数据的最优权衡:最优模型侧算力随总算力以 0.475 次幂增长,最优训练词元数以 0.525 次幂增长,整体接近均衡并略微偏向数据一侧。与已有稠密扩散模型的扩展定律相比,混合专家扩散模型的分配前沿是迄今最偏向数据侧的,稀疏激活与扩散建模各自带来的 “亲数据” 倾向在其中叠加显现,意味着边际算力投向训练词元比投向模型侧计算更为划算。 图 2:LLaDA MoE v2 的算力分配扩展定律:固定算力下模型 - 数据分配的 IsoFLOP 曲线(左),以及最优模型侧算力(中)与最优训练词元数(右)随总算力的幂律前沿 在架构设计方面,团队沿激活比例、专家粒度与共享专家比例三个关键维度解析了混合专家架构的扩展规律:随着规模扩大,更低激活比例、即更大的路由专家池愈发占优;8 至 16 的中等专家粒度在各规模下均保持稳健;共享专家承载约三分之一激活容量(33.3%)在所有规模下恒为最优,与自回归混合专家模型惯用的 25% 甚至不设共享专家的经验形成鲜明对比,由此得到了扩散语言模型专属的稀疏激活架构设计准则。 图 3:混合专家架构的扩展规律:激活比例(a)、专家粒度(b)与共享专家比例(c)在不同算力规模下的受控扫描,红星标记各规模的最优配置 在上述扩展定律的指引下,联合团队从头训练了 LLaDA MoE v2 30B-A3B 模型:总参数 30B、每词元激活 3B 参数,采用 128 个细粒度路由专家,激活比例 9.09%、专家粒度 8、共享专家比例 33.3%,落在扩展定律给出的最优区间。模型经五阶段预训练 累计学习 23.5T 词元 ,全程消耗约 46 万 NVIDIA B200 GPU 小时。在 15 项基准测试中, LLaDA MoE v2 取得扩散语言模型中的最高平均分 58.60 ,较同规模扩散模型 SDAR Sci 高出 3.78 分,其中 HumanEval 与 BigCodeBench 分别领先 16.46 分与 7.98 分;与自回归模型 Qwen3 相比,模型在 OlympiadBench、HumanEval 等多项推理与代码基准上的差距不足 3 分,而 预训练词元用量仅为其约 65% 。 图 4:LLaDA MoE v2 基座模型与其他扩散语言模型和自回归模型在 15 项基准上的核心指标对比 扩展定律的指导价值在算力效率上体现得尤为直观:与未受扩展定律指引的上一代 LLaDA-MoE 7B-A1B 相比,LLaDA MoE v2 在 MMLU、GSM8K 和 KorBench 上仅以约一半的训练算力便实现超越,展现出 “定律指引” 将预训练算力高效转化为下游性能的路径。 图 5:扩展定律指引的 LLaDA MoE v2 在多项基准上以更少训练算力达到并超越上一代 LLaDA-MoE 在有监督微调方面,团队使用 700 万条指令数据进行训练,所得模型即在 8 项数学推理与代码生成基准中的 7 项上超越同规模扩散模型 SDAR Chat,并在 AIME 2024/2025、MBPP、LiveCodeBench 等基准上逼近经历额外强化学习阶段的 Qwen3,更在多语言代码生成基准 MultiPL-E 上实现反超,表明扩展定律指引的基座模型经简单微调即可释放扎实的指令遵循与复杂推理能力。 图 6:LLaDA MoE v2 指令微调模型与 Qwen3 和 SDAR Chat 在推理与代码基准上的核心指标对比 LLaDA MoE v2 首次为混合专家扩散语言模型建立了覆盖超参数、算力分配与架构设计的系统性扩展定律,突破了非自回归模型规模化依赖经验迁移的瓶颈。通过定律指引的稀疏架构与掩码去噪训练,模型以更少的预训练词元与更低的激活开销逼近同规模领先自回归模型,为扩散语言模型的规模化提供了 “定律指引”,为进一步扩大模型规模、探索智能上限铺平了道路。 © THE END 转载请联系本公众号获得授权 投稿或寻求报道:liyazhou@jiqizhixin.com 平台地址: http:
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱