汽车
morning
阿里通义 Qwen3.8-Flash 发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9
2026-08-26
1 阅读
约4分钟阅读
IT之家
字号:
IT之家8月26日消息,阿里通义千问团队今晚正式发布了Qwen3.8-Flash。通义团队同时发布了Qwen3.8-Flash-Next的开源权重,下一步新架构将是全新一代Qwen4系列模型的雏形。这是一个多态MoE模型,主模型参数量为125B,额外配备51B的N-gram Embedding,每个token激活6B它原生支持 262,144 个 token 高效,并可通过 YaRN 扩展至 1M token。据介绍,Qwen3.8-Flash 围绕四个方向进行了系统升级:在 Attention 方面,采用 GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构。GDN 负责压缩历史信息,QSA 则通过轻量级 Indexer 在微块粒度上筛选重要方向,显着延长序列面对 1M token 的超长上下文,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6 倍和 4.9 倍的。在 Residual 方面,引入 Gated Residual(GR)机制,将残差流扩展为 4 条支点分支,通过动态门控制信息读写。残差状态支持 FP8 存储,大幅提升访存增量。在 Embedding 方面,引入51B参数的N-gram Embedding,利用局部上下文查表扩展模型容量。这些参数可卸载至主机内存,通过异步预取与模型计算重叠,不长期占用GPU显存。在优化方面,采用Muon优化器,针对正交化精度、参数分工及矩阵拆分等策略进行优化。针对新架构融合并重新建立了Scaling Law。性能与成本相比Qwen3.7-Plus,Qwen3.8-Flash的训练成本仅约为前面的九分之一,但在编码和办公任务上具备更强的能力。在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的 8 个上取得了最优化结果,包括 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 和 MMMU。 模型表现纯文本:多模态:模型结构:基础模型表现:可用性与定价IT之家从官方获悉,Qwen3.8-Flash上线千问AI平台,对外提供API服务,定价为每百万代币输入1元、产出3元。模型权重已于北京8月26日23:00在Hugging Face与ModelScope平台开源,同步发布FP8量化版本。Qwen3.8-Flash-Next时间默认支持1M边界并内置官方工具。参考资料:技术报告: https://github.com/ QwenLM / Qwen3.8-Flash-Next / blob / main / tech_report.pdf 技术博客: https://qwen.ai/ blog?id=qwen3.8-flash-next 拥抱脸: https://huggingface.co/Qwen/Qwen3.8-Flash-Next ?spm= a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next ModelScope: https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next ?spm= a2ty_o06.30285417.0.0.1d73c921XAP2dV& ;amp;amp;file=Qwen3.8-Flash-Next
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱