首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

DeepSeek V4.1 Pro或为2万亿参数:未来还有8万亿版、押注国产芯片

摘要

快科技9月21日消息,此前我们分析了中秋国庆双节前后国内外要发的10多款大模型,其中最受期待的还得是DeepSeek V4.1 Pro。 跑得比较快的Theinformation网站又爆料了新的消息, DeepSeek正在训练2万亿参数量的大模型,未来还会扩展到8万亿参数量。 而且DeepSeek的大模型训练未来会押注国产AI芯片,尤其是华为的昇腾系列,不过具体情况就没有细节流出了。 未来的8万亿...

快科技9月21日消息 此前我们分析了中秋国庆双节前后国内外要发的10多款大模型 其中最受期待的还得是DeepSeek Pro 跑得比较快的Theinformation网站又爆料了新的消息 DeepSeek正在训练2万亿参数量的大模型 未来还会扩展到8万亿参数量 而且DeepSeek的大模型训练未来会押注国产AI芯片 尤其是华为的昇腾系列 不过具体情况就没有细节流出了
2026-09-21 1 阅读 约3分钟阅读 宪瑞
分享:
字号:
快科技9月21日消息,此前我们分析了中秋国庆双节前后国内外要发的10多款大模型,其中最受期待的还得是DeepSeek V4.1 Pro。 跑得比较快的Theinformation网站又爆料了新的消息, DeepSeek正在训练2万亿参数量的大模型,未来还会扩展到8万亿参数量。 而且DeepSeek的大模型训练未来会押注国产AI芯片,尤其是华为的昇腾系列,不过具体情况就没有细节流出了。 未来的8万亿参数量大模型不好说是哪年推出,但报道中的这个2万亿参数量的大模型很有可能就是快要发布的DeepSeek V4.1 Pro了,就是不知道梁历哪个月发了,节前希望不是很大,10月中旬到下旬可能性更高。 从之前发布DeepSeek V4.1 Flash的信息中可以看出V4.1 Pro会延续全新的架构设计, 包括CED+Engram、Prefill与Decode拆分、非对称式激活结构等技术 ,让AI来估算的话,比较合理的参数如下所示: 训练这样2万亿参数量的大模型差不多需要50-60万亿Token,按照目前的显卡算力估算的话,H100/H200这样的卡需要3万张,B200需要1.5万张,910C这样的要6万张, 但如果是昇腾950系列,也就是3万张,跟H200差不多。 DeepSeek新一代大模型的发展方向也是跟国产AI芯片深度绑定的,华为的昇腾950系列有PR和DT两个系列,适合的工作也是分为训练及推理的,也把Prefill与Decode两个过程拆分了, DeepSeek的新架构显然是跟昇腾走软硬件协同优化AI训练、推理的。 用国产AI芯片训练万亿级别的大模型已经有过报道和实例了,但是2万亿规模的还没有确认的,目前超过2万亿参数量的国产大模型主要有文心一言5.0、Kimi K3、千问Qwen 3.8 Max,没发布的还有MiniMax M3等,都没宣传过是用国产AI芯片训练的。 DeepSeek V4.1 Pro如果用了国产AI芯片进行2万亿参数量的大模型训练,即便不是全部训练过程,那也是里程碑性质的进步。 明年华为的昇腾960系列还会提前1-3个季度上市 ,困扰国产大模型发展的算力问题未来几年会大幅缓解,那就有机会跟OpenAI、Anthropic正面竞争了。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱