首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

10万亿参数大模型,注定要被关进笼子里

摘要

文 | 字母AI OpenAI即将发布的GPT-6,传闻称它的参数量高达10万亿。 10万亿是一个非常恐怖的概念。现如今,全球顶尖大模型的参数量都在“万亿”级别。比如阿里的Qwen 3.8为3.5万亿,Kimi K3为2.8万亿,字节内部正在开发的模型,也有数万亿的参数量,哪怕是OpenAI的Mythos 5,估算也只有8万亿。 10万亿,代表了一个全新的时代。 遥想2025年,引发DeepSee...

Mythos GPT 的10万亿 10的25次方次浮点运算 字母AI OpenAI即将发布的GPT 传闻称它的参数量高达10万亿 10万亿是一个非常恐怖的概念 现如今 全球顶尖大模型的参数量都在
2026-08-11 1 阅读 约10分钟阅读 字母AI
分享:
字号:
文 | 字母AI OpenAI即将发布的GPT-6,传闻称它的参数量高达10万亿。 10万亿是一个非常恐怖的概念。现如今,全球顶尖大模型的参数量都在“万亿”级别。比如阿里的Qwen 3.8为3.5万亿,Kimi K3为2.8万亿,字节内部正在开发的模型,也有数万亿的参数量,哪怕是OpenAI的Mythos 5,估算也只有8万亿。 10万亿,代表了一个全新的时代。 遥想2025年,引发DeepSeek时刻的DeepSeek-R1,它才6710亿参数量。怎么仅仅过了1年,参数量就膨胀到如此这般了? 现在的GPT-5.6和Claude Mythos 5,根据测算,前者参数量在3到5万亿,后者更是将近8万亿。 那它们都能干嘛呢?有个独立开发者拿GPT-5.6做带界面的图片压缩工具,一个模型包揽需求分析、架构设计、写代码、写测试用例、修Bug。如果是一个独立开发者完成这些任务,大约需要花费1天的时间,而GPT-5.6 Sol只用了不到2小时就交付了能用的成品 Mythos 5更吓人了。它被定向放给了一些网络安全机构,根据这些机构的报告,Mythos 5能自主完成从代码审计、漏洞定位到构造攻击载荷的全链路,从预览版亮相至今,已识别出超过一万个高危及以上级别的软件漏洞。 到了10万亿模型,它能做的就更多了。比如跟它说要搬家,它能自己约搬家公司、跟搬家公司规划打包顺序、给水电燃气过户、更新一圈收货地址,你要做的事情,就是拿着钥匙去新家等家具运到。 但这只是硬币的一面。 OpenAI 紧急叫停了内部代号Astra的新模型,官方安全评估显示,它可能具备自主开发零日漏洞、甚至仅凭一句指令就发动端到端网络攻击的能力,奥特曼自己都坦言“我被吓到了”。 在英国 AI 安全研究所(AISI)8 月初的红队测试中,对 Mythos 5 和 GPT-5.6 Sol 做了 122 轮测试,出现 19 起自主越界攻击。 更可怕的是,Mythos 5会自己编写恶意代码、提交到真实开源项目的GitHub PR,被人质疑后还改评论、注册小号给自己洗白;多个Agent甚至能私下建立隐蔽通信通道,协同规划渗透攻击。 10万亿参数能做到的“恶”,将远超人们的想象。 10万亿和万亿有什么不同? 先搞清楚一个最基本的问题:参数到底是什么。 你可以把大模型的参数,理解成我们大脑里的突出,它是神经细胞之间用来传递信息的连接点。人类的神经突触大约有10的14到15次方个,也就是百万亿这个量级。 模型参数做的事类似,记住输入与输出之间的模式,储存这个世界的规律。参数量,决定的是一个模型的记忆与表达容量,直白一点说, 就是它脑子里装得下多少东西,能把话说得多透彻。 但容量不等于智力,一个人的房间里塞满了书,不等于这个人就有多么高的学识。真正决定智力的,是数据、训练方法、架构,还有推理时的算法。 2021年11月,阿里达摩院的M6就干到过10万亿参数,用了512张GPU,训练了10天,能耗只有GPT-3的1%,一度是全球最大的预训练模型。 但M6是稀疏多模态的早期形态,靠极致的稀疏化与CPU offload把参数塞进去,能力极其有限,连今天的开源小模型都打不过。 它是“参数意义上”的10万亿,不是“能力意义上”的10万亿。 和今天要靠数十万卡集群端到端训练出来的通用前沿模型,完全不是一个物种。 那巨头为什么还要死命堆参数? 说到底,还是因为Scaling Law。OpenAI在2020年发现,模型性能与参数量、数据量、算力之间呈可预测的幂律关系。并且三者同步放大,能力就随之可预测地提升。 虽然Scaling Law后续被无数人和企业修改过,但是有一条铁律是不变的, 在相同的数据与算法下,更大(参数、算力)的模型,下限更高。 10万亿参数,到底要烧多少钱? 我们可以算一笔账。训练一个模型的总计算量,大致等于6乘以“激活参数”再乘以“训练数据量”。 GPT-4用了约2.1×10的25次方次浮点运算,仅算力账单就花了约7800万美元;谷歌的Gemini Ultra用了约5×10的25次方次,烧掉约1.91亿美元。 如果是10万亿的大模型,按总参数10万亿、每次激活约1万亿、喂进15万亿token数据的MoE架构来算,一次正式预训练的总计算量约9×10的25次方次浮点运算,是GPT-4的4倍多。 GPT-4当年是用2.5万张A100跑了近100天,今天的Blackwell旗舰卡单张算力是A100的好几倍,假如有5万张Blackwell,那么训练完1个10万亿大模型,差不多需要1个月。一张Blackwell旗舰卡的租金大约为两三千美元一个月,5万张跑满30天,光算力租金就是一两亿美元。 可是这5万张卡不是插上电就能转的。一张Blackwell旗舰卡功耗就有1200瓦,5 万张光是显卡本身就要吃掉60兆瓦。 算上网络、存储、散热和机房损耗,整座数据中心要配到接近100兆瓦的供电。 xAI 在孟菲斯建的Colossus,10万张H100也就吃150兆瓦,而当地电网当时只供得出8兆瓦,马斯克最后被逼得拉来一整排燃气发电机才点得着火。光这一趟的电费,按一个月算就要几百万美元。 至于地方,那是一个装满几百个液冷机柜、占地几万平方米的数据中心园区,相当于两三个标准足球场。 Epoch AI的统计是,前沿模型的训练成本每年以2.4倍的速度增长。阿莫迪曾经说过,到2027年,最前沿模型的单次训练成本可能冲到100亿美元,甚至1000亿美元的量级。 但这还只是单次预训练的账单。算上反复试错、数据工程、电力与人才,整个项目的真实投入,要奔着数十亿美元、甚至更高去。OpenAI今年给自己批的算力预算,已经高达约500亿美元。 但这里藏着一个反直觉的关键点: 10万亿的成本,不是3.5万亿的三倍,甚至可能比很多人想象的便宜得多。 总参数多,不等于烧的钱多。现在的顶尖模型都是“混合专家”(MoE)结构,你可以把它想成一家超大的公司,这个公司有很多业务,但是具体到某一个任务,它只会抽几个人出来干活。 所以决定一单生意成本的,从来不是公司总人数,而是这单实际动用了多少人。换到模型上,就是“激活参数”这个概念。处理每个token时,真正被叫出来干活的,其实只有部分参数而已。 明白了这一点,Kimi K3的2.8万亿也好、Qwen的3.5万亿也好,GPT-6的10万亿也好,它们差的只是“员工总数”,而账单不跟着总数走。真正决定成本的只有两样,每次干活动用的激活参数,加上喂进去的数据量。 总参数翻三倍,单次成本可能纹丝不动;反过来,哪怕两家总参数一样多,一家激活得多、喂的数据多,账单也能差出好几倍。 在这场大模型竞赛里,参数量成了大家比拼的重要指标。因为它最直观、也最难造假。OpenAI抛出10万亿,本质上就是在宣布:参数量,就是这个时代大模型竞争中最关键的指标,而在这个指标上,我领先所有人。 这句话背后的潜台词是, 模型竞争,已经进入了一个“烧不起”的程度。 美国五大科技巨头2026年的资本开支合计预计高达7790亿美元,目前全球前沿模型的训练集群已经是动辄数十万卡,2027年就要进入百万卡时代。 光是入场就需要几百亿美元,后面的运营、维护、调优等等也不少花钱。换句话说,AI这条赛道,现在只允许
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱