汽车
morning
智谱 VS Deepseek,两条分叉的自进化树
摘要
文 | 字母AI 智谱发布GLM-5.1的时候,盘中涨幅一度接近19%,收盘涨幅11.5%。到了GLM-5.2,当天暴涨32.8%,一周后市值突破万亿。按照这个逻辑来看,GLM-5.3发布后,智谱股价不得起飞喽? 可事与愿违,8月14日发布GLM-5.3当天,智谱跌3.57%,日内回撤超11%。 智谱GLM-5.3的成绩单很亮眼。DeepSWE的66.9分超过了V4 Pro的62.7,Termin...
GLM
DeepSeek
AGI
字母AI
智谱发布GLM
1的时候
盘中涨幅一度接近19
收盘涨幅11
到了GLM
当天暴涨32
2026-08-17
1 阅读
约10分钟阅读
字母AI
字号:
文 | 字母AI 智谱发布GLM-5.1的时候,盘中涨幅一度接近19%,收盘涨幅11.5%。到了GLM-5.2,当天暴涨32.8%,一周后市值突破万亿。按照这个逻辑来看,GLM-5.3发布后,智谱股价不得起飞喽? 可事与愿违,8月14日发布GLM-5.3当天,智谱跌3.57%,日内回撤超11%。 智谱GLM-5.3的成绩单很亮眼。DeepSWE的66.9分超过了V4 Pro的62.7,Terminal Bench 3.0从5.2的4.6分暴涨到 28.3分拿下开源第一,CyberGym以84.5%登顶全球,在高难度编程任务上,只用了不到Claude Opus 4.8一半的 token,就拿到了更高的完成率。 在智谱官方放出的性能图里,编程、终端操作、Agent任务、网络安全等八方面,赢过了DeepSeek V4 Pro正式版七项,对DeepSeek形成了“精准狙击”。 但是却很少有人注意到,GLM-5.3其实并非“新”模型,它和GLM-5.2 用的是同一个7430亿参数基座,所有提升全靠后训练。这和DeepSeek V4 Pro从预览版到正式版的逻辑是一样的,后者也都是同一个1.6T基座,能力跃迁同样来自后训练。 GLM-5.3之于5.2,就是V4 Pro正式版之于预览版。两者的不同在于,智谱没有涨价,DeepSeek却涨了一大截。从8月17日0点开始,DeepSeek API新一轮调价,全面引入峰谷分时定价机制,整体价格较此前出现大幅上调,全计费项涨幅区间为50%至1100%。 还有一点,那就是在自进化这块,智谱已经和DeepSeek形成了初步交锋。GLM-5.3的新后训练方法,本质上是一种模型自进化。而DeepSeek V4 Pro同步发布的DeepSeek Harness,其插件即一切的策略,也是为了自进化。 自进化是公认通往AGI的赛道,眼下国产大模型的 AGI 赛道,本质上就是智谱、DeepSeek、Kimi 三家的竞速。 都喊着 AGI,都在拼谁的模型更像一个能独立干活的 "人"。 两家的方法论究竟有何不同? 先看智谱这边。GLM-5.2到5.3最核心的变化是加入了一套“自己出真题自己做”的环境合成流水线。 在GLM-5.2的时期,训练环境还主要靠人工搭建,所以题型有限、场景也偏模拟题。 到了5.3,智谱引入了一个全自动的环境生成机制。 具体来讲,智谱用了一个“AI研究员”(研究Agent)去真实场景里面抄题目。比如它会观察工程师到底怎么干活,把真活儿变成考题。 其实很早之前的生成对抗就采用了类似的逻辑,用机器给机器出题。 可机器出题没法保证每道题都是好题。 有的题可能根本解不出来(出题时条件给错了),有的题可能缺关键信息(做到一半卡死),有的题可能是“无解题”(mission impossible)。如果这些废题混进训练题库,模型辛辛苦苦刷了半天,刷的是一道根本做不出来的题。 因此智谱用了一个AI判卷员(判断Agent),先自己做一遍。 相当于出题人出完卷子,先自己答一遍,确认“这题真的能解出来”,不是道废题。防止出那种连老师都不会做、纯粹难为学生的怪题。 判卷员在做题过程中,不许看参考答案,只看解题过程。 如果是带着答案做题,那么模型可能学会“背答案”或者“抄近路”。表面上得分高,实际啥也没学会。所以判卷员得盯着解题轨迹,看它是不是一步一个脚印真解出来的,有没有钻漏洞、走捷径。只有“题能出、能做、过程干净”三道关卡全过了,这道题才配进训练题库。 这套流水线让训练环境规模扩大了数倍。 除了方法改变以外,刷题的整个基础设施也得到了升级。 slime是智谱从GLM-5时代就一直在用的一套训练框架,你可以把它理解成一个自动化的刷题工厂。 5.3在这套工厂上做了两层大改造。第一层是算法层面,新增了一批技术配置,最关键的一个改动,是让练习和考试的环境几乎完全一致。两者计算结果的平均差异控制在千万分之一的量级,比之前精确了99.99%。 AI的强化学习,本质上是成千上万轮的循环。先考试生成一批答卷,再根据答卷讲课更新模型,然后再考试、再讲课,无限循环。 如果练习和考试的环境有一点点不一样,每一轮都带入一点误差,一万轮下来误差就滚成了大雪球,模型可能学歪甚至直接崩掉。 就好比NBA比赛中,三分线弧顶距离是7.24米,底角是6.7米,但是FIBA国际篮联的三分线是6.75米,如果练习的时候以FIBA的标准,那么到了NBA中就适应不了那么远的三分线。 第二层是系统层面,智谱给这个出题工厂加了一堆效率优化。 常用的数据放到近处缓存,不用每次去远处取。相当于教材室紧挨教室,拿到教材就可以立马发给学生。 多个老师还可以自动切换,还能提前备好课,任务调度让每台机器都不闲着,还能根据题型自动调整到最优配置。这些优化叠在一起,长程编码任务的整体训练速度翻了2.3倍。 在Agent领域影响力最大的Terminal Bench 3.0基准数,得分从5.2的4.6分,暴涨到了5.3的28.3分,拿下开源模型第一。DeepSWE v1.1从46.2涨到66.9,Agents' Last Exam从23.8涨到28.5,AutomationBench从26.2涨到48.2。 再看DeepSeek这边,从预览版到正式版,DeepSeek V4 Pro也强化了后训练。预览版的监督微调数据以通用问答和基础代码为主,而在正式版当中,新增了大量Agent专用的多步骤工具调用对话范例。 以前教模型的例子,是“帮我写封邮件”这种一问一答。现在换成“把文件夹里所有PDF转成Word”这种真活儿。AI得先扫文件夹,然后识别PDF,并逐个进行转换。一切都完成后,汇总报告,一环扣一环。 同时,DeepSeek把GRPO强化学习的奖励函数给重新设计了一遍。 预览版在Agent场景下有两个常见的硬伤,其一是工具调用死循环,反复调用同一工具但提取不到有用信息;其二是参数解析错误,JSON格式错、必填字段漏。 正式版的奖励信号专门针对这两类失败做了惩罚,在需要35次工具调用的复杂任务中,正式版基本可以一次跑通不再卡死。 唐杰vs梁文锋+崔添翼 技术路线的背后从来都是人的理念。智谱和DeepSeek这场对抗,本质上是两种AGI路径的对撞。 智谱创始人唐杰在7月11日发布了内部信《巨浪已来》,宣布启动“Touch High(摸高)计划”。信中写到,未来两年不把重心放在商业变现上,集中资源冲AGI的下一个高地。 唐杰把AGI的突破拆解为三座必须翻越的大山,第一座是记忆,长上下文和RAG已经逼近记忆雏形;第二座是完全自治的智能体系统(Autonomous Agent System,即持续学习和自我评判),模型迭代频次的提升本身就在逼近持续学习,前沿模型已显露自我评判的萌芽;第三座是自进化(Self-Evolving)。 唐杰表示,“AI训练AI已经成型,模型自己写代码、自己清洗与合成数据、自己训练自己。这或许会消耗一些算力,却节省了最宝贵的人力与时间。而在大模型时代,速度是最重要的,快速迭代会直接拉开认知的代际差距。” 前文提到的GLM-5.3后训练办法,本质上就是一种自进化。 不过自进化最有魅力的地方,并不在于它如何实现了开发者一开始给它规定的目标
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱