首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
游戏 morning

DeepSeek“推倒重来”

2026-09-15 1 阅读 约10分钟阅读 字母AI
分享:
字号:
文 | 字母AI DeepSeek V4.1 Flash发布后,不仅速度变快,而且内容更准确,还有原生多模态。 全网对DeepSeek V4.1 Flash好评如潮,梁文锋再次被奉为“梁圣”。 相较于V4 Flash,V4.1 Flash最大的特点是推倒重来,采用了和V4 Flash完全不同的非对称结构。 这也就是说,V4在结构上积累的训练配方、优化技巧、工程适配,到了V4.1这里,大部分都作废了。 现在的DeepSeek早就不是一家小作坊了,而是一个拥有数百名员工的企业,想要重起一个新的结构不仅费时,还很费力。即便如此,梁文锋也要狠下心,对V4推倒重来。 新结构听起来确实很像一个营销用的噱头,不过答案其实就在DeepSeek V4.1 Flash的官方论文当中,DeepSeek的旧架构,已经装不下新的训练目标了。 那么这个新的目标又是什么呢?我认为,很可能是“入口”。 DeepSeek为什么要推倒重来? 通常来讲,先有模型,后有Harness。厂商根据模型的能力和特点来构建Harness。然而DeepSeek V4.1 Flash却是被DSH给“反哺”出来的。 官方论文表示,V4.1 Flash的后训练遵循标准的SFT→ RL→ 在线蒸馏(OPD)范式,没有任何算法改动。关键的地方在于,所有实质性变化都在数据流水线当中,大规模自动合成Agent任务与环境,数据、任务、rollout渐进式扩增。 RL训练时让模型在6种不同的Agent框架里反复试错,数据量、任务种类、试错轮次一路放大。DSH是这6个训练场里最重要的一个,V4.1 Flash还专门针对DSH的不同操作模式做了定向训练。 DSH从DeepSeek V4 Pro的伴生产品,摇身一变成了V4.1 Flash的老大哥。 为了满足DSH的偏好,DeepSeek V4.1采用了全新的结构。 论文里是这么介绍的,新结构让模型在prefill阶段每token只需要激活8B的参数、decode阶段激活16B,进而大幅改善“输入密集的agent工作负载”的成本效率。 为什么“输入密集”会成为麻烦? 过去的模型结构是为"聊天"设计的,用户问一句,模型答一句。这就造成了输入短、输出长,模型只会记住当前这一轮对话的上下文。 但在Agent时代,几十轮的中间状态一直挂在上下文里,输入动辄几十万token,远大于输出。 2026年4月,密歇根大学、斯坦福大学等院校联合发布论文《AI是怎么花你钱的?》(How Do AI Agents Spend Your Money?),其中就提到这样一件事,在agentic代码任务中,输入与输出的token比高达154:1。 于是DeepSeek选择推倒重来。V4.1 Flash采用了非对称结构Causal-Encoder-Decoder(CED)。 V4.1 Flash的语言主干共40层,如果按照以前的Transformer(decoder-only)那样,这40层应该是一模一样的。每一层都同时负责“读”和“写”,同时处理给它的输入,也处理输出,而且每一层都要自己攒一份KV Cache。 CED的“非对称”,指的是把这40层拆成前20层编码器、后20层解码器,编码器只负责“读”,把输入压成摘要,解码器只负责“写”,照着摘要生成回答。 就像汽车的流水线一样。 过去是一个车间完成所有活,想增加产能就得一直复制这一个车间。现在是流水线,冲压车间就负责冲压,电泳车间就负责电泳。 并且记忆只产生一次,解码器的全局KV Cache直接从编码器的最终结果投影出来。DeepSeek V4.1 Flash的全局KV Cache压到了890字节/token,降低至V4 Flash的1/4。 这是因为DeepSeek V4.1 Flash采用了CSA2(Compressed Sparse Attention 2),第二代压缩稀疏注意力。 V4的时候DeepSeek使用的是第一代CSA,到了第二代,可以让不同层之间共享KV和索引,也就解决了前面所提到的痛点。 依然是像汽车流水线一样,CSA2中把这40层分成了三个不同的车间,分别为Full、Reindex和Reuse。 Full负责完整记录,就像传统Transformer的每一层一样。Reindex负责提炼重点,再根据提炼的结果做事。Reuse则直接照着Full的技术抄,连提炼都省了。 虽然说除了第一层用Full,剩下39层全用Reuse是最节省成本的做法,但每层关注的重点不同,能力也不同,浅层做的是“字面理解”,深层做的是“逻辑推理”,它们需要的上下文内容不同。如果全用Reuse只会生成没有价值的回答。 去年还是先有车、再修路,今年已经是先修路,再造车。 模型性能强弱、性价比高低,都不是叙事的核心,唯有掌握了入口,才能吸引更多用户。 但梁文锋不是第一个这么做的,姚顺雨的Hy4 preview走在他之前。 Hy4 preview官方技术报告里表示,通过腾讯内部的软件工程师、游戏开发者、金融分析师、安全专家,围绕他们真正交付的工作共建数据,再和CodeBuddy、WorkBuddy这些产品共同设计。 在163名内部专家参与的203个真实工程任务盲测中,Hy4 preview平均2.99分,GLM-5.3是2.92,Kimi K3是2.94。 入口的重要性不言而喻,腾讯产品矩阵的优势得以发挥。 DSH和WorkBuddy本质上是一种产品闭环,是整条训练流水线的一部分。 有意思的是,2026年7月24日,腾讯撤销大语言模型部和多模态模型部,合并成立基础模型部,姚顺雨统一负责。他将混元多模态的发展重点,放在了Agent强相关的多模态理解上,和梁文锋此前对多模态的看法一致。 现如今,梁文锋又在模型上靠拢了姚顺雨,互相学习。 智谱与Kimi有类似的闭环吗? 智谱和月之暗面这两家不是没有工具,Kimi有Kimi Claw,智谱也有ZCode、AutoClaw和GLM Coding Plan。 但这些工具没办法像DSH和WorkBuddy那样“反哺”模型。智谱和Kimi的工具是后挂的外壳,模型先在合成环境里练好,再做个产品给用户用。 智谱现在把所有精力都放在了模型自进化上。8月31日,在智谱半年度业绩会上,唐杰首次明确表示,GLM-6.0是一款Full Self-Training(完全自训练)模型,与OpenAI的RSI(Recursive Self-Improvement,递归自我改进)相似。 唐杰表示,从预训练、中训练到后训练,全流程让模型自己训自己,不再靠人写代码、清洗数据、调参、设计实验。人只负责给模型定目标,以及做最后的验收工作。 在GLM-5.3上,智谱就已经展示过他们自进化方法的一部分了。GLM-5.3和5.2使用的基座相同,但是性能却大幅提升。 具体情况是这样的,GLM-5.3建了一套端到端的任务环境合成流水线,Agent从真实世界的软件工程和终端操作场景收集种子任务,接下来模型自己头脑风暴,生成大量可验证的任务草稿,再构建做题用的Agent,把这些草稿实例化成具体的可运行环境。 将Agent输出的回答进行精炼,根据研究员定义的评分标准,检查并迭代优化任务质量。 最终就产出了数千个多样化、
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱