首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

腾讯猛踩油门,混元追赶的127天

摘要

文 | 深流研究所,作者 | 吴绛枫 8 月 28 日,腾讯混元发布并开源 Hy4 preview。 从今年 2 月重建预训练与强化学习基建算起,混元把大版本的迭代周期,压缩到两个月左右。 这已经接近 Anthropic、OpenAI、智谱等头部模型厂商的更新频率。 差别在于,腾讯是在重建地基的同时跑出了这个速度。 版本间隔在缩短,混元能力跃升的幅度也在持续变大。 Hy4 preview 总参数达...

preview Hy4 Hy3 OpenAI WorkBuddy CodeBuddy Claude Opus 深流研究所 吴绛枫
2026-08-29 1 阅读 约10分钟阅读 深流研究所
分享:
字号:
文 | 深流研究所,作者 | 吴绛枫 8 月 28 日,腾讯混元发布并开源 Hy4 preview。 从今年 2 月重建预训练与强化学习基建算起,混元把大版本的迭代周期,压缩到两个月左右。 这已经接近 Anthropic、OpenAI、智谱等头部模型厂商的更新频率。 差别在于,腾讯是在重建地基的同时跑出了这个速度。 版本间隔在缩短,混元能力跃升的幅度也在持续变大。 Hy4 preview 总参数达到 770B,是 Hy3 的 2.6 倍;激活参数从 21B 提升到 49B,上下文从 256K 扩展到 1M。 图注:Hy4 preview在各项benchmark的评分表现 7 月初,Hy3 在软件工程实战基准 DeepSWE 上拿到 28.0 分,同期 Claude Opus 4.8 是 58.0。 不到两个月,Hy4 preview 在同一项测试上拿到 64.3,超过 DeepSeek V4 Pro 的 62.7。 同一天公布的Terminal-Bench 2.1 上,Hy4 preview 拿到 85.4 分,与 Claude Opus 5 持平。 如果把 Hy3 preview 以来的三个版本放在一起看,混元在多项主流 benchmark 上都画出了一条显著上升的曲线。 总的来说,混元整体仍在追赶阶段。但在更接近真实生产力的任务上,混元实打实追赶上来了,尤其是长上下文任务、代码库重构、专业科学推理等方面。 那么,猛踩油门的腾讯混元,它的“加速度”究竟从何而来? 1、每一次发布,都是实战 Hy4 preview 发布当天,WorkBuddy 和 CodeBuddy 同步开启两周免费体验。 混元团队在说明中提到:“如同 Hy3 preview,我们希望通过 Hy4 preview 的尽快发布获得广泛的真实反馈,从而显著提升 Hy4 正式版。” 同一套流程,混元已经走过一遍。 4 月 23 日,Hy3 preview 开源上线,同时接入元宝、WorkBuddy、CodeBuddy、ima 和 QQ 等多个业务产品。 三个月后,Hy3 正式版发布。团队表示,Hy3 preview 已在 50 多个业务中获得广泛反馈,修复了大量体验问题;正式版在此基础上,进一步提升后训练数据的质量与多样性,并扩大了强化学习的算力规模。 变化体现在核心指标上。 对比preview版,Hy3 正式版的幻觉率从 12.5% 降到 5.4%,常识错误率从 25.4% 降到 12.7%,多轮对话问题率从 17.4% 降到 7.9%。 这不是单靠增加参数就能解决的。 模型在真实任务里会犯一些非常具体的错误。比如忘记用户几轮前提出的限制,工具调用失败后盲目重试,任务已经完成却不知道什么时候该停等等。 只有把模型放进产品,让它持续面对真实用户,再把失败过程拆开,找到问题发生在哪一步,补充正确的任务轨迹和判断标准,错误才可能被一条条纠正。 Preview 不是一个版本标签,而是将真实使用纳入模型研发的行业机制。 早在 2022 年,OpenAI 就把 ChatGPT 作为 research preview 推向公众,希望借此收集用户反馈,了解模型在真实世界中的优势与局限。后来的 o1-preview、GPT-4.5,也延续了相似的发布方式。 OpenAI 将其称为“迭代式部署”:不是等系统在实验室里变得完美再推出,而是让一个仍有不足的版本受控地进入真实世界,再根据实际使用不断修正。 如今,分阶段开放、早期测试和 preview-first,已经成为前沿模型常见的研发机制。 每一次 preview 都不只是一次产品公测,也是一次大规模实战。 正如混元团队所说,Hy3 preview 是混元从读万卷书到行万里路的开端。 2、实战反馈,如何变成模型能力 发布大模型只是第一步。 它能不能真的进步,取决于收回来的是什么,以及这些东西能不能变成有效的训练材料。 Hy4 preview 的官方说明里,有一句容易被略过的话:模型能力的提升,来自与腾讯内部软件工程、游戏、金融、安全等领域专家的高质量数据共建。 Hy3 时期,重点是与 CodeBuddy、WorkBuddy 等产品深度协同,把真实任务中的用户反馈和失败案例送回训练环节。 到了 Hy4 阶段,在产品反馈之外,来自各个专业领域的专家共建被放到了更靠前的位置。 这是两个不同层次的反馈。 用户告诉模型“哪里不好用”,专家告诉模型“什么才算真正做好”。 一个金融分析任务,普通用户可能只能判断最后的报告能不能用;专业人士则可以进一步判断统计口径是否一致、证据链是否完整、风险提示是否充分。 一个软件工程任务,测试通过不等于代码可以合入,工程师还会看架构、可维护性、性能和潜在回归。 让产品反馈和专家判断组织起来,参与模型训练的方法,腾讯内部叫 Co-Design。 什么信息该给模型,什么时候给,以什么结构给;模型可以调用哪些工具,怎样判断任务完成,失败后又该如何恢复——这些都不是模型团队关在实验室里能独立想明白的。 Co-Design 做的,是让多方一起定义问题,而不是等模型训练完成,再由产品接上一个 API。 混元内部还建立了 50 多套评测,用真实考题、人工评测和产品众测进行验收,不再把外部排名作为唯一标准。 姚顺雨的判断是,真正有价值的进步来自产品侧回流的真实 Prompt 分布:模糊提问、多轮追问、省略表达、隐含意图、前后矛盾,以及用户自己都没有完全说清楚的需求。 用户提供问题分布,专家提供质量标准,产品提供任务环境,模型团队再把三者变成后训练和评测体系。 这才是反馈真正转化成模型能力,实现Co-Design loop的全过程。 3、腾讯的Agent产品矩阵,混元的训练场 WorkBuddy 的界面上,摆着多个厂商的十余款模型。 混元、DeepSeek、GLM、Kimi、MiniMax,用户点一下就能切换,没有唯一选项。 这给混元设置了一个比内部评测更直接的考场。 每一次切换都是一次投票。每一次重复使用也是一次投票。 结果是 Hy3 留住了用户。 今年 7 月 8 日,Hy3 正式版在 WorkBuddy 上线后,调用量一度把算力打满。当天下午排队率超过 50%,团队紧急扩容。原定两周的免费体验,也因为需求过大延长到了 8 月底。 自上线 WorkBuddy 以来,主动选择 Hy3 preview 的用户数量增长了 6 倍。接入 Hy3 正式版后,WorkBuddy 内部测评的任务成功率从 72% 提升到 90%,平均耗时缩短 34%。 这些数字至少证明了一件事: 模型在内部评测中获得的提升,有一部分转化成了用户能够直接感知的体验。 用户选择只是结果。 对模型研发更重要的是,用户为什么选择它,又为什么放弃它。 在多模型共存的产品里,混元获得的不只是一句“好用”或者“不好用”,而是一组带有对照关系的反馈: 同一个任务,不同模型用了多长时间,采取了什么路径,调用了哪些工具,在哪一步失败,用户最终接受了哪一个结果。 这让 WorkBuddy 不只是混元的考场,也成了它的训练场。 WorkBuddy 只是其中一个入口。 混元已经接入腾讯内部百余个业务场景。腾讯也在推动企业微信、腾讯文档、ima、
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱