游戏
morning
混元Hy4 preview上线即排队,能消解腾讯的AI焦虑吗?
2026-08-31
1 阅读
约10分钟阅读
商业秀
字号:
文 | 商业秀,作者 | 郑久宇 编 | 杨肖若 混元这次最新的发布,是没有开发布会的。 8月28日深夜,只有一篇文章加一个开源仓库,Hy4 preview就这么上线了。7700亿总参数、490亿激活和100万Token上下文,Apache 2.0全开放。 这场真正的发布会,或许是发生在三天后的8月31日上演的场景:混元Hy4 preview自8月28日在WorkBuddy首发接入后,任务队列就开始出现频繁排队的情况。 官方赶紧发公告道歉、紧急扩容,就连腾讯公关总监张军也说调用量“出奇猛增”,技术团队整个周末都在推进扩容,并将持续动态调配资源。 还说,“受限于高端算力总量和高峰期并发集中,仍不排除个别时段排队。” 那更像是,一个模型用排队的方式,替自己的公司把“焦虑”说了出来。 这就有意思了。因为就在发布前三天,8月25日,腾讯高级执行副总裁汤道生刚在内刊《知点》里写过一篇长文,标题叫《和AI一起长跑:这两年的一些思考》,正面回应“腾讯做AI慢了”。 他有一句话说得挺实在,“要说一点不焦虑,那不可能。” 焦虑或许传导到了资本市场。8月28日,Hy4 preview上线当日,交易日收盘腾讯股价455.2港元,总市值为41437.52亿港元。截至发稿,8月31日收盘股价回落至452.4港元,市值约为4.12万亿港元。 看起来,技术圈一片叫好,但并未催生出二级市场的股价市值行情,市场仍在权衡AI持续高额投入带来的成本压力。 01 船是怎么“漏”的? 腾讯做AI的焦虑,不是今天才有的。 在今年5月13日的腾讯股东大会上,有人问马化腾,腾讯的AI是不是落后了? 马化腾打了个比方,“原来一年前我们以为上了船,后来发现那个船漏水了,又开始换一艘船。现在感觉站上去了,还坐不下去,还是希望船速能快一点。” “上船”说的是2024年大模型起跑,“漏水”说的是混元,一个被内部外部都承认“落后”的模型。《财经》此前采访的某位AI研究人员说得更直白,混元此前长期“躺平”,自姚顺雨加入后,“走向正轨不少”。 姚顺雨,1998年生,清华姚班、普林斯顿博士,ReAct 和思维树(Tree of Thoughts)的共同提出者,2024年进入OpenAI参与Deep Research 和 Operator。2025年下半年回国,12月就空降腾讯首席AI科学家,向刘炽平汇报。 他接过手的更像是一个“烂摊子”,但也是个明白的摊子。2026年1月底,混元启动底层基础设施全面重建,覆盖预训练、强化学习、数据和评估。3月,腾讯撤销成立近十年的AI Lab;7月23日,大语言模型部与多模态模型部合并为基础模型部,28岁的姚顺雨统管腾讯全部底层模型研发。 根据最新财报,二季度腾讯研发支出了272.8亿元,同比涨了35%;资本开支527.8亿元,同比涨了176%,大头都进了AI算力和训练。 按他说的节奏,混元平均每两个月迭代一次大版本:4月,发布Hy3 preview,7月6日,发布Hy3 正式版,发布一周,调用量较Hy2涨了超68倍,到8月28日,Hy4 preview上线。 48小时前,或许整个行业都盯着同一个问题:这次,腾讯真的追上了吗? 02 押家底般的投入和跑分里的一些真话 先看规格。Hy3是295B总参、21B激活、256K上下文;Hy4 preview直接拉到 770B、49B和1M,注意力机制从GQA换成了Gated DSA 加上IndexCache,残差改成4路iHC。 说人话就是,从长上下文里挑重点看,信息多路并行传,模型变大了近两倍半,但每token激活的只有49B,成本可控。 有博主称,在架构层面,这是混元第一次真正摸到国内顶级模型的边。 定位也换了个说法,不再喊通用,而是为生产力而生 。在软件工程、办公分析、游戏开发和科学研究四个场景,靠腾讯内部专家共建数据和 WorkBuddy/CodeBuddy 产品协同打磨。 姚顺雨之前反复讲过一个思路,不训练刷榜的做题家,关心模型在真实场景好不好用。 官方还讲了个更玄的故事,递归自我改进。说Hy4 preview是第一次参与了自己训练方法、数据策略、评估体系和底层算子的自动优化,自主做算子融合和通信优化,端到端吞吐提升了31.8%。科学方面,把3DBlaschke-Lebesgue 问题的体积下界从0.380799推到了0.41104,离Meissner四面体猜想只剩2%的差距。 顺带官方也坦白了,preview版本复杂任务容易长思考、过度自我验证。这句话后面会反复应验。 腾讯官方公布了一组12项评测的对比,对手是GLM 5.3、Kimi K3、DeepSeek V4 Pro、Qwen 3.8 Max,以及闭源阵营的 GPT 5.6 Sol 和 Claude Opus 5。 别被这一锅粥的表骗了,我们分三档来看: 第一档是跟国产开源同侪,的确是站住了 。Terminal Bench 2.1 拿85.4(GLM 5.3 约88.2–88.8、Kimi K3 约85.7–88.3,不同转引会有出入);DeepSWE64.3,略低于Kimi的74.0;但SWE-bench Multilingual 82.9,是开源阵营第一;SWE Atlas Refactoring、Toolathlon-Verified 、OneMillionBench(工具)都领先。 第二档是跟闭源旗舰,差距还是比较明显的。 GDPval-AA V2 上,混元 1678,Claude Opus 5 是 1831,GLM 5.3 都压它一头(1763);物理推理的 CritPt 上,混元16.9,处于全场垫底区,GPT 5.6 Sol 是 32.3,Claude 是 29.1;SWE-bench Pro 上,Claude 79.2,混元65.7;HLE 纯文本,Claude 54.9、GPT 49.5,混元 43.4。 第三档是跟自己比,的确进步惊人 。DeepSWE 从28.0干到64.3,翻倍还多;ProgramBench从3.6到17.5;Terminal Bench从70.8到85.4。一个半月追回这么多,混元自己都说这是最大的代际增益,这回真不是吹。 还有两个数字,得单独拿出来捋一捋。 一个是官方盲测,有163名内部专家、203个工程任务,Hy4 preview 均分 2.99/4,略优于GLM 5.3(2.92)和 Kimi K3(2.94)。 听着很提气是吧?但仔细看胜负比,对 GLM 是胜 46.8%、负 40.4%,对 Kimi 是胜 51.2%、负 40.9%。负率四成,这就是五五开里探出一个头。而且打分的是腾讯自己的工程师,任务是自家工程任务。这个略优于的含金量,或许是要打折扣的。 另一个是第三方榜单,在Arena.ai的Code Arena WebDev 上,Hy4 preview排第5,1633分、开源模型第3,和 Grok-4.6、GPT-5.6 Sol 咬在同一区间。这是混元模型头一回出现在这种位置。 注意措辞是出现在这个位置,不是站上第一位。混元从落后到第一梯队的叙事,目前一半还靠官方自己的数据撑着,独立机构的大规模横评还没出来。 03 干活的时候,它到底行不行? 跑分归跑分
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱