首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

腾讯混元 Hy4 preview 开源,参与“训练自己”!WorkBuddy实测:有了小型团队交付实力,但还得有人盯

摘要

“在顺雨与研究团队的努力下,Hy4将会迎来更多突破与更大的进步,大家可以拭目以待。但眼睛也不能只盯着模型这一层。”汤道生前两天在内部署名文章中说的,现在终于来了。 今天,腾讯发布了混元Hy4 preview,总参数 770B、激活参数 49B,上下文长度突破 1M,重点面向Agent、Coding与生产力场景优化,增强在真实业务场景中完成复杂任务的能力。 据悉,相比上一代,Hy4 preview在...

preview Hy4 https com WorkBuddy tokens Cursor Claude CodeBuddy tencent
2026-08-28 1 阅读 约10分钟阅读 褚杏娟
分享:
字号:
“在顺雨与研究团队的努力下,Hy4将会迎来更多突破与更大的进步,大家可以拭目以待。但眼睛也不能只盯着模型这一层。”汤道生前两天在内部署名文章中说的,现在终于来了。 今天,腾讯发布了混元Hy4 preview,总参数 770B、激活参数 49B,上下文长度突破 1M,重点面向Agent、Coding与生产力场景优化,增强在真实业务场景中完成复杂任务的能力。 据悉,相比上一代,Hy4 preview在多步骤Agent、代码开发和生产力任务上进一步提升,尤其是在更好的任务拆解、上下文承接、指令遵循和长链路执行能力上。 在Coding场景中,进一步增强代码理解、生成、修改和复杂工程任务处理能力;在生产力场景中,重点提升文档处理、信息分析、办公自动化、游戏开发、网页生成及跨工具协作等能力;在游戏开发场景中,增强了一句需求直接生成可玩原型能力,并能熟练使用游戏引擎,开发者可以通过多轮交互持续完善复杂游戏项目;在科学研究场景下,提升复杂科研问题的理解、推理与求解能力。 值得注意的是,Hy4 preview 在自身研发的全链路过程中发挥了积极价值,首次参与训练方法、数据策略、评估体系和底层算子的自动优化。模型提出方案、运行实验并根据结果继续迭代,实验产生的代码、日志和反馈进入下一轮探索,形成初步的递归自我改进闭环。 Hy4 preview 还通过自主分析推理系统瓶颈,并围绕算子融合、通信优化等方向开展多轮优化,端到端吞吐相较基线提升 31.8%,在不同上下文长度和并发度下均取得稳定收益,初步展现了自主开展推理基础设施优化的能力。 Hy4 preview 已经开源,并在 WorkBuddy/CodeBuddy 国内版及国际版、元宝、ima 等腾讯产品同步首发,也可通过腾讯云 Tokenhub 和 OpenRouter 接入 API 使用。 定价方面,Hy4 preview 继续走普惠高性价比路线,输入 6元/百万 tokens,输出 18 元/百万 tokens,缓存命中 0.3 元 / 百万 tokens。为进一步收集用户反馈以进一步提升模型性能,腾讯表示,WorkBuddy/CodeBuddy 将面向用户开展为期2周的限时免费活动。 开源链接: HuggingFace:https://huggingface.co/tencent/Hy4-preview Github:https://github.com/Tencent-Hunyuan/Hy4-preview Modelscope:https://modelscope.cn/models/Tencent-Hunyuan/Hy4-preview Gitcode: https://ai.gitcode.com/tencent_hunyuan/Hy4-preview " 模型体验: https://aistudio.tencent.com/ " 测试:基本可独立完成任务,只关键节点需要人工 我们在 WorkBuddy 中测试了Hy4 preview,最直接的感受是Agent 已经开始具备“把一件事情做完”的能力,但人还是需要作为最后一道防线,Agent 还需要解决“最后一公里”问题。 AI编程工具采购报告:搜索能力很强但差临门一脚 我们首先给的任务是:公司准备为 30 人开发团队统一采购 AI 编程工具。请调研以下四类方案的当前团队/企业选择:Cursor;GitHub Copilot;Claude Code / Claude for Work;OpenAI Codex / ChatGPT Business 或 Enterprise 中的 Codex。(提示词会更详细一些) 先直接说结论:最后的报告很漂亮,结果非常接近通过,但因几处关键事实和成本计算错误被卡在及格线下。 结果如下: 有兴趣的读者可以查看PDF版本(原版):https://docs.qq.com/pdf/DYnhQeVZDSmFYbVp6 这份报告有不少做得不错的地方,比如能调用十来个网页,把复杂政策调查得非常深入,时效性信息也抓得很好,像GitHub 2026 年 4 月 22 日暂停 Copilot Business 新自助注册,这是真实且很容易漏掉的动态政策,报告抓到了。 但仍然有遗漏,而这也带来了严重后果:由于Cursor 年付价格漏查,造成整个成本横向比较口径不一致。 报告按照 40美元/席/月算出 Cursor Teams Standard 30 人一年14,400美元,Premium 算成 43,200美元;但 Cursor 2026 年 6 月官方已经明确,Teams 年付分别是 Standard 32美元/席/月、Premium 96美元/席/月。 因此,如果报告对 Claude、ChatGPT 都采用年付最低价格,Cursor 也应该同口径使用年付价格。正确应为: Cursor Teams Standard:30 × 32 × 12 = 11,520美元/年,不是 14,400美元;Cursor Teams Premium:30 × 96 × 12 = 34,560美元/年,不是 43,200美元;20 Standard + 10 Premium:20×32×12 + 10×96×12 = 19,200美元/年,不是 24,000美元。 这个错误直接导致了错误的结论:“即使 Copilot Business 额度超支 100%,年成本 13,680美元仍低于 Cursor Teams Standard 的起步价14,400美元。” 还有OpenAI Business 的 SSO 不是“未确认”,而是已经有明确官方文档这样的错误。 此外,在系列调研后,最终却在一个简单乘法或者复制数字上翻车。比如 15 席 Claude Team 时总成本写为 10,800美元,实际上是6,840 + 15×20×12 =10,440美元。 可以看出,目前Hy4 preview在WorkBuddy后,其信息密度、官方资料覆盖、动态政策捕捉都明显高于普通搜索型回答,调研能力很强,但没有完成最后一道交叉校验和数字自检,导致少量错误进入了核心采购结论。 因此,当前人力核验是必不可少的环节。它已经像一个相当能干的采购研究员,但还不是可以不复核就签字的采购负责人。对于后续研发来说,在长链路工具调用结束后,Agent 需要加强对自己的事实和计算进行二次审计。 四端网页制作:小型产品团队式交付能力 第二个任务,是做一个四端产品实现。 还是直接说结论:明确通过,而且属于目前相当强的一档表现。 这次给的任务提示词是: 公司准备开发一套内部“项目作战中心”,用于同时管理多个产品项目。系统至少包含:项目名称、项目负责人、当前阶段、完成进度、截止日期、风险等级、待办任务。请基于同目录中的 `projects.json`,分别实现 Web 端、移动端、桌面端和一个 3D 项目作战室。要求四个版本使用一致的数据结构,但针对不同终端设计适合的交互方式,不能只是简单缩放同一个页面。必须支持查看项目列表、查看项目详情、按负责人和风险等级筛选、创建任务、修改任务状态、查看整体项目进度、对已逾期或高风险项目给出清晰的视觉提示。3D
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱