首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

刚刚,GLM-5.3发布:Coding更接近Fable 5!潜伏40年的bug都被揪出来了

摘要

刚刚,GLM-5.3发布:Coding更接近Fable 5!潜伏40年的bug都被揪出来了 十三 2026-08-14 16:47:51 来源: 量子位 金磊 发自 凹非寺 量子位 | 公众号 QbitAI 太热闹了。 昨儿DeepSeek V4 Pro正式版+Harness、Grok 4.6“你方唱罢”,今儿 GLM-5.3 闪亮一记 “我登场” —— 一出手便杀回 开源一哥 、 国模一哥 ,甚...

GLM Fable 视频地址 https weixin com LXLsciw8OqStAyxWnktbzg 量子位 这次GLM 中国人能飞
2026-08-14 1 阅读 约9分钟阅读 十三
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 刚刚,GLM-5.3发布:Coding更接近Fable 5!潜伏40年的bug都被揪出来了 十三 2026-08-14 16:47:51 来源: 量子位 金磊 发自 凹非寺 量子位 | 公众号 QbitAI 太热闹了。 昨儿DeepSeek V4 Pro正式版+Harness、Grok 4.6“你方唱罢”,今儿 GLM-5.3 闪亮一记 “我登场” —— 一出手便杀回 开源一哥 、 国模一哥 ,甚至在Coding方面更加 接近Claude Fable 5! 也就是说,唐杰给马斯克“画的饼”(说国产模型超越Fable 5不会太久),往前拱了一大截,也就花了2个月整。 在多项主流基准测试中,GLM-5.3是当前 排名最高的开源模型 ,编程与智能体能力接近Claude Fable 5,编程 体感 超过其他国产模型。 更值得注意的是不同推理强度下的表现。随着Token预算增加,GLM-5.3的Coding准确率继续往上走;在High档位下,已经能以明显更低的Token消耗,做到超过Claude Opus 4.8最高档位的准确率。 但你先别急着“嚯~”、“好家伙”,因为好戏还在后头。 这次GLM-5.3除了Coding之外,另一个更重要的关键词,是 安全 。 在CyberGym白盒代码审查中,GLM-5.3拿到84.5%,相比5.2的77.2%继续提升,也略高于Mythos 5和GPT-5.6 Sol,一举成为 最强开源安全模型 。 并且在GLM-5.3发布前两周,智谱就联合清华、南开,以及国内众多企业、实验室,开展了密集的红队测试与安全评估。 据悉,累计发现漏洞2404个(经过初筛、去重),其中1088个为中高危,覆盖系统内核、操作系统、浏览器引擎、开源基础组件、互联网应用与互联网协议等220个项目。 甚至最早的Bug,可以追溯到 40年前! 所以,这次智谱发布GLM-5.3,两个关键词便一目了然了:一个是Coding,另一个是安全。 不意外,GLM-5.3一出,瞬间在X引发了大量的关注和热议,网友们已经把它称作 “Fable 5级” 了: 不得不说啊,这次GLM-5.3又在国际上把国产AI给支棱起来,这盛况,真是应了揽佬的“名人名言”: 中国人能飞~中国人能飞~ 最重要的一点是,在体验GLM-5.3的真实过程中,我们的体感真真儿的可以用一句话来概括: 丝滑,相当的丝滑! 是有点 超预期 在身上的。 那么接下来,老规矩,一波深度实测,走起~ 做了一个可交付的模拟游戏 我们这次所有的实测,都会在智谱自家的Harness,即 ZCode 里进行。 第一个任务,就拿 Karpathy 最新抛出的 指环王基准 来小试牛刀一下。 在把《指环王》第一章开头的文字和对应Prompt输进去之后,模型选择我们提前拿到的内测GLM-5.3,并把模式变成“完全访问”,保证全程无人工干预: 然后,GLM-5.3就自己唰唰唰地开始干活了,你只需要做的,就是等: 在 28分钟 后,一个中文版的指环王基准,就水灵灵地做出来了: 视频地址: https://mp.weixin.qq.com/s/LXLsciw8OqStAyxWnktbzg Karpathy设计的这个任务,考验的是模型能否长时间自主规划、写代码、摆放3D资产、编排动画并做出完整可运行作品。 并且我们在Prompt中还刻意加大了难度,让AI根据原文自行改编成约90秒中文旁白,但不能改变核心情节。 从GLM-5.3的结果来看,它不仅可以hold住这项测试的基本要求,更能从文学文本里抓重点,并把文字重新组织成视听语言。 这类任务的难点,其实也不只是Three.js能不能跑起来。模型得先把一段文学叙事拆成场景、人物、镜头和时间线,再一路落进代码里,最后还得保证90秒的内容能连续跑起来。 为了更直观地感受GLM-5.3 Coding能力的提升,我们还用一模一样的Prompt和设置,让GLM-5.2跑了一遍: 视频地址: https://mp.weixin.qq.com/s/LXLsciw8OqStAyxWnktbzg 无需多言,GLM-5.3完胜。 接下来,我们加大难度,让它再做一个可以完全交互的3D手表解构的Demo。 在输入完Prompt之后,GLM-5.3依旧是自己开始操作,遇到需要修复的地方,也会自行检查做调整: 在 十几分钟 过后,结果就生成出来了: 视频地址: https://mp.weixin.qq.com/s/LXLsciw8OqStAyxWnktbzg 在没有任何扫描、没有下载任何手表相关模型的情况下,手表各处细节都能被解构得明明白白,而且是把镜头拉到特别大也是能hold住的那种。 相比前面的“指环王基准”,这一关考的又不太一样:一块完整的表好画,但拆开以后,表盘、机芯、齿轮和表链之间的空间关系还能不能保持住,才是考验3D Coding的地方。 不过有一说一,上面两个实测效果虽然还算不错,但终归是属于演示级别的Demo。 因此,Coding能力的最后一个实测,我们尝试GLM-5.3是否能做 可交付的模拟游戏 。 也就是说,这个任务跑下来,它不仅是有视觉效果,还得是有后端、有数据库、有权限、有测试、有部署的完整模拟游戏。 (注:本地需提前安装好Docker。) 这次任务较为复杂,GLM-5.3总共花了40分钟。 但对于此次任务的验收,我们不能停留在只放出来最终效果,且得一步一步验证。 首先就是 注册和登录游戏 : 然后我们进入游戏后进行操作,点击 保存到数据库 ,并退出游戏;要保证进来后还是刚才 存档的进度 : 权限 测试方面,我们退出刚才的账号,再重新注册一个;进入游戏后,我们不难发现2个账号的信息是 互相看不到 的。 这就证明GLM-5.3已经跑通了权限的设置: 视频地址: https://mp.weixin.qq.com/s/LXLsciw8OqStAyxWnktbzg 最后,为了方便起见,我们让GLM-5.3自己跑测试并输出 验收报告 ,Prompt如下: 现在不要再增加任何新功能。 请进入最终验收阶段,实际运行项目现有的全部自动化测试、权限测试、数据库持久化测试和构建测试。 然后向我输出一份最终验收报告。 必须列出: 1 . 实际执行了哪些测试命令 2 . 每一项测试的真实结果 3 . 总测试数量 4 . 通过数量 5 . 失败数量 6 . Docker构建是否真实成功 7 . 哪些内容经过真实验证 8 . 哪些内容尚未验证 9 . 当前已知Bug 不要修改测试结果,不要将未运行的内容描述为已经通过。 最终的报告结果如下,可以看到,这个项目确实是把前端、后端、数据库、权限等,通通跑通了: 结合上面三个实测来看,GLM-5.3在Coding方面,不仅仅是更会写质量更高的“页面”,现在,它已经能把一个需求真正交付成软件。 没有GPU,硬让它编CUDA会怎样? 既然GLM-5.3已经是可交付的生产级AI,那么安全,也就是此次智
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱