首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡

摘要

神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡 十三 2026-08-27 00:48:12 来源: 量子位 金磊 发自 凹非寺 量子位 | 公众号 QbitAI 终于,这几天在网上炒得沸沸扬扬的 神秘 模型 「牛来」 (Ox Alpha),真身曝光了! 而且果然是来自 中国玩家 —— 是 智谱 刚刚发布即 开源 的 GLM-5.3 Flash ,还是5系列里 首个 原生多模态的那...

GLM 视频地址 https weixin com 量子位 Flash wNQAWeUacfB8a1F_kQZe_g 那么接下来 智谱GLM
2026-08-27 1 阅读 约9分钟阅读 十三
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡 十三 2026-08-27 00:48:12 来源: 量子位 金磊 发自 凹非寺 量子位 | 公众号 QbitAI 终于,这几天在网上炒得沸沸扬扬的 神秘 模型 「牛来」 (Ox Alpha),真身曝光了! 而且果然是来自 中国玩家 —— 是 智谱 刚刚发布即 开源 的 GLM-5.3 Flash ,还是5系列里 首个 原生多模态的那种。 「牛来」在火的这几天里啊,其实已经有不少人用Ox Alpha这个版本在实测了。 其中玩儿得比较多的,便是手搓一个 SpaceX Raptor猛禽发动机3D交互网页 。 例如博主Tim Jayas时隔几日,用同样的Prompt让「牛来」做了两次这个任务后,直接发出了这样的感慨: 感觉「牛来」是一个能自己持续学习的模型。 巧了,我们刚好也拿到了GLM-5.3 Flash的内测资格,也做了同款的项目;在我们输入完Prompt之后,全程无需任何操作: 在等候片刻之后,3D猛禽引擎项目就出炉了,来感受一下这个feel: 视频地址: https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g 从效果对比来看,嗯,无需多言,GLM-5.3 Flash做出来的3D猛禽引擎,更精进了。 那为啥「牛来」模型会这么火? 单单是从各大官方的帖子中,我们就能窥知一二。 例如在 OpenRouter 上,「牛来」首日便冲上了榜首,还刷新了刷新单日tokens用量历史纪录: OpenCode 则表示,Ox Alpha一出世,即终结了DeepSeek在OpenCode连续56天霸榜的纪录: 而在智谱正式认领完「牛来」之后,我们还发现了GLM-5.3 Flash其它亮点。 在 模型尺寸 方面,GLM-5.3 Flash仅为 320B ,但在能力上 全面超越 了体量为753B的GLM-5.2。 除此之外,根据最新的AA榜单显示,GLM-5.3 Flash已经拿下 57分 ,放眼全球范围内已然是步入前沿之列,并且与Claude Opus 4.8得分持平。 在 价格 方面,GLM-5.3 Flash的定价是5.3版本的1/10,限时折扣为1/20的GLM-5.3,1/40的Opus 4.8,定价低于DS-V4-Flash。 以及,还有一件值得骄傲的事儿—— 上面提到的62T Tokens都跑在国产卡上!原来老外追了一个月的神秘模型,是头纯血国产牛。 那么接下来,老规矩,一波深度实测,走起~ 智谱GLM,终于长眼睛了 正如我们刚才提到的,智谱GLM-5.3 Flash是5系列里的首个原生多模态模型。 所以第一波实测,我们就围绕 多模态 来展开。 例如我们给GLM-5.3 Flash一个 多人说话 的视频,让它能基于原视频,分清谁在说话,并且精准配上字幕。 Prompt如下: 先识别不同说话人,再制作兼具人物颜色和卡拉 OK 跟读效果的字幕:人物底色保持固定,当前读到的词或短语进一步高亮。配色使用青蓝、暖黄、珊瑚红和白色的高对比组合,当前词由低亮度平滑过渡到高亮色。区分主讲人、主持人和短暂插话者,背景音乐、掌声与环境人声不单列为说话人。字幕必须基于最终时间轴重新对齐,任何剪辑后的片段都不能沿用源视频的旧时间位置。先通览全片再做决定,避免只依据开头样本推断后续结构。请保持剪辑点自然,优先保证人声清晰。字幕放在画面安全区,并用描边或底板保证复杂背景下可读。 这个任务就挺考验一个模型多模态处理的功底,例如它得先对视频做理解,人物也得对应上,以及最重要的,字幕得精准。 那么我们来看一下GLM-5.3 Flash的表现: 视频地址: https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g 其中一个细节是,GLM-5.3 Flash可以先从画面里,捕捉到哪怕只出现了一次的“名签”这个细节,以此来对应声音、名字和人物的关系。 由此可见,GLM-5.3 Flash在这个任务上的多模态能力是比较过关的。 如果你觉得配字幕这个任务有点简单,那么接下来,我们再“喂”给GLM-5.3 Flash一整部经典电影《神话》,让它直接做一个 电影解说视频 。 Prompt如下: 请将这部完整电影剪辑成一条中文电影解说视频,梳理主线剧情和人物关系,突出关键冲突与情绪转折,确保解说内容与原片一致,并生成配音和中文字幕。 来看下最终的成片: 视频地址: https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g 相比刚才的配字幕来说,GLM-5.3 Flash这次要“看”的视频时长更长,还要对整个剧情有把控,截取出来的关键片段且得是连贯和重要。 而从最终结果来看,GLM-5.3 Flash能自己理解并执行电影解说背后的一切关键步骤,并且效果呈现上,已然也是够达标的。 接下来,除了多模态之外,我们再把 Coding能力 放进来一起考验。 大致的任务是先给GLM-5.3 Flash一张完整的 产品设计稿 ,让它基于一张图,做出来 可以交互产品使用界面 。 准备的设计稿如下(上下滑动查看全图): Prompt是这样的: 按照这张 UI 设计稿实现一个完整的移动端购物 App,尽量还原原设计里的配色、字体、图片、卡片和页面布局,并把图中展示的主要页面和购物流程做成可实际交互的版本。实现首页/发现、商品列表、筛选、商品详情、评价、收藏、购物车、配送、地址、支付、订单完成、门店地图、个人中心和设置等功能。 来看下最终互动的效果: 视频地址: https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g 依旧是一连串的功能都能按照Prompt的要求,丝滑地进行交互。 至于更加复杂的任务,智谱官方展示了一个由GLM-5.3 Flash独立跑了12个小时后的3D Blender场景构建任务的效果: 视频地址: https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g 嗯,现在GLM-5.3 Flash的情况就是,只要你给够它时间,它就能以低廉的价格,自己把复杂任务给跑通。 架构也是全新的 在看完实测后的结果,或许你会好奇一个问题: 为啥一个320B的模型,就能做到这样的效果呢? 答案其实藏在“Flash”这个词的背后。 这一次,智谱从模型架构本身就开始抠效率。 GLM-5.3 Flash总参数为320B,实际激活参数只有18B,层数也从GLM-4.5时期的92层压到了45层。但瘦身之后,能力反而超过了上一代更大的GLM-5.2。配合最新的30T Token多模态预训练语料,智谱希望做到的是少算一点,但别少干活。 这里面最关键的一刀,砍在了注意力机制上。GLM-5.3 Flash采用了 线性注意力+稀疏注意力的混合架构 。 线性注意力负责抓住局部信息,稀疏注意力再
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱