首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

GLM-5.3-Flash发布,多模态终于来了

2026-08-27 1 阅读 约10分钟阅读 Leo张ToB杂谈
分享:
字号:
不久前,在OpenCode和OpenRouter上进行了出现了一个名为Ox-Alpha(中文社区称作牛来)的模型,并迅速成为当周最受欢迎的模型。而就在近日, 智谱 AI出面认领了这个中文名为“牛来”的模型,就是其最新发布的GLM-5.3-Flash。值得注意的是,GLM-5.3-Flash是GLM-5系列的首个原生多模态模型。 重新定义模型“斩杀线” Ox-Alpha上线首日即冲至OpenRouter榜首,并刷新单日tokens用量历史纪录,相较OpenRouter平台之前最大tokens量提升4倍。 能力强只是GLM-5.3-Flash最不值得一提的一个环节,GLM-5.3-Flash带来的惊喜之一就是将模型的价格“打下来”。原先,大模型有着参数越大、能力越强、价格越贵的定律,OpenAI的GPT-4系列、Anthropic的Claude Opus系列,无不遵循这一定律。就连智谱自己的GLM-5.3,上半年提价后输出价格也达到了28元。 GLM-5.3-Flash的出现,打破了这条曲线。GLM-5.3 Flash的Artificial Analysis Intelligence分数为57分,超过了上一代旗舰模型GLM-5.2,也高于DeepSeek旗舰模型V4 Pro正式版的53分。在Artificial Analysis Intelligence Index的公开榜单上,GLM-5.3-Flash的57分“远高于同类模型的中间值(18分)”。 而就是这种比肩主流闭源模型的能力,其价格主流模型的四十分之一。官方数据显示,GLM-5.3-Flash每百万Token输入0.8元、输出2.8元、缓存命中价格0.23元。横向对比调价后的DeepSeek V4 Flash——其谷时价格分别为输入1.5元、输出4.5元。综合输入和输出成本,GLM-5.3-Flash在绝大多数常规调用场景下比DeepSeek V4 Flash更便宜。 而对比Claude Opus 4.8,差距更加悬殊。按当时汇率折算,Opus 4.8每百万Token输入约35元、输出约175元。GLM-5.3-Flash的价格仅为对方的四十分之一左右。 “同样智力,1/40价格,前沿智能,第一次不需要省着用。”智谱在发布公告中这样写道。 8月,DeepSeek V4 Flash已经完成了一轮提价。涨价说明市场有强劲需求——也说明“便宜”这件事,在商业上不可持续太久。而智谱在GLM-5.3-Flash上选择的路径恰恰相反:用更低的成本结构,支撑更低的价格,同时不牺牲模型能力。这不再是一个单纯的市场营销动作,而是一次工程能力的验证。 多模态终于来了 此前,智谱首席科学家唐杰在社交平台上发起全球意见征集,为GLM-5.3收集功能建议,浏览量超过40万。评论区被一个词刷屏了:视觉。 GLM-5.3-Flash是GLM-5系列的首个原生多模态模型。视觉编码(Visual Coding)并不只是处理图像,它拓展编程所能触及的边界。对于前端开发、游戏开发、3D仿真等任务而言,最终产物包括用户能够感知的界面、交互或虚拟世界,视觉能力被原生集成进模型中,使其能够自主判断何时需要“观察”,并利用视觉反馈来指导下一步行动。 GLM-5.3-Flash的多模态能力,最直接的落点是Coding。 传统编程模型的工作方式是:你给它需求,它输出代码,然后你拿去跑、去看效果、发现问题、再把问题喂回给它。这是一个“人”在闭环里当裁判的流程。GLM-5.3-Flash把裁判也交给了模型自己——视觉能力被原生融入Coding循环,使模型能够主动观察界面、渲染结果与交互反馈,并据此持续测试和改进。 这意味着什么?模型写完前端代码,可以自己“看”一下渲染出来的页面长什么样;做完一个游戏功能,可以自己“玩”一下看看有没有bug;搭完一个3D场景,可以自己“转”一圈检查各个视角是否协调。 智谱针对视觉编码开发了专门的数据合成流水线,重点训练模型的自我视觉判断与测试时改进能力。最终生成的轨迹要求模型与环境交互、检视自身输出,并进行迭代式改进。这不再是“生成代码”的单向输出,而是一个“生成-观察-修正”的闭环。 智谱官方展示:GLM-5.3-Flash在Blender中自主运行了16个小时,没有任何外部素材,从零搭建了一套约400平方米的专业主厨自宅与测试厨房。 这个任务远不止“写代码”那么简单。在Blender中构建一个连贯的3D场景,需要把几何、材质、光照与空间等知识转化为一个在不同视角下都保持一致的3D结构。模型需要判断什么时候该“看一眼”渲染结果,再用看到的结果决定下一步该做什么。它要自己决定墙怎么砌、光怎么打、厨房动线怎么规划——然后看到效果,再调整,再看到效果,再调整。16个小时,一个模型在虚拟世界里当了一次建筑师兼室内设计师兼施工队。 另一个官方展示的案例是复刻游戏《泰拉瑞亚》。从图像到可运行工程,从两小时电影到8分钟成片,这些实测合集展示的,是一个不仅能写代码、还能“看懂”自己写了什么的模型。 跑在国产卡上 GLM-5.3-Flash最不寻常的地方,或许不在模型本身,而在它跑在什么上面。 过去一周,智谱首次尝试用一个大规目国产芯片集群,直接承载来自全球开发者的真实线上负载。据了解,官方没有确认具体供应商,也没有公布具体芯片数量,但据某些媒体报道,其调用超过10万张国产芯片,算力供应商或来自华为、摩尔线程与海光,有知情人士透露,训练或由海光DCU等国产芯片支持。 但可以确认的是:Ox-Alpha在OpenCode和OpenRouter上的所有请求流量,全部由国产芯片提供算力支持。这是一次真实的、持续的压力测试——不是在实验室里跑几个峰值数据,而是让全球开发者用脚投票。用户不知道模型背后是谁、用的是什么芯片,只根据速度、稳定性和效果决定是否继续调用。 结果,Ox-Alpha成了当周最受欢迎的两个平台上的调用冠军。 国产芯片跑前沿大模型,这件事本身就很有挑战性。单张国产芯片当前面对的主要瓶颈是内存容量和带宽,而GLM-5.3-Flash又原生支持最长1M上下文,对显存和通信提出了更高要求。 智谱的解法是在SGLang基础上构建专用推理引擎,并做了一系列激进的内存优化。包括节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化以及Layer Split等技术。核心思路是“以算力换带宽、以通信换显存”——用国产芯片相对充裕的算力,去弥补内存上的短板。 在集群层面,智谱采用了Encode-Prefill-Decode(EPD)分离式架构。多模态编码、Prompt预填充和逐Token解码被拆分为三个可以独立调度和扩缩容的工作池,让不同阶段按照各自的算力特征运行。 这套方案的效果是:与同一批硬件上的初始基线相比,端到端服务性能提升了3倍。智谱称,最终硬件效率和单Token成本已经达到与主流 英伟达 GPU相当的水平。 这里需要做一个重要区分。所谓“1/40”,并不是说国产芯片的硬件推理成本只有海外GPU的1/40。目前并没有公开数据支持这样的比较。更准确的理解是:一款全部由国产芯片集群承载的前沿模型服务,把面向用户的价格压到了Claude Opu
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱