首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

智谱认领“牛来”模型,实测:“牛马”友好

2026-08-28 1 阅读 约10分钟阅读 李冬梅
分享:
字号:
过去一个周末,全球AI开发者都在追问同一个问题:突然出现在 OpenRouter 上的神秘模型Ox Alpha,究竟来自哪家实验室? 它没有公布开发者,没有披露参数规模,也没有给出技术报告,只以“匿名模型”的身份开放使用。 但在短短几天内,Ox Alpha迅速冲上OpenRouter热门榜单,并凭借代码生成、复杂推理和长时间Agent任务中的表现,引发了大量猜测。 “牛来”模型谜底揭晓,是 GLM-5.3-Flash 现在,谜底终于揭晓。 昨天晚上,智谱正式确认:Ox Alpha 正是其最新发布的 GLM-5.3-Flash。过去一周在海外开发者社区引起轰动的“神秘模型”,真的来自智谱。 Ox Alpha最早于8月20日匿名登陆OpenRouter。 在身份揭晓前,OpenRouter对它的描述是:一款面向代码、持续智能体工作和生产负载设计的推理模型,适合处理长期软件工程、复杂推理,以及结合文本和视觉信息的工作流。 它可以接收文本、图片和视频输入,输出文本,匿名测试版本提供104万Token上下文。 OpenCode 还曾宣布向用户免费开放一周,并称模型提供方准备了每天100万亿Token的服务能力。 这种近乎“无限量免费”的测试方式,让Ox Alpha在几天内获得了大量真实用户。 Stripe 联合创始人兼 CEO Patrick Collison 体验后表示,它“非常令人印象深刻”。 一部分开发者则发现,Ox Alpha在代码修改、前端生成、理解大型代码仓库以及连续调用工具方面,表现并不像一款普通的低成本模型。 外界对其身份的猜测也由此升温。 事实证明,Ox Alpha 并非智谱在 GLM 之外另起炉灶,而是 GLM-5 系列中的新成员——GLM-5.3-Flash。匿名上线更接近一次大规模公开盲测:先隐藏厂商和模型名称,让开发者根据实际使用效果作出判断,再公布身份和技术细节。 智谱此前也采用过类似方式测试 Pony Alpha。相比直接发布基准测试成绩,匿名测试能够在一定程度上减少品牌认知对评价的影响,也能在正式发布前获得更大规模的真实负载和用户反馈。 根据智谱官方博客,Ox Alpha 在 OpenCode 和 OpenRouter 开放期间,一度成为当周最受欢迎的模型。 更加值得注意的是,匿名测试期间产生的全部流量,均由部署在国产AI芯片上的大规模集群承载。 新模型怎么样? GLM-5.3-Flash是一款混合专家模型,拥有3200亿总参数,但每次处理Token时只激活约180亿参数。 这意味着,它保留了大模型的参数容量,但不需要在每次推理时调用全部3200亿参数。 模型会根据输入内容,将任务分配给部分专家网络,在模型能力、推理速度和部署成本之间寻找平衡。 与GLM-4.5系列相比,两者的总参数量接近,分别为3200亿和3550亿,但GLM-5.3-Flash的激活参数从320亿下降到180亿,模型层数也由92层减少至45层。 激活参数和层数减少,可以直接降低单个Token推理时需要完成的计算量。 这也是GLM-5.3-Flash名称中“Flash”的一层含义:它并非简单缩小模型,而是希望通过架构变化,用更少的实际计算量保留接近大型模型的能力。 GLM-5.3-Flash还是GLM-5系列中第一款原生多模态模型,可以同时处理文本、图片、视频和文件,并提供约100万Token上下文窗口。 智谱称,该模型采用了最新的30万亿Token多模态预训练语料。这意味着其视觉能力并非在纯文本模型训练完成后简单外挂,而是在预训练阶段便将文本与视觉信息纳入统一模型。 模型权重目前已经在Hugging Face开放,并采用相对宽松的MIT许可证。开发者可以通过SGLang、vLLM、KTransformers和TokenSpeed等框架进行本地部署。 模型地址: https://huggingface.co/zai-org/GLM-5.3-Flash " 具体而言,新模型有哪些亮点值得关注? 亮点一:重新设计的注意力机制 首先是为百万 Token 上下文重新设计的注意力机制。 长上下文一直是大模型推理成本增长最快的部分之一。 模型需要记住的内容越多,注意力计算量和KV Cache占用的显存就越大。当上下文扩展到100万Token后,如果继续沿用传统注意力机制,服务成本和硬件压力都会明显上升。 为了降低这部分开销,GLM-5.3-Flash 采用了线性注意力与稀疏注意力结合的混合架构。智谱将其称为首个采用这种混合架构的开源前沿模型。 其中,线性注意力主要通过状态建模捕捉局部依赖;稀疏注意力则通过轻量级索引器,从更长的上下文中寻找与当前任务相关的信息。 简单来说,模型不必在每一次生成时都让所有Token彼此进行完整计算,而是先利用线性注意力处理局部信息,再从百万Token上下文中检索真正相关的全局内容。 为进一步降低百万Token场景下索引器的延迟和内存占用,智谱还设计了IndexPool,通过加权池化将四个索引器Key向量压缩为一个。 按照智谱给出的测算,与GLM-5.3相比,GLM-5.3-Flash的注意力计算量降至约三分之一,KV Cache规模降至约四分之一,分别减少3.01倍和4.44倍。 不过,智谱也没有回避它与其他模型之间的差距。 在其对GLM-5.3、DeepSeek-V4-Flash 和 Kimi-K3 的对比中,GLM-5.3-Flash 的注意力计算量最低,但 KV Cache 仍然略大于 Kimi-K3 和 DeepSeek-V4-Flash,说明其显存效率仍有进一步优化空间。 除了混合注意力,GLM-5.3-Flash还引入了Manifold-Constrained Hyper-Connections,也就是mHC,用于提高模型扩展过程中的训练稳定性和参数利用效率。 这些改动共同指向一个目标:GLM-5.3-Flash不追求单纯把模型做得更大,而是希望减少完成同一任务所需的实际计算和存储资源。 亮点二:代码和Agent能力,是“牛来”的主要长板 从智谱公布的测试结果看,GLM-5.3-Flash的优势主要集中在代码、工具调用和长时间Agent任务上。 在DeepSWE v1.1中,GLM-5.3-Flash取得63.4分,高于GLM-5.2的46.2分。DeepSWE关注的并不是让模型补全一段代码,而是测试它能否进入真实代码仓库,理解项目结构、定位问题并完成修改。 在用于测试自动化操作能力的 AutomationBench 中,GLM-5.3-Flash 取得48.8分,GLM-5.2为26.2分。此外,它在 NL2Repo 上取得56.3分,在Toolathlon Verified上取得78.4分,在Agents’ Last Exam中取得26.3分,在Terminal-Bench 2.1中取得84.3分。 Terminal-Bench主要测试模型能否在真实终端环境中完成软件工程、系统管理和数据处理任务。模型不仅要给出答案,还要实际调用命令、观察执行结果、处理错误并继续推进任务。 这些测试更接近当前 Coding Agent 的工作方式:模型需要连续思考和操作,而不是一次
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱