首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

编程能力提高50%!GLM-5.3 满分通过了GPT-5.6给的Coding 测试

摘要

北京时间8月14日,GLM-5.3正式发布。GLM-5.3 围绕GLM-5.2已经搭建完成的长程强化学习技术栈持续扩大训练规模,包括增加更多任务环境、提高任务多样性,并投入更多计算资源进行强化学习训练。 当前,GLM-5.3已经向全部GLM Coding Plan用户开放,并可用于ZCode、Claude Code、OpenCode等Coding Agent。新的Coding Plan同时改为积分...

GLM grader Code Agent GPT sol TASK workspace python3 北京时间8月14日
2026-08-17 1 阅读 约10分钟阅读 褚杏娟
分享:
字号:
北京时间8月14日,GLM-5.3正式发布。GLM-5.3 围绕GLM-5.2已经搭建完成的长程强化学习技术栈持续扩大训练规模,包括增加更多任务环境、提高任务多样性,并投入更多计算资源进行强化学习训练。 当前,GLM-5.3已经向全部GLM Coding Plan用户开放,并可用于ZCode、Claude Code、OpenCode等Coding Agent。新的Coding Plan同时改为积分制额度体系,输入Token、缓存输入Token和输出Token分别计算积分。工作日北京时间14:00至18:00为高峰时段,其余时间包括周末均按照标准积分消耗的50%计算。 智谱还在自家Coding Agent ZCode中进一步强化了缓存和长程任务能力。官方称其缓存命中率可以达到98%以上,重复上下文按照更低的Cached Token费率计算,相当于可以增加约30%的有效Token使用量,同时截至8月31日还提供1.5倍限时额度加成。此外,ZCode还提供Goal Mode,可以围绕一个目标持续完成规划、编码、测试和验证,并支持通过微信或飞书远程查看和控制长时间运行的任务。 官方将在大约两周完成安全评估和加固工作,随后正式公开GLM-5.3模型权重。 AI 测 AI:GPT-5.6 肯定 GLM-5.3 我们让GPT-5.6 sol(最高)设计了可直接交给ZCode的测试压缩包,评分器会生成 zcode-test-results.json,总分100分,每项20分,五个小测试包括: low/high/max 推理强度、JSON遵循、延迟和令牌消耗算法代码生成,运行510项固定、随机和性能测试小型仓库缺陷修复,包括拓扑排序、异常处理和循环检测多轮工具调用,检查库存预留、超卖和任务完成情况受控安全审计,验证路径穿越、符号链接逃逸等补丁 提示词如下: 请先完整阅读当前项目根目录的 TASK.md,然后连续完成其中五项测试。执行要求:1. 先检查 workspace/ 中现有文件,再制定简短计划;2. 只修改 workspace/,不要修改 grader.py、TASK.md、START_PROMPT.txt;3. 不访问网络、不安装依赖、不调用其他模型或外部服务;4. 每完成一项就运行 python3 grader.py,依据真实错误继续修复;5. 不得删除测试、绕过评分器、硬编码 grader.py 中的随机样例或伪造运行结果;6. 全部完成后再次运行 python3 grader.py,并在根目录创建 TEST_REPORT.md,写明五项结果、总分、耗时、关键实现和仍存风险。请现在开始执行,不需要向我确认中间步骤;除非遇到需要扩大权限或无法从本地材料判断的阻塞。 整个期间,除了权限确认外,没有其他额外操作。大约13分钟后,五项测试全部完成,并且满分通过。最后,GLM-5.3 还给出了一份任务报告。 对于这次测试,GPT-5.6 sol 的结论是:这次测试说明 GLM‑5.3 在ZCode中的“受约束工程执行能力”很强,可评为 A−。 具体来看,GLM‑5.3 首先不只是“写出能运行的代码”,而是理解了任务中的原子性、确定性、异常语义和安全边界;其次,实现方式基本符合常规工程写法,没有明显为了测试而硬编码答案;再者,自我审查质量较高,报告指出的风险与实际代码基本一致;最后,151秒完成5项任务,作为小型离线工程测试,效率不错。不过这不是纯模型推理延迟,还包含文件操作和测试执行时间。 但不能仅凭这次100分就认定它在大型系统工程或真实安全任务中达到前沿闭源模型水平。任务主要是小型、单文件、规格清晰的Python问题,远低于真实大型仓库的复杂度,也没有测试跨语言项目、并发、数据库、前端、编译系统、模糊需求或长上下文等能力。 编程能力提高50%,来自后训练 本次所有性能提升均来自后训练。 GLM-5.3 后训练基础设施主要由三部分组成:用于高效长上下文处理的IndexShare、面向长程任务强化学习的SAO,以及大规模异步训练框架slime。 智谱表示,GLM-5.2阶段已经基本完成相关技术栈建设,因此GLM-5.3的核心工作可以概括为一件事,即继续Scaling post-training。结果显示,即使基础模型保持不变,模型在复杂代码、长程Agent任务以及网络安全等方向仍然出现了明显提升。 在代码能力上,智谱称GLM-5.3在内部智谱 Code Bench上的成绩相比GLM-5.2提高约50%。 值得注意的是,智谱此次重点扩大了一类更接近真实工程工作的训练环境,让任务从“写一段代码”逐步变成“独立承担一项工程工作”。部分训练任务甚至对应一名有经验工程师数天才能完成的工作量。 以机器学习基础设施任务为例,模型可能获得与真实工程师类似的工作环境,包括计算集群、存储系统、内部文档、代码仓库以及实验结果,需要自行诊断整个训练栈中的性能瓶颈、实现优化方案、运行实验,并最终在保证正确性的前提下实现可以量化的端到端性能提升。 这意味着,智谱团队的训练目标已经转向了让“Agent能否从头到尾接管一项复杂任务”。在这种训练方式下,用户不再需要事先把复杂问题拆成大量小步骤,再逐步监督模型执行。 只依靠人工制作少量任务已经难以支撑强化学习继续扩展。为此,智谱建立了一套自动化环境生成流水线:Research Agent从真实工作中收集任务模式,并将其转化为包含多步骤依赖关系和隐藏状态的可执行长程环境;随后由Judge Agent实际尝试任务,判断任务是否真正可解。 与此同时,系统还会在不知道标准答案的情况下自动生成Verifier,用于判断Agent最终是否完成任务。为了降低模型通过奖励漏洞“投机取巧”的风险,训练过程中还会分析Solver轨迹寻找reward shortcut,并持续修补验证规则。智谱表示,这套流程目前仍然需要相当程度的人工参与,进一步提高环境生成和验证环节的自动化程度将是后续重点之一。 关注长程能力,同时减少token消耗 GLM-5.3同时继承了GLM-5.2阶段引入的长程强化学习策略,包括支持上下文压缩的SAO。其目的并不是只让模型在短任务上取得更高分,而是让强化学习带来的能力提升能够保持到更长的Agent执行轨迹中。从公开Benchmark结果来看,这一变化已经同时体现在代码任务和通用Agent任务上。 为了减少公开测试集污染带来的影响,智谱此次还公布了内部测试集智谱 Code Bench。该测试主要模拟真实用户使用Coding Agent时面对的复杂本地开发环境,覆盖多个任务类别,并按照不同推理强度,从端到端任务完成率和细粒度Checklist准确率两个维度进行评价。 支撑长程强化学习训练的核心基础设施之一,是智谱开源的后训练框架 slime。该系统训练侧采用 Megatron、Rollout 侧采用 SGLang,并将训练、Rollout 和数据 Buffer 组织在同一数据流中。数学、代码、Sandbox、Verifier及长程 Agent 环境均可作为数据生成环节接入,无需为新增任务重建训练循环。这为 GLM-5.2 到 GLM-5.3 持续扩展训练环境提供了基础。 GLM-5.3期间
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱