
GLM-5.3 的所有提升都来自后训练扩展。GLM-5.2 版本已经搭好整套工程栈:面向长上下文处理的 IndexShare、服务长程任务强化学习的 SAO、支撑大规模异步训练的 slime,底层跑在持续积累的长程任务环境上。过去一个月,智普在这套技术栈上继续做扩展:增加环境数量、丰富任务类型,同时投入更多训练算力。
GLM-5.3 与 GLM-5.2 使用相同的基座模型,所有性能增益都来自后训练。相比 GLM-5.2,新版本在复杂编程和长程任务上的表现提升明显:
- 代码能力提升:GLM-5.3 在开源权重模型中表现突出,内部 Z.ai Code Bench 上相比 GLM-5.2 提升了 50%,同时在 Terminal-Bench 3.0、Agents’ Last Exam 等公开评测中拿到开源模型最优成绩。
- 安全能力涌现:随着后训练规模扩大,模型的网络安全能力增长超出预期。GLM-5.3 在 CyberGym 漏洞挖掘评测中拿到最高分,利用链越靠后的环节提升越明显,漏洞利用基准得分相比 GLM-5.2 提升了一倍以上。
- 开源计划:在完成安全评估与加固后,模型权重将在发布两周后开源。

| Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4Pro-0813 | Qwen3.8-Max | Opus 4.8 | Fable 5(w/ fallback) | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| Coding | ||||||||
| Terminal Bench 2.1 | 88.2 | 81.0 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
| Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | – | – | 21.1 | 33.7 | 34.6 |
| DeepSWEv1.1 | 66.9 | 46.2 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 48.9 | 58.0 | 61.1 | 55.9 | 69.7 | – | – |
| ProgramBenchAlmost Solved | 19.0 | 9.5 | 17.5 | – | 10.5 | 15.5 | 33.0 | 23.0 |
| FrontierSWE | 78.1 | 67.5 | – | – | – | 66.5 | 88.2 | – |
| SWE-Marathonv1.1 | 42.5 | 19.4 | 48.1 | – | – | 48.8 | 33.1 | 42.5 |
| PostTrainBench | 39.8 | 31.7 | 32.0 | – | – | 32.9 | 41.8 | 36.2 |
| Cyber | ||||||||
| CyberGym | 84.5 | 77.2 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
| ExploitGym2h / 6h | 105 / 130 | 29 / 39 | 36 / 70 | – | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench | 54.4 | 24.4 | 32.2 | – | 28.8 | 40.0 | 78.0 | 76.5 |
| Agentic | ||||||||
| Toolathlon Verified | 73.0 | 59.9 | 76.5 | 74.1 | 72.5 | 76.2 | 74.7 | 74.9 |
| AutomationBenchv1.0.6 | 48.2 | 26.2 | 46.7 | 43.2 | 39.8 | 41.0 | 46.2 | 45.8 |
| Agents’ Last ExamALE-CLI | 28.5 | 23.8 | 27.6 | 25.7 | 27.0 | 25.7 | 23.8 | 28.6 |
| HLE w/ Tools | 62.5 | 54.7 | 59.8 | 60.0 | 56.2 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
复杂编程能力提升
GLM-5.3 的环境扩展目标,已经从简单编程题转向更贴近真实专家工作单元的场景。目前的环境覆盖了更广泛的生产研发工作流,任务设计围绕工程与科研的实际开展方式搭建,部分任务的工作量相当于资深工程师数天的投入。比如在机器学习基础设施(ML Infra)任务中,模型会拿到和工程师完全一致的工作环境,可以直接访问计算集群、存储系统、内部文档、代码库和实验结果,需要诊断整个训练链路的性能瓶颈、完成代码优化、运行实验,在保证正确性的前提下给出可量化的端到端加速结果。这类环境训练出来的模型,可以端到端扛下复杂工作,不用用户把问题拆得很碎、每一步都手动干预。
随着智能体能力提升,后训练扩展的难点已经从模型侧转到了环境构建侧。有效的任务环境必须同时满足可执行、可验证、贴近真实专业工作三个条件,还要支持大规模自动化生成,仅靠人工搭建完全无法支撑规模化需求。为了跑起量,智普团队搭建了端到端合成环境的流水线,还针对部分任务同步合成强化学习的奖励信号:研究型智能体从真实工作流中提取任务模式,转化为包含多步依赖和隐状态的可运行长程环境;再由裁判智能体尝试解题,验证任务确实可解。验证器全程不接触参考答案,同时会利用解题轨迹排查、封堵奖励作弊路径(Reward Shortcut)。只有通过标准解验证(Oracle)、空操作验证(No-op)、未求解状态检查三项校验的验证器,才能生成足够可靠的二值奖励,直接用于强化学习训练。
模型沿用了 GLM-5.2 引入的强化学习策略,包括带压缩机制的 SAO,让训练收益能落到长程任务上,不会只在短任务上起效。这一优化在编程与通用智能体任务上都有体现:GLM-5.3 在 Terminal-Bench 3.0 上的得分从 4.6 提升至 28.3,DeepSWE v1.1 从 46.2 提升至 66.9,Agents’ Last Exam 从 23.8 提升至 28.5。这套流水线目前还需要少量人工介入,后续重点方向之一就是进一步提升环境生成和验证的自动化程度。
除公开评测集外,团队还搭建了内部基准 Z.ai Code Bench,专门评估编程智能体在真实用户场景下的表现。这个基准覆盖多类任务,把智能体直接放进复杂的本地开发环境中,在不同思考强度下,从「端到端任务完成率」和「细粒度检查清单准确率」两个维度打分。作为内部评测集,它能降低公开测试集污染的风险,结果更贴近实际使用体验。

从评测结果看,GLM-5.3 在性能和 token 效率上都有提升。各个思考强度档位下,它的智能体编程表现都优于 GLM-5.2,消耗的输出 token 反而更少。Max档位下,GLM-5.3 单任务平均消耗约 75K 输出 token,完成率 34.5%;GLM-5.2 要消耗 96K token,完成率只有 23.4%。和闭源模型比,效率优势同样明显:High档位下 GLM-5.3 消耗约 50K 输出 token 拿到 31.4% 的完成率,超过了消耗 120K token、完成率 29.5% 的 Claude Opus 4.8;目前和 Claude Fable 5 还有差距,后者 Max 档位完成率为 39.5%。
涌现网络安全能力
后训练阶段,团队把漏洞挖掘数据和对应环境加进了训练配方,原本只是想提升模型的漏洞发现和推理能力,结果随着训练规模扩大,这项能力的增长速度远超预期。GLM-5.3 不止能识别单个漏洞点,还具备跨多阶段的漏洞利用推理能力,可以为完整利用链规划合理的执行路径。

智普团队在覆盖漏洞分析与利用不同阶段的三个基准上评估了 GLM-5.3:
- 在基于白盒源码、测试模型能否通过触发故障定位并验证漏洞的 CyberGym 上,GLM-5.3 得分 84.5%(GLM-5.2 为 77.2%),领先 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。
- 在需要对真实漏洞及其利用做深度推理的 ExploitBench 上,GLM-5.3 得分 54.4%,相比 GLM-5.2 的 24.4% 提升一倍以上,Mythos 5 和 GPT-5.6 Sol 的得分分别为 78.0% 和 76.5%。
- 在按时间归一化预算衡量任务完成数量的 ExploitGym 上,GLM-5.3 2 小时完成 105 个任务,6 小时完成 130 个任务,GLM-5.2 同期分别为 29 个和 39 个,Mythos 5 则为 181 个和 247 个。时间预算根据各模型的吞吐数据做了归一化,详见文末注释。
三个基准的结果趋势一致:评测覆盖的利用链环节越靠后,GLM-5.3 相对 GLM-5.2 的增益越大,和头部闭源模型的差距也越明显。
除了标准化基准,我们还验证了这些能力在真实场景下的迁移效果。从 GLM-5.2 开始,我们就和国内多家安全团队合作,把模型用在真实代码库审计上。经过专家评审、筛选、去重,模型在 269 个项目里共发现 2436 个漏洞,其中 1097 个是中高危,覆盖系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用、网络协议等多个领域。不少漏洞已经潜伏了数年甚至数十年,最久的可以追溯到约 40 年前。
目前这项工作已经转入常态化漏洞披露流程,团队搭建了 Z.ai Security Disclosure Ledger,公开记录正在披露流程中的漏洞。新漏洞通过审核、进入披露流程后,记录会持续更新,区分已公开和披露中两类状态。已公开漏洞的记录会包含受影响项目、严重程度、CVE 编号(若已分配)以及漏洞在代码库中潜伏的时长。
slime:专为长程强化学习扩展设计的后训练框架
前面提到的所有训练都跑在开源后训练强化学习框架 slime 上,训练侧用 Megatron,采样推演(rollout)侧用 SGLang。slime 的设计把训练、采样、数据缓冲区统一到了单条数据流里,数学题、代码、沙箱、验证器、各类长程智能体环境都可以作为数据生成模块直接接入,不用修改训练主循环。所以从 GLM-5.2 到 GLM-5.3 的迭代过程中,团队可以持续加新环境,不用每次都重构训练栈。
GLM-5.3 研发期间,slime 主要在两个方向做了演进:
- 算法侧,新增了面向强化学习研究的能力支持,包括 top-p 掩码、top-k 与全词表 OPD(在线策略蒸馏,On-Policy Distillation),还加了一系列改善训练与采样一致性的配置,包括 R3 风格设置、训练采样路径全数值对齐。这些能力让采样、训练、教师信号的控制粒度更细,也方便快速跑对照实验。在训练与采样一致性评测中,对数概率(logprob)的平均差异控制在 1e-7 量级,比早期配置降低了 99.99% 以上。
- 系统侧,重点优化了大规模强化学习的资源利用率和系统吞吐。我们把本地存储作为额外缓存层,对原本常驻主机内存的模型状态和数据做分层管理,这在多教师 OPD 场景下作用尤其明显:通过训练侧的动态教师切换和预取,不需要为每个教师模型常驻独立的推理服务,额外开销很小,同时降低了资源占用。
针对智能体和异步负载,我们优化了 Router 与 slime 的联合调度和负载均衡,让不同长度、不同完成时间的采样请求能更充分地利用推理资源;同时引入负载感知的启发式策略,根据各采样环境的特征动态推导偏向吞吐的配置参数,比如 Prefill/Decode 资源配比、并发设置等。在长程代码强化学习任务中,这一系列系统优化把端到端强化学习训练吞吐提升了 2.3 倍以上,支撑了更长轨迹、更复杂环境下的训练扩展。
开始使用 GLM-5.3
GLM-5.3 API 变更
GLM-5.3 支持三种思考强度档位:low、high 和 max,不再支持关闭思考模式。
| 参数 | 值 | 默认 | 描述 |
|---|---|---|---|
thinking.type | enabled | enabled | Enables thinking. disabled is no longer supported. |
reasoning_effort | low, high, max | max | low: light; high: enhanced; max: deep. |
思考参数配置
代码任务建议使用max档位:
{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}
如果现有应用配置为thinking.type: "disabled",升级到glm-5.3之前请先把它改成enabled,同时把reasoning_effort设为low,否则请求会报错。
在 GLM Coding Plan 与 ZCode 中使用
- 你可以在常用的编程智能体工具中体验 GLM-5.3,包括 ZCode、Claude Code、OpenCode 等,具体接入方式见开发文档:https://docs.z.ai/devpack/overview
- GLM-5.3 已经全量推送给所有 GLM Coding Plan 订阅用户。新版订阅采用积分额度制,输入、缓存输入、输出 token 分别计费,非高峰时段调用享受 5 折积分优惠。高峰时段为周一至周五 14:00–18:00(UTC+8),其余时间和周末都是非高峰期。订阅入口:https://z.ai/subscribe
- 配合 ZCode 使用 GLM-5.3
- 98% 以上缓存命中率,重复上下文按更低的缓存费率计费,实际可用 token 提升约 30%。
- 限时 1.5 倍额度,叠加缓存优惠后,8 月 31 日前最高可达标准额度的 180%。
- 长程任务处理,Goal 模式下支持持续规划、编写、测试、验证,直到达成目标。
- 移动端远程控制,支持通过微信或飞书在手机端监控、干预长时间运行的任务。
ZCode 体验入口:https://zcode.z.ai
本地部署
GLM-5.3 的模型权重将在发布两周后正式开源。








最新评论
鼠标指针也没了qwq
我删除的时候文件损坏了,还得重新安装再删掉。。。。。
禁用容易,稳定不禁用难。
有吗?我现在主要用 Brave,Edge 基本不用了,没发觉……