系统极客一直在努力
专注操作系统及软件使用技能

GLM-5.3:复杂编程和漏洞挖掘能力提升

智普 AI

GLM-5.3 的所有提升都来自后训练扩展。GLM-5.2 版本已经搭好整套工程栈:面向长上下文处理的 IndexShare、服务长程任务强化学习的 SAO、支撑大规模异步训练的 slime,底层跑在持续积累的长程任务环境上。过去一个月,智普在这套技术栈上继续做扩展:增加环境数量、丰富任务类型,同时投入更多训练算力。

GLM-5.3 与 GLM-5.2 使用相同的基座模型,所有性能增益都来自后训练。相比 GLM-5.2,新版本在复杂编程和长程任务上的表现提升明显:

  • 代码能力提升:GLM-5.3 在开源权重模型中表现突出,内部 Z.ai Code Bench 上相比 GLM-5.2 提升了 50%,同时在 Terminal-Bench 3.0、Agents’ Last Exam 等公开评测中拿到开源模型最优成绩。
  • 安全能力涌现:随着后训练规模扩大,模型的网络安全能力增长超出预期。GLM-5.3 在 CyberGym 漏洞挖掘评测中拿到最高分,利用链越靠后的环节提升越明显,漏洞利用基准得分相比 GLM-5.2 提升了一倍以上。
  • 开源计划:在完成安全评估与加固后,模型权重将在发布两周后开源。
GLM-5.3 性能评估
BenchmarkGLM-5.3GLM-5.2Kimi K3DeepSeek-V4Pro-0813Qwen3.8-MaxOpus 4.8Fable 5(w/ fallback)GPT-5.6 Sol
Coding
Terminal Bench 2.188.281.088.387.986.685.088.088.8
Terminal Bench 3.028.34.617.421.133.734.6
DeepSWEv1.166.946.267.562.756.658.069.772.7
NL2Repo58.048.958.061.155.969.7
ProgramBenchAlmost Solved19.09.517.510.515.533.023.0
FrontierSWE78.167.566.588.2
SWE-Marathonv1.142.519.448.148.833.142.5
PostTrainBench39.831.732.032.941.836.2
Cyber
CyberGym84.577.280.083.378.578.183.883.6
ExploitGym2h / 6h105 / 13029 / 3936 / 7014 / 2680 / 120181 / 247216 / 293
ExploitBench54.424.432.228.840.078.076.5
Agentic
Toolathlon Verified73.059.976.574.172.576.274.774.9
AutomationBenchv1.0.648.226.246.743.239.841.046.245.8
Agents’ Last ExamALE-CLI28.523.827.625.727.025.723.828.6
HLE w/ Tools62.554.759.860.056.257.963.964.5
GDPval-AA v217691508168215901739158817431730

复杂编程能力提升

GLM-5.3 的环境扩展目标,已经从简单编程题转向更贴近真实专家工作单元的场景。目前的环境覆盖了更广泛的生产研发工作流,任务设计围绕工程与科研的实际开展方式搭建,部分任务的工作量相当于资深工程师数天的投入。比如在机器学习基础设施(ML Infra)任务中,模型会拿到和工程师完全一致的工作环境,可以直接访问计算集群、存储系统、内部文档、代码库和实验结果,需要诊断整个训练链路的性能瓶颈、完成代码优化、运行实验,在保证正确性的前提下给出可量化的端到端加速结果。这类环境训练出来的模型,可以端到端扛下复杂工作,不用用户把问题拆得很碎、每一步都手动干预。

随着智能体能力提升,后训练扩展的难点已经从模型侧转到了环境构建侧。有效的任务环境必须同时满足可执行、可验证、贴近真实专业工作三个条件,还要支持大规模自动化生成,仅靠人工搭建完全无法支撑规模化需求。为了跑起量,智普团队搭建了端到端合成环境的流水线,还针对部分任务同步合成强化学习的奖励信号:研究型智能体从真实工作流中提取任务模式,转化为包含多步依赖和隐状态的可运行长程环境;再由裁判智能体尝试解题,验证任务确实可解。验证器全程不接触参考答案,同时会利用解题轨迹排查、封堵奖励作弊路径(Reward Shortcut)。只有通过标准解验证(Oracle)、空操作验证(No-op)、未求解状态检查三项校验的验证器,才能生成足够可靠的二值奖励,直接用于强化学习训练。

模型沿用了 GLM-5.2 引入的强化学习策略,包括带压缩机制的 SAO,让训练收益能落到长程任务上,不会只在短任务上起效。这一优化在编程与通用智能体任务上都有体现:GLM-5.3 在 Terminal-Bench 3.0 上的得分从 4.6 提升至 28.3,DeepSWE v1.1 从 46.2 提升至 66.9,Agents’ Last Exam 从 23.8 提升至 28.5。这套流水线目前还需要少量人工介入,后续重点方向之一就是进一步提升环境生成和验证的自动化程度。

除公开评测集外,团队还搭建了内部基准 Z.ai Code Bench,专门评估编程智能体在真实用户场景下的表现。这个基准覆盖多类任务,把智能体直接放进复杂的本地开发环境中,在不同思考强度下,从「端到端任务完成率」和「细粒度检查清单准确率」两个维度打分。作为内部评测集,它能降低公开测试集污染的风险,结果更贴近实际使用体验。

GLM-5.3 按努力程度划分的智能编码性能

从评测结果看,GLM-5.3 在性能和 token 效率上都有提升。各个思考强度档位下,它的智能体编程表现都优于 GLM-5.2,消耗的输出 token 反而更少。Max档位下,GLM-5.3 单任务平均消耗约 75K 输出 token,完成率 34.5%;GLM-5.2 要消耗 96K token,完成率只有 23.4%。和闭源模型比,效率优势同样明显:High档位下 GLM-5.3 消耗约 50K 输出 token 拿到 31.4% 的完成率,超过了消耗 120K token、完成率 29.5% 的 Claude Opus 4.8;目前和 Claude Fable 5 还有差距,后者 Max 档位完成率为 39.5%。

涌现网络安全能力

后训练阶段,团队把漏洞挖掘数据和对应环境加进了训练配方,原本只是想提升模型的漏洞发现和推理能力,结果随着训练规模扩大,这项能力的增长速度远超预期。GLM-5.3 不止能识别单个漏洞点,还具备跨多阶段的漏洞利用推理能力,可以为完整利用链规划合理的执行路径。

GLM-5.3 网络安全评估

智普团队在覆盖漏洞分析与利用不同阶段的三个基准上评估了 GLM-5.3:

  • 在基于白盒源码、测试模型能否通过触发故障定位并验证漏洞的 CyberGym 上,GLM-5.3 得分 84.5%(GLM-5.2 为 77.2%),领先 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。
  • 在需要对真实漏洞及其利用做深度推理的 ExploitBench 上,GLM-5.3 得分 54.4%,相比 GLM-5.2 的 24.4% 提升一倍以上,Mythos 5 和 GPT-5.6 Sol 的得分分别为 78.0% 和 76.5%。
  • 在按时间归一化预算衡量任务完成数量的 ExploitGym 上,GLM-5.3 2 小时完成 105 个任务,6 小时完成 130 个任务,GLM-5.2 同期分别为 29 个和 39 个,Mythos 5 则为 181 个和 247 个。时间预算根据各模型的吞吐数据做了归一化,详见文末注释。

三个基准的结果趋势一致:评测覆盖的利用链环节越靠后,GLM-5.3 相对 GLM-5.2 的增益越大,和头部闭源模型的差距也越明显。

除了标准化基准,我们还验证了这些能力在真实场景下的迁移效果。从 GLM-5.2 开始,我们就和国内多家安全团队合作,把模型用在真实代码库审计上。经过专家评审、筛选、去重,模型在 269 个项目里共发现 2436 个漏洞,其中 1097 个是中高危,覆盖系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用、网络协议等多个领域。不少漏洞已经潜伏了数年甚至数十年,最久的可以追溯到约 40 年前。

目前这项工作已经转入常态化漏洞披露流程,团队搭建了 Z.ai Security Disclosure Ledger,公开记录正在披露流程中的漏洞。新漏洞通过审核、进入披露流程后,记录会持续更新,区分已公开和披露中两类状态。已公开漏洞的记录会包含受影响项目、严重程度、CVE 编号(若已分配)以及漏洞在代码库中潜伏的时长。

slime:专为长程强化学习扩展设计的后训练框架

前面提到的所有训练都跑在开源后训练强化学习框架 slime 上,训练侧用 Megatron,采样推演(rollout)侧用 SGLang。slime 的设计把训练、采样、数据缓冲区统一到了单条数据流里,数学题、代码、沙箱、验证器、各类长程智能体环境都可以作为数据生成模块直接接入,不用修改训练主循环。所以从 GLM-5.2 到 GLM-5.3 的迭代过程中,团队可以持续加新环境,不用每次都重构训练栈。

GLM-5.3 研发期间,slime 主要在两个方向做了演进:

  • 算法侧,新增了面向强化学习研究的能力支持,包括 top-p 掩码、top-k 与全词表 OPD(在线策略蒸馏,On-Policy Distillation),还加了一系列改善训练与采样一致性的配置,包括 R3 风格设置、训练采样路径全数值对齐。这些能力让采样、训练、教师信号的控制粒度更细,也方便快速跑对照实验。在训练与采样一致性评测中,对数概率(logprob)的平均差异控制在 1e-7 量级,比早期配置降低了 99.99% 以上。
  • 系统侧,重点优化了大规模强化学习的资源利用率和系统吞吐。我们把本地存储作为额外缓存层,对原本常驻主机内存的模型状态和数据做分层管理,这在多教师 OPD 场景下作用尤其明显:通过训练侧的动态教师切换和预取,不需要为每个教师模型常驻独立的推理服务,额外开销很小,同时降低了资源占用。

针对智能体和异步负载,我们优化了 Router 与 slime 的联合调度和负载均衡,让不同长度、不同完成时间的采样请求能更充分地利用推理资源;同时引入负载感知的启发式策略,根据各采样环境的特征动态推导偏向吞吐的配置参数,比如 Prefill/Decode 资源配比、并发设置等。在长程代码强化学习任务中,这一系列系统优化把端到端强化学习训练吞吐提升了 2.3 倍以上,支撑了更长轨迹、更复杂环境下的训练扩展。

开始使用 GLM-5.3

GLM-5.3 API 变更

GLM-5.3 支持三种思考强度档位:lowhigh 和 max,不再支持关闭思考模式。

参数默认描述
thinking.typeenabledenabledEnables thinking. disabled is no longer supported.
reasoning_effortlowhighmaxmaxlow: light; high: enhanced; max: deep.

思考参数配置

代码任务建议使用max档位:

{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

如果现有应用配置为thinking.type: "disabled",升级到glm-5.3之前请先把它改成enabled,同时把reasoning_effort设为low,否则请求会报错。

在 GLM Coding Plan 与 ZCode 中使用

  • 你可以在常用的编程智能体工具中体验 GLM-5.3,包括 ZCode、Claude Code、OpenCode 等,具体接入方式见开发文档:https://docs.z.ai/devpack/overview
  • GLM-5.3 已经全量推送给所有 GLM Coding Plan 订阅用户。新版订阅采用积分额度制,输入、缓存输入、输出 token 分别计费,非高峰时段调用享受 5 折积分优惠。高峰时段为周一至周五 14:00–18:00(UTC+8),其余时间和周末都是非高峰期。订阅入口:https://z.ai/subscribe
  • 配合 ZCode 使用 GLM-5.3
    • 98% 以上缓存命中率,重复上下文按更低的缓存费率计费,实际可用 token 提升约 30%。
    • 限时 1.5 倍额度,叠加缓存优惠后,8 月 31 日前最高可达标准额度的 180%。
    • 长程任务处理,Goal 模式下支持持续规划、编写、测试、验证,直到达成目标。
    • 移动端远程控制,支持通过微信或飞书在手机端监控、干预长时间运行的任务。

ZCode 体验入口:https://zcode.z.ai

本地部署

GLM-5.3 的模型权重将在发布两周后正式开源。

赞(0)
分享到

评论 抢沙发