
智谱正式发布了 GLM-5 系列的首款原生多模态模型——GLM-5.3-Flash,模型总参数量 320B,激活参数 18B。推理成本只有 GLM-5.2 的十分之一,各项基准测试和实际工作负载表现都超过后者,代码和 AI Agent 相关基准的成绩已经逼近了 Claude Opus 4.8。
相比 GLM-5,GLM-5.3-Flash 在架构上进行了多项升级:
- 首次引入稀疏注意力与线性注意力结合的混合架构,大幅降低长上下文推理成本的同时,保留了精准的长文本处理能力;
- 采用流形约束超连接(Manifold-Constrained Hyper-Connections)提升模型扩展效率、优化性能表现;
- 再配合最新构建的 30T Token 多模态预训练语料,从结构到数据都进行了针对性优化。
GLM-5.3-Flash 就是之前在 OpenCode 和 OpenRouter 平台上以ox-alpha为代号进行测试的模型,用来收集真实用户反馈。而承载这些流量的,全是国产 AI 芯片。


GLM-5.3-Flash 简介
极致成本下的强悍性能
GLM-5.3-Flash 刷新了 Artificial Analysis Intelligence Index v4.1.1 的帕累托前沿:单次任务(折后)成本仅 0.045 美元,就能拿到 57 分。以往要达到这个智能水平,通常要花近 10 倍的价格,是各类通用工作负载很有竞争力的选择。

在 6 项代码和 AI Agent 基准测试中,GLM-5.3-Flash 全面优于 GLM-5.2,不少项目优势还很大:DeepSWE v1.1 上 63.4 对 46.2,AutomationBench 上 48.8 对 26.2,整体表现已经很接近 Claude Opus 4.8。

这个优势在内部代码评估中也同样成立:在基于 Claude Code 2.1.207 跑的 Z.ai Code Bench v1.0 测试中,GLM-5.3-Flash 在各个算力投入档位下,都明显超过了 GLM-5.2。开到最大算力时几乎追平 Claude Opus 4.8,得分 29.0 对 29.5。

为极致效率而生的架构

和 GLM-4.5 系列相比,GLM-5.3-Flash 从设计之初就瞄准了超低成本推理。两者总参数量接近(320B 对 355B),但它的激活参数量(18B 对 32B)和网络层数(45 对 92)都减少了近一半。
为了把长上下文场景下的注意力开销压到最低,智谱采用了线性注意力 + 稀疏注意力的混合架构:线性注意力通过状态建模捕捉局部依赖,稀疏注意力靠轻量级索引器检索相关的全局上下文。针对 100 万 Token 上下文下索引器的延迟和内存开销问题,又加入了 IndexPool 技术,通过加权池化把四个索引器键向量压缩成一个。
为了直观展示该套架构的效率,把 GLM-5.3-Flash 和 GLM-5.3 跟近期发布的开源模型 DeepSeek-V4-Flash 和 Kimi-K3 放在一起对比,重点看单 Token 算力开销和 KV Cache 容量。考虑到不同模型参数规模不同,统一计算单层单头的注意力算力消耗、单层平均 KV Cache 大小(BF16 精度),保证对比公平。
和 GLM-5.3 相比,GLM-5.3-Flash 的注意力算力开销降了 3 倍,KV Cache 需求降了 4.4 倍,是所有对比模型中,注意力算力消耗最低的。不过它的 KV Cache 还是略大于 Kimi-K3 和 DeepSeek-V4-Flash,后续还有优化空间。
架构全面升级,加上预训练语料库的优化,让 GLM-5.3-Flash 能用更少的算力跑出更强的性能。下面是 GLM-5.3-Flash 基座模型的评估结果,对比了之前的基座模型和 DeepSeek-V4-Flash-Base。结果显示,GLM-5.3-Flash-Base 整体表现要优于 GLM-4.5-Base,大部分基准测试的成绩和 GLM-5-Base 不相上下。
| Benchmark | GLM-4.5-Base | GLM-5-Base | DeepSeek-V4-Flash-Base | GLM-5.3-Flash-Base |
|---|---|---|---|---|
| Activated Params | 32B | 40B | 13B | 18B |
| Total Params | 355B | 744B | 284B | 320B |
| MMLU | 86.1 | 88.3 | 88.5 | 88.1 |
| BBH | 86.2 | 87.4 | 84.9 | 86.6 |
| HellaSwag | 87.1 | 88.1 | 85.3 | 87.1 |
| LiveCodeBench-Base | 28.1 | 34.4 | 29.9 | 37.6 |
| SimpleQA | 30.0 | 36.0 | 31.2 | 33.5 |
DeepSeek-V4-Flash-Base 的结果使用智谱内部的评估框架得出,以控制实现细节带来的差异。
编码循环中的视觉智能
视觉编码不只是处理图像,更拓展了代码能触达的边界。在前端开发、游戏制作、3D 仿真这类任务中,最终产出的往往不只是代码,而是用户直接接触的界面、交互甚至整个虚拟世界,很多问题只有到渲染、交互、试玩阶段才会暴露。CUA 把编码能力从可编程系统进一步延伸到可视化、可交互的环境里,模型必须原生具备多模态视觉能力,才能自主判断什么时候该观察,再用视觉反馈指导后续操作。
围绕这个目标,智普专门为视觉编码做了一套数据合成流水线,重点强化模型的视觉自我判断和测试时迭代能力。生成的行为轨迹要求模型必须和环境交互,检查自己的输出再反复优化。针对前端编码场景,团队还探索了基于环境反馈的强化学习机制,并借助真实用户行为流驱动 AI Agent 做验证,进一步增强模型对图形用户界面(GUI)的判断能力。这样验证环节就不再只看功能对不对,而是深入到最终渲染、交互的实际产品体验层面。
代码能让模型构建和修改数字世界,视觉能力则让模型真正进入普通人日常看到、用到的操作环境。


超越代码:你的工作伙伴
代码能力是智能知识工作的重要基础,视觉智能则把这些能力拓展到了更宽的专业任务场景。大部分专业工作都需要解析异构的视觉和结构化信息:文档、表格、演示文稿、数据看板、系统界面和会议纪要等等。
通过对文本、视觉和结构化上下文进行联合推理,视觉智能让模型的能力不再局限在代码场景里。模型可以直接解析和任务相关的工作产物、提取有效信息,不需要用户特意把工作环境转成文本提示词。它还能结合视觉上下文和预期目标评估自己的输出,从而实现更高效的自我验证和迭代,包括对排版质量、美观度的判断。
在国产 AI 芯片上大规模部署
过去一周,智普已经在国产 AI 芯片组成的大规模集群上成功跑起了 GLM-5.3-Flash。集群配备了高带宽互联网络,推理服务栈也针对底层硬件进行了深度优化。
为了解决单卡算力、内存容量相对有限的问题,智普在 SGLang 基础上为这套架构定制了专用推理引擎。整个开发过程靠 GLM-5.3 驱动的基础设施 AI Agent 提速了很多:它帮工程师开发、优化底层 Kernel,诊断性能瓶颈,完善服务栈,形成了一个很有意思的反馈闭环——模型自己参与优化了给它提供算力的底层系统。
国产芯片的短板主要在内存容量和带宽上,支持 100 万 Token 长上下文时这个问题尤其突出,所以智普采用了非常激进的内存优化策略,包括针对底层架构定制的「以计算换带宽」和「以通信换带宽」技术。服务栈里整合了多种方案:线性注意力和 LM 头的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化、Layer Split。
在集群层面,采用了生产级Encode-Prefill-Decode (EPD)分离架构,把多模态编码、提示词预填充、逐 Token 解码拆成独立调度、可弹性扩展的工作池,在数万张国产加速卡上跑出了高效、稳定的推理服务。
和同一硬件上的初始基准相比,端到端的服务性能提升了 3 倍,硬件效率和单 Token 成本已经能和主流 NVIDIA GPU 媲美。这说明国产芯片完全可以在兼顾效率和成本的前提下,大规模承载前沿模型的推理任务。
使用 GLM-5.3-Flash
- GLM-5.3-Flash 已经向所有 GLM Coding Plan 用户开放,可用配额是 GLM-5.3 的 3 倍,大家可以前往 Bigmodel 体验。
智谱准备了一批 GLM Coding Plan 的 7 天体验卡,给还没订阅过套餐的用户领取。每天限量放量 10000 张,先到先得。
- GLM-5.3-Flash 的权重已经在 HuggingFace 开源,本地部署目前支持
SGLang、vLLM和TokenSpeed等推理框架,其他框架的适配还在推进中。
| Benchmark | GLM-5.3-Flash | GLM-5.2 | DeepSeek-V4-Vision-Exp | Opus 4.8 | GPT-5.6 Terra | Gemini 3.7 Flash |
|---|---|---|---|---|---|---|
| Coding | ||||||
| Terminal Bench 2.1 | 84.3 | 81.0 | 83.9 | 85.0 | 87.4 | 85.8 |
| DeepSWEv1.1 | 63.4 | 46.2 | 59.3 | 58.0 | 69.6 | 65.3 |
| NL2Repo | 56.3 | 48.9 | 57.7 | 69.7 | – | – |
| Agentic | ||||||
| Toolathlon Verified | 78.4 | 59.9 | 75.9 | 76.2 | 74.9 | – |
| AutomationBenchv1.0.6 | 48.8 | 26.2 | 38.8 | 41.0 | 37.2 | 52.3 |
| Agents’ Last Exam | 26.3 | 20.4 | 27.3 | 27.0 | 28.0 | – |
| HLE w/ Tools | 55.3 | 54.7 | 55.1 | 57.9 | – | – |
| GDPval-AA v2 | 1773 | 1504 | 1675 | 1582 | 1571 | 1527 |
| Vision | ||||||
| OfficeQA Pro | 62.4 | – | 57.9 | 48.9 | – | – |
| CharXiv Reasoningw/ Tools | 89.4 | – | 80.4 | 89.9 | 88.0 | 88.7 |
| Chartographyw/ Tools | 78.0 | – | 64.3 | 75.0 | 68.0 | 65.0 |
| BabyVision | 53.4 | – | 35.1 | 46.8 | 61.6 | 70.9 |
| MVbench | 77.8 | – | 69.4 | 67.1 | 75.0 | 82.2 |
| MMVU | 80.5 | – | 72.7 | 67.4 | 75.8 | 82.3 |
GLM-5.3-Flash 证明了,前沿智能不一定非要靠极高的算力成本堆出来。这个结果不是某一个单点突破带来的,而是三方面一起迭代的结果:能以更少算力释放更强能力的创新架构、更丰富的多模态预训练语料,以及和推理硬件深度协同设计的基础设施。现在智普正在把这套成熟的经验用到更大参数规模的模型上——GLM-5.3-Flash 把性价比前沿推到了新的位置,过程中积累的经验,也会用在下一代前沿模型的研发里。








最新评论
有多亮,是blingbling的吗🤣
这个网站眼前一亮
不要装,千万不要装,无法自定义鼠标指针,主题和壁纸需要重新设置,但是鼠标指针完全被像素版大白指针替代,无法更改。
鼠标指针也没了qwq