系统极客一直在努力
专注操作系统及软件使用技能

GLM-5.3-Flash:前沿智能,Flash 成本

智普 AI

智谱正式发布了 GLM-5 系列的首款原生多模态模型——GLM-5.3-Flash,模型总参数量 320B,激活参数 18B。推理成本只有 GLM-5.2 的十分之一,各项基准测试和实际工作负载表现都超过后者,代码和 AI Agent 相关基准的成绩已经逼近了 Claude Opus 4.8

相比 GLM-5,GLM-5.3-Flash 在架构上进行了多项升级:

  • 首次引入稀疏注意力与线性注意力结合的混合架构,大幅降低长上下文推理成本的同时,保留了精准的长文本处理能力;
  • 采用流形约束超连接(Manifold-Constrained Hyper-Connections)提升模型扩展效率、优化性能表现;
  • 再配合最新构建的 30T Token 多模态预训练语料,从结构到数据都进行了针对性优化。

GLM-5.3-Flash 就是之前在 OpenCode 和 OpenRouter 平台上以ox-alpha为代号进行测试的模型,用来收集真实用户反馈。而承载这些流量的,全是国产 AI 芯片。

ox-alpha 在 OpenRouter 排名
ox-alpha 在 OpenCode 排名

GLM-5.3-Flash 简介

极致成本下的强悍性能

GLM-5.3-Flash 刷新了 Artificial Analysis Intelligence Index v4.1.1 的帕累托前沿:单次任务(折后)成本仅 0.045 美元,就能拿到 57 分。以往要达到这个智能水平,通常要花近 10 倍的价格,是各类通用工作负载很有竞争力的选择。

Artificial Analysis Intelligence Index v4.1.1

在 6 项代码和 AI Agent 基准测试中,GLM-5.3-Flash 全面优于 GLM-5.2,不少项目优势还很大:DeepSWE v1.1 上 63.4 对 46.2,AutomationBench 上 48.8 对 26.2,整体表现已经很接近 Claude Opus 4.8。

GLM-5.3-Flash 性能评估

这个优势在内部代码评估中也同样成立:在基于 Claude Code 2.1.207 跑的 Z.ai Code Bench v1.0 测试中,GLM-5.3-Flash 在各个算力投入档位下,都明显超过了 GLM-5.2。开到最大算力时几乎追平 Claude Opus 4.8,得分 29.0 对 29.5。

GLM-5.3-Flash 按努力程度划分的编码性能

为极致效率而生的架构

GLM-5.3-Flash 架构

和 GLM-4.5 系列相比,GLM-5.3-Flash 从设计之初就瞄准了超低成本推理。两者总参数量接近(320B 对 355B),但它的激活参数量(18B 对 32B)和网络层数(45 对 92)都减少了近一半。

为了把长上下文场景下的注意力开销压到最低,智谱采用了线性注意力 + 稀疏注意力的混合架构:线性注意力通过状态建模捕捉局部依赖,稀疏注意力靠轻量级索引器检索相关的全局上下文。针对 100 万 Token 上下文下索引器的延迟和内存开销问题,又加入了 IndexPool 技术,通过加权池化把四个索引器键向量压缩成一个。

为了直观展示该套架构的效率,把 GLM-5.3-Flash 和 GLM-5.3 跟近期发布的开源模型 DeepSeek-V4-Flash 和 Kimi-K3 放在一起对比,重点看单 Token 算力开销和 KV Cache 容量。考虑到不同模型参数规模不同,统一计算单层单头的注意力算力消耗、单层平均 KV Cache 大小(BF16 精度),保证对比公平。

和 GLM-5.3 相比,GLM-5.3-Flash 的注意力算力开销降了 3 倍,KV Cache 需求降了 4.4 倍,是所有对比模型中,注意力算力消耗最低的。不过它的 KV Cache 还是略大于 Kimi-K3 和 DeepSeek-V4-Flash,后续还有优化空间。

架构全面升级,加上预训练语料库的优化,让 GLM-5.3-Flash 能用更少的算力跑出更强的性能。下面是 GLM-5.3-Flash 基座模型的评估结果,对比了之前的基座模型和 DeepSeek-V4-Flash-Base。结果显示,GLM-5.3-Flash-Base 整体表现要优于 GLM-4.5-Base,大部分基准测试的成绩和 GLM-5-Base 不相上下。

BenchmarkGLM-4.5-BaseGLM-5-BaseDeepSeek-V4-Flash-BaseGLM-5.3-Flash-Base
Activated Params32B40B13B18B
Total Params355B744B284B320B
MMLU86.188.388.588.1
BBH86.287.484.986.6
HellaSwag87.188.185.387.1
LiveCodeBench-Base28.134.429.937.6
SimpleQA30.036.031.233.5

DeepSeek-V4-Flash-Base 的结果使用智谱内部的评估框架得出,以控制实现细节带来的差异。

编码循环中的视觉智能

视觉编码不只是处理图像,更拓展了代码能触达的边界。在前端开发、游戏制作、3D 仿真这类任务中,最终产出的往往不只是代码,而是用户直接接触的界面、交互甚至整个虚拟世界,很多问题只有到渲染、交互、试玩阶段才会暴露。CUA 把编码能力从可编程系统进一步延伸到可视化、可交互的环境里,模型必须原生具备多模态视觉能力,才能自主判断什么时候该观察,再用视觉反馈指导后续操作。

围绕这个目标,智普专门为视觉编码做了一套数据合成流水线,重点强化模型的视觉自我判断和测试时迭代能力。生成的行为轨迹要求模型必须和环境交互,检查自己的输出再反复优化。针对前端编码场景,团队还探索了基于环境反馈的强化学习机制,并借助真实用户行为流驱动 AI Agent 做验证,进一步增强模型对图形用户界面(GUI)的判断能力。这样验证环节就不再只看功能对不对,而是深入到最终渲染、交互的实际产品体验层面。

代码能让模型构建和修改数字世界,视觉能力则让模型真正进入普通人日常看到、用到的操作环境。

存在布局问题的初始版本
自我视觉验证后

超越代码:你的工作伙伴

代码能力是智能知识工作的重要基础,视觉智能则把这些能力拓展到了更宽的专业任务场景。大部分专业工作都需要解析异构的视觉和结构化信息:文档、表格、演示文稿、数据看板、系统界面和会议纪要等等。

通过对文本、视觉和结构化上下文进行联合推理,视觉智能让模型的能力不再局限在代码场景里。模型可以直接解析和任务相关的工作产物、提取有效信息,不需要用户特意把工作环境转成文本提示词。它还能结合视觉上下文和预期目标评估自己的输出,从而实现更高效的自我验证和迭代,包括对排版质量、美观度的判断。

在国产 AI 芯片上大规模部署

过去一周,智普已经在国产 AI 芯片组成的大规模集群上成功跑起了 GLM-5.3-Flash。集群配备了高带宽互联网络,推理服务栈也针对底层硬件进行了深度优化。

为了解决单卡算力、内存容量相对有限的问题,智普在 SGLang 基础上为这套架构定制了专用推理引擎。整个开发过程靠 GLM-5.3 驱动的基础设施 AI Agent 提速了很多:它帮工程师开发、优化底层 Kernel,诊断性能瓶颈,完善服务栈,形成了一个很有意思的反馈闭环——模型自己参与优化了给它提供算力的底层系统。

国产芯片的短板主要在内存容量和带宽上,支持 100 万 Token 长上下文时这个问题尤其突出,所以智普采用了非常激进的内存优化策略,包括针对底层架构定制的「以计算换带宽」和「以通信换带宽」技术。服务栈里整合了多种方案:线性注意力和 LM 头的节点内张量并行、ReplaySSMW8A8量化、INT8/FP8/BF16混合缓存量化、Layer Split

在集群层面,采用了生产级Encode-Prefill-Decode (EPD)分离架构,把多模态编码、提示词预填充、逐 Token 解码拆成独立调度、可弹性扩展的工作池,在数万张国产加速卡上跑出了高效、稳定的推理服务。

和同一硬件上的初始基准相比,端到端的服务性能提升了 3 倍,硬件效率和单 Token 成本已经能和主流 NVIDIA GPU 媲美。这说明国产芯片完全可以在兼顾效率和成本的前提下,大规模承载前沿模型的推理任务。

使用 GLM-5.3-Flash

  • GLM-5.3-Flash 已经向所有 GLM Coding Plan 用户开放,可用配额是 GLM-5.3 的 3 倍,大家可以前往 Bigmodel 体验。

智谱准备了一批 GLM Coding Plan 的 7 天体验卡,给还没订阅过套餐的用户领取。每天限量放量 10000 张,先到先得

  • GLM-5.3-Flash 的权重已经在 HuggingFace 开源,本地部署目前支持SGLangvLLMTokenSpeed 等推理框架,其他框架的适配还在推进中。
BenchmarkGLM-5.3-FlashGLM-5.2DeepSeek-V4-Vision-ExpOpus 4.8GPT-5.6 TerraGemini 3.7 Flash
Coding
Terminal Bench 2.184.381.083.985.087.485.8
DeepSWEv1.163.446.259.358.069.665.3
NL2Repo56.348.957.769.7
Agentic
Toolathlon Verified78.459.975.976.274.9
AutomationBenchv1.0.648.826.238.841.037.252.3
Agents’ Last Exam26.320.427.327.028.0
HLE w/ Tools55.354.755.157.9
GDPval-AA v2177315041675158215711527
Vision
OfficeQA Pro62.457.948.9
CharXiv Reasoningw/ Tools89.480.489.988.088.7
Chartographyw/ Tools78.064.375.068.065.0
BabyVision53.435.146.861.670.9
MVbench77.869.467.175.082.2
MMVU80.572.767.475.882.3

GLM-5.3-Flash 证明了,前沿智能不一定非要靠极高的算力成本堆出来。这个结果不是某一个单点突破带来的,而是三方面一起迭代的结果:能以更少算力释放更强能力的创新架构、更丰富的多模态预训练语料,以及和推理硬件深度协同设计的基础设施。现在智普正在把这套成熟的经验用到更大参数规模的模型上——GLM-5.3-Flash 把性价比前沿推到了新的位置,过程中积累的经验,也会用在下一代前沿模型的研发里。

赞(0)
分享到

评论 抢沙发