
从 Gemma 4 发布开始,Google 就一直在迭代其能力:先是引入了多 Token 预测解码技术来加速推理,随后又推出了 12B 无编码器多模态版本,来填补 E4B 和 26B MoE 模型之间的空白。
现在,又搞出来个 QAT(量化感知训练)优化权重,进一步拉满了 Gemma 4 的运行效率,让普通边缘设备、消费级 GPU 能够更轻松地跑动本地大模型。
Gemma 4 QAT 模型
本次发布的权重包含两类:一类是适配主流Q4_0格式的 QAT 权重,另一类是专门为移动端设计的全新量化格式(后面细说)。
- 和传统压缩方案不同,QAT 会在训练阶段就模拟量化过程,最大程度降低压缩带来的精度损失。
- 搭配新的移动端量化格式,Gemma 4 E2B 模型的显存占用直接压低到了 1GB。
两项优化同时落地,既大幅拉低了运行内存门槛,还完整保留了 Gemma 4 原本的能力和输出质量。
在缩减体积的同时保持模型质量
要在消费级硬件上流畅跑本地大模型,量化技术是关键:它既能大幅降低显存占用,也能切实提升解码速度。但传统的训练后量化(PTQ)往往会带来明显的精度衰减。
和训练完成后才做量化的 PTQ 不同,QAT 直接把量化逻辑嵌入到了训练流程里。就算 PTQ 的保真度已经做得不错,但根据 Google 的实测数据显示,QAT 的整体模型质量还是要比 PTQ 基准更高。
为了让全系 Gemma 4 模型都能吃到这波优化红利,Google 把 QAT 方案适配到了最通用的Q4_0格式;针对 E2B、E4B 这类端侧模型,则重新评估了量化策略,专门设计了一套移动端的专属量化机制。
大幅节省显存与存储空间
加载不同模型所需的预估显存(VRAM)消耗见下表:

深入底层:针对移动设备的专属优化
移动端处理器往往很难高效处理标准的压缩格式。为了让 Gemma 4 能在手机上流畅运行,Google 专门为边缘硬件设计了定制化的移动端量化架构,主要做了 4 点优化:
- 静态激活:模型运行时本来要消耗大量算力,来实时计算数据缩放系数。那就干脆在训练阶段就预计算好这些参数,来减轻移动芯片的长期计算负载,让响应速度加快。
- 逐通道量化:根据移动端加速器的架构特点,重新调整了压缩数据的底层组织结构,让手机等移动设备可以原生直接执行计算,不用再靠低效的兼容方案来过渡。
- 定向 2-bit 量化:对模型中负责生成 Token 的特定区域做极限压缩(最低到 2-bit),但核心推理部分仍然保留高精度。这样既能省下存储空间,还不会削弱模型的逻辑能力。
- Embedding 与 KV cache 优化:把压缩重点放在词汇表和 KV 缓存上,大幅降低模型运行时的动态内存占用,哪怕是超长对话也不容易爆显存。
由于不是所有场景都需要音频、视觉处理能力,你完全可以根据需要,只部署所需模态,进一步降低硬件开销。比如,只部署纯文本的 Gemma 4 E2B 模型(无逐层嵌入),实际内存占用还不到 1GB。
使用 Gemma 4 QAT 模型
目前 Q4_0 和 mobile 版本的权重已经可以在 Hugging Face 下载,llama.cpp、Ollama、LM Studio 等常用工具都可以运行 Gemma 4 QAT 模型。
















最新评论
为什么关机关电源后,开机时打开电源就开机了。对电脑有损伤吗?
有多亮,是blingbling的吗🤣
这个网站眼前一亮
不要装,千万不要装,无法自定义鼠标指针,主题和壁纸需要重新设置,但是鼠标指针完全被像素版大白指针替代,无法更改。