
Gemma 4 正式发布,全面采用 Apache 2.0 协议。它专为高阶逻辑推理与 AI 智能体工作流而生,实现了破纪录的「参数智能比」,是 Google 迄今为止能力最强的开源大语言模型家族。
自初代 Gemma 发布以来,全网、全系列累计下载量已超 4 亿次,并衍生出了超 10 万+ 的 Gemmaverse 庞大生态。

依托与 Gemini 3 同源的世界级前沿架构,Gemma 4 是目前能部署在「自有硬件」上的最强模型系列之一。它和 Google 闭源的 Gemini 产品线形成完美互补,为业界带来了「最强开源 + 顶尖闭源」的终极组合。
业界领先的技术指标与「移动优先」战略
本次 Gemma 4 矩阵一共提供了 4 种针对性极强的参数规格,彻底跳脱出了基础对话聊天的范畴,可从容应对复杂的业务逻辑流:
| 模型版本 | 核心定位 | 下载链接 |
|---|---|---|
| E2B(Effective 2B) | 移动端与边缘计算首选 | 获取 E2B 权重 |
| E4B(Effective 4B) | 高性能端侧 AI 推理 | 获取 E4B 权重 |
| 26B MoE | 极速响应与复杂推理 | 获取 26B 权重 |
| 31B Dense | 追求极限质量的微调基座 | 获取 31B 权重 |
- 目前,31B 稠密模型在业界权威的 Arena AI 文本排行榜上,位居全球开源模型第 3,26B MoE 模型则稳居第 6 位,轻松击败了体积是它 20 倍的大参数量模型。开发者只需极低的硬件开销,就能触达前沿大语言模型的性能边界。
- E2B 和 E4B 模型彻底重塑了端侧 AI 的可用性。它们不再盲目堆砌参数,而是将多模态能力、极低延迟、无缝设备生态集成,放在了首位。
强大、易用且完全开放
为了给下一代前沿研究与产品创新提供核心基石,Google 针对海量硬件做了全栈微调与尺寸优化。
- 优化范围覆盖 Android 手机、家用笔记本显卡,一直到顶配的开发者工作站与加速器集群。
- 依托这些深度优化的模型基座,你可以通过微调(fine-tuning),让 Gemma 4 在垂直领域实现更出彩的表现。
以下是 Gemma 4 六大核心能力的关键演进:
- 高阶逻辑推理:具备多步骤任务规划与深层逻辑推演能力,在复杂数学运算、指令遵循类基准测试中,实现了跨越式的性能提升。
- 原生 AI 智能体工作流:原生集成函数调用(Function Calling)、结构化 JSON 输出与底层系统指令设定。你可以轻松搭建高可靠性的自动化智能体,实现与各类外部 API 的无缝交互。
- 离线代码生成:可以输出高质量的系统级本地代码,能快速把你的工作站变成全离线本地 AI 编程助手。
- 原生多模态视觉与音频:全系模型均支持视频与图像解析,适配动态分辨率,精通 OCR 文本提取与复杂图表分析。其中,E2B 和 E4B 还额外搭载了原生音频输入接口,可以实现精准的语音识别与语义理解。
- 超长上下文吞吐:可以轻松处理超长文本内容。端侧模型配备 128K 上下文窗口,大模型版本更是提升至 256K,你可以在单个提示词(prompt)中,直接塞入完整代码仓库或长篇技术白皮书。
- 海量多语言支持:基于超 140+ 种语言完成原生预训练,能助力全球开发者,打造真正无国界、高性能的普惠级 AI 应用。
面向多元硬件的极致优化
针对不同硬件架构与业务场景,Google 对 Gemma 4 的权重尺寸做了精细化裁剪,让前沿 AI 算力触手可及。
26B 与 31B:个人电脑上的前沿智能
- 未量化的 bfloat16 权重组合经过专项优化,可以完整运行在单张 80GB NVIDIA H100 GPU 上。针对桌面级用户,量化版本可以原生运行在消费级显卡上,流畅驱动 IDE、代码助手与各类 AI 智能体工作流。
- 其中,26B MoE 混合专家架构是专门为超低延迟打造的性能怪兽。它在每次推理中仅激活 3.8B 有效参数,就能实现极高的 Token 生成速率;31B Dense 稠密架构则将文本与图像生成质量推向极致,是深度微调的理想基座。

E2B 与 E4B:重塑移动端与 IoT 设备的 AI 体验
- 在推理阶段,它们只需加载 2B 和 4B 有效参数,能最大程度节省移动设备的 RAM 空间与电池续航,是 Google 为极限算力与内存瓶颈给出的解决方案。
- 经过与 Google Pixel 研发团队,以及高通、联发科等移动芯片厂商的深度联合优化,这些多模态模型现已能在手机、Raspberry Pi、NVIDIA Jetson Orin Nano 等边缘设备上,实现近乎零延迟的全本地运行。
采用 Apache 2.0 开源协议
Goolgle 表示:AI 的未来,必须建立在协同共创的基础之上。唯有打破壁垒,才能让开发者生态真正繁荣。这也是 Gemma 4 采用商业上极度宽容的 Apache 2.0 协议的核心原因。
你可以对自有数据、底层基础设施与模型拥有 100% 的掌控权。无论是在高度机密的本地机房(On-premises),还是在公有云环境中,都能自由编码、安全部署,为开发者的灵活性与数字主权铺平了道路。
强烈推荐大家快去围观 Unsloth 发布的 Gemma 4 本地部署指南。
常见问题解答
Q:为什么 Gemma 4 要更改成 Apache 2.0 开源协议?
A:全新采用的 Apache 2.0 协议,消除了此前的商业与部署限制,赋予开发者完全的数字主权与商业化自由。企业可以在本地、云端甚至商业闭环中,完全自主地构建、修改并安全部署该前沿大语言模型。
Q:部署 31B Dense 和 26B MoE 大模型的硬件门槛是什么?
A:部署门槛已大幅降低。未量化的 bfloat16 原生权重,可完美在 80GB NVIDIA H100 GPU 上单卡部署;通过 llama.cpp 等工具运行量化版本,完全可以在主流中高端消费级显卡上实现高效本地推理。
Q:Gemma 4 的 E2B/E4B 端侧模型是如何平衡性能与设备功耗的?
A:E2B 与 E4B 专为移动端与 IoT 节点重构,推理阶段采用了按需激活机制,分别仅占用 2B 与 4B 的超小内存印迹。这种设计在保证多模态能力的同时,大幅削减了 RAM 占用,能效延长设备的电池续航。
















最新评论
提供snap包没意见,但是移除deb,还把deb改成虚包指向snap,实在是让人作呕
为什么关机关电源后,开机时打开电源就开机了。对电脑有损伤吗?
有多亮,是blingbling的吗🤣
这个网站眼前一亮