系统极客一直在努力
专注操作系统及软件使用技能

Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 全新发布

Gemini 3.6 Flash

开发者和企业在搭生产级 AI Agent 时,往往最在意这 3 件事:Token 效率、低延迟表现和性能稳定性。为了在效率和生成质量之间找到平衡,更好的支撑大规模智能体工作流,Google 在 Gemini 3.5 Flash 的基础上,正式推出了 3 款新模型:

  • 3.6 Flash:新一代主力模型,代码生成、知识工作、多模态任务性能均有明显提升。根据 Artificial Analysis Index 数据,它比 3.5 Flash 的 Token 输出要少 17% ;在 Datacurve 的 DeepSWE 等基准测试中,Token 节省幅度最高可达 65%。
  • 3.5 Flash-Lite:3.5 系列中速度最快、性价比最高的版本,Artificial Analysis Index 测试显示,输出速度可达 350 Token/秒,智能体工作流的表现也比上一代 Flash-Lite 要好不少。
  • 3.5 Flash Cyber(内置于 CodeMender):专为网络安全场景优化的高效前沿模型,和代码安全智能体 CodeMender 深度整合,安全防护有很强的竞争力。

除了以上 3 款,Gemini 3.5 Pro 目前也正处于合作伙伴测试阶段,准备好了就会全量开放。Google 也已经启动了下一代模型研发,Gemini 4 的预训练规模是有史以来最大,目前进展顺利。

3.6 Flash:效率与质量双重提升

Gemini 3.6 Flash 强化了代码和知识工作能力,Token 效率提了一大截。Artificial Analysis Index 数据显示,它的输出 Token 消耗要比 3.5 Flash 少 17%。在处理多步工作流时,需要的推理步数和工具调用次数也更少。

效率提上去的同时,价格也降了下来:输入 Token 低至$1.50/1M,输出 Token 为$7.50/1M。单次智能体任务的综合成本明显降低,构建和运行 AI Agent 变得更加经济划算。

效率优化也并没有牺牲性能,3.6 Flash 在各实际场景中的表现都全面超过了 3.5 Flash:

  • 代码编辑精度更高,能减少冗余修改和执行死循环。DeepSWE 测试成绩从 37% 升到了 49%;衡量机器学习研究能力的 MLE Bench 得分,从 49.7% 涨到了 63.9%。
  • 在 OSWorld-Verified 基准测试中,计算机控制能力得分从 78.4% 提升到了 83.0%。目前计算机控制已经作为内置客户端工具,正式接入 Gemini API 和 Gemini Enterprise。
  • 在 GDPval-AA v2 等知识工作基准测试中,3.6 Flash 同样也保持领先(1421 分对比 3.5 Flash 的 1349 分。)。
Gemini 3.6 Flash 智能体基准测试
Gemini 3.6 Flash 每任务平均输出 Token 数

3.6 Flash 搭载了升级后的前沿安全防护机制,重点防范模型被滥用于网络攻击,以及化学、生物、放射性、核,这类高风险恶意场景。这些机制大幅提升了模型抵御「越狱」攻击的能力。同时 Google 优化了训练策略,尽量降低了在合规场景下的误拒答率。

更多详情,请查阅 3.6 Flash 模型卡

3.5 Flash-Lite:专为扩展智能体工作流而生

Gemini 3.5 Flash-Lite 专门面向低延迟任务,以及对吞吐量要求很高的开发者工作流,比如智能体搜索、文档处理等场景。

Artificial Analysis 测试显示,3.5 Flash-Lite 的输出速度达到了 350 Token/秒。价格也很有竞争力:输入 Token $0.3/1M,输出 Token $2.5/1M。和 3.1 Flash-Lite 相比,它的生成质量有提升明显,为高并发用户提供了很高的性价比。

在所有「思考深度」档位下,3.5 Flash-Lite 的表现都明显要优于 3.1 Flash-Lite,开发者可以按实际负载灵活配置:

  • 跑海量任务时,把思考级别设到最低或较低,保证低延迟、低成本;
  • 跑多步子智能体负载时,再把思考级别调高。
  • 它同样内置了计算机控制工具,能为跨平台智能体任务提供稳定支持。

在多项评估中,3.5 Flash-Lite 的进步都很明显。代码与智能体任务 Terminal-Bench 2.1 得分 54%,上一代是 31%;长上下文处理 GDM-MRCR v2 得分 72.2%,上一代 60.1%;现实任务执行 GDPval-AA v2 拿到了 1140 分,上一代只有 642 分,各方面都远超老版本。

Gemini 3.5 Flash-Lite 对比 3.1 Flash-Lite

在许多智能体和代码生成相关评估中,3.5 Flash-Lite 的表现甚至超过了 3 Flash:SWE-Bench Pro 拿到了 54.2%,3 Flash 是 49.6%;OSWorld-Verified 拿到了 74.0%,3 Flash 是 65.1%。原本跑在 2.5 甚至 3 Flash 上的工作负载,升级到它会更快、更强。

更多详情,请查阅 3.5 Flash-Lite 模型卡

3.5 Flash Cyber 与 CodeMender:高效挖掘与修复安全漏洞

如今, AI 模型发现安全漏洞的速度,已经超过了现有的系统修复速度。要应对越来越大的威胁,软件安全防护方案也必须够强、够快。

Gemini 3.5 Flash Cyber 是在 3.5 Flash 基础上,专门为发现和修复网络安全漏洞进行了微调的版本。和更大参数的模型相比,它专业能力不落下风,单 Token 成本也更低。

在代码安全智能体 CodeMender 中,系统会调度多个 3.5 Flash Cyber 智能体协同工作,来生成一份完整的安全报告。这套架构让 3.5 Flash Cyber 在知名安全基准测试 CyberGym 中,达到了前沿模型的水平。

Gemini 3.5 Flash Cyber:CyberGym 安全基准测试

鉴于这类漏洞挖掘技术天然就有两面性,Google 对 3.5 Flash Cyber 的部署采取了谨慎的定向策略。近期它只会通过限量试点,只面向政府部门和受信任的合作伙伴开放,且仅限在 CodeMender 内部使用。

立即体验 3.6 Flash 与 3.5 Flash-Lite

从现在起,Gemini 3.6 Flash 和 3.5 Flash-Lite 已经在以下渠道正式上线:

  • 开发者:可以通过 Google AI Studio、Android Studio 接入 Gemini API 调用,3.6 Flash 也已经同步上线 Google Antigravity,详见开发者指南
  • 企业客户:可以通过 Gemini Enterprise Agent Platform 使用,3.6 Flash 也已经接入 Gemini Enterprise 应用。
  • 普通用户:可以直接在 Gemini App 中体验。另外 3.5 Flash-Lite 也正在逐步接入 Google 搜索。
赞(0)
分享到

评论 抢沙发