系统极客一直在努力
专注操作系统及软件使用技能

Gemini 3.8 Flash:推理和代码能力全面提升

Gemini 3.8 Flash 和 3.8 Flash Cyber

Gemini 3.8 Flash 和 3.8 Flash Cyber 正式发布,推理和代码能力都进行了升级,同时保留了 3.7 Flash 系列的低延迟和低成本优势。

  • Gemini 3.8 Flash:通用主力模型,软件工程、Agent 任务和多步推理能力比 3.7 Flash 更强,价格维持了 3.7 Flash 的首发优惠:每 100 万输入 Token $0.75,每 100 万输出 Token $3.75。
  • Gemini 3.8 Flash Cyber:网络安全防御专用模型,重点聚焦在漏洞挖掘和自动化修补,目前仅通过 Fairwind 计划向受信任的防御团队开放。

两个版本面向不同的场景,但共用了同一套底层权重,都靠长时间运行的 Agent 循环迭代和递归评估持续修正模型。通用版本在代码和复杂推理上的提升,部分来自于网络安全场景的高强度训练。

Gemini 3.8 Flash:专为长周期代码编写和自主 Agent 打造

和 3.7 Flash 相比,Gemini 3.8 Flash 的提升明显,多项核心指标已经逼近了成本更高的顶尖前沿模型。

Gemini 3.8 Flash 基准测试

在长周期软件工程基准 DeepSWE v1.1 上,3.8 Flash 能端到端自主解决复杂工程问题,综合表现超过了大多数参数量更大的前沿模型,计算成本却只有后者的几分之一。

Gemini 3.8 Flash:DeepSWE v1.1

在金融和法律这类对严谨度要求更高的专业场景中,3.8 Flash 在 Vals Finance Agent V2Harvey’s Legal Agent Benchmark 上的表现超过了 3.7 Flash 和其他前沿模型;在覆盖 STEM、人文社科多步推理的 HLE-Verified 基准上,它拿到了 54.9% 的成绩。

Gemini 3.8 Flash:Vals Finance Agent V2

这些性能提升来自于一项核心设计取舍:在处理复杂任务时,3.8 Flash 会主动执行更多推理步骤,增加工具调用的迭代次数。调高effort级别时,模型会消耗更多 Token 来换取更高的输出质量。

如果你的业务最在意算力成本,可以调低effort级别来减少 Ttoken 开销,或者继续使用 3.7 Flash 来跑对效率要求高的任务。

Gemini 3.8 Flash Cyber:专家级网络安全表现

Gemini 3.8 Flash Cyber 目前只通过 Fairwind 计划向受信任的防御团队开放,在保持 Flash 系列低延迟、低成本特性的同时,提供了针对网络攻防的专用能力。

自主漏洞挖掘

在漏洞发现基准 CyberGym(主要针对 C/C++ 代码库)中,Gemini 3.8 Flash Cyber 的自主挖掘表现超过了 3.5 Flash Cyber,并优于参数量更大的前沿模型。

Gemini 3.8 Flash:CyberGym

在另一项覆盖 20 种编程语言的内部基准测试中,Gemini 3.8 Flash Cyber 的漏洞排查成功率超过了 70%。

Gemini 3.8 Flash:真实世界漏洞发现

自动化漏洞修补

在训练 Gemini 3.8 Flash Cyber 时,团队把漏洞修补放在了比漏洞利用等攻击性能力更高的优先级。在 Collinear 主导的 CWE-Bench 漏洞修补基准上,Gemini 3.8 Flash Cyber 的 pass@1 达到了 47.2%,和行业顶尖前沿模型的 47.8% 非常接近,但推理成本要低很多。

Gemini 3.8 Flash Cyber:CWE-Bench vs 每次推理成功

实际场景与内部验证

Google 已经在内部广泛使用 Gemini 3.8 Flash Cyber 来守护代码安全:

  • Chrome 安全团队实测显示,针对 Chrome 真实漏洞,3.8 Flash Cyber 生成的有效补丁数量是业内顶尖超大商业模型的 2.6 倍。
  • 云安全厂商 Wiz 的渗透测试基准显示,Gemini 3.8 Flash Cyber 的召回率提升了 7.5%~9.7%,调用成本降到了其他主流前沿模型的 1/5.2 到 1/2.3。
  • Google Cloud 漏洞研究团队使用 3.8 Flash Cyber,在不到 2 小时就排查出了一处核心底层漏洞,这类研究以往通常要耗时数月。

安全策略与防护边界

按照 Google 的前沿安全框架要求,3.8 Flash 默认内置了针对 CBRN(化学、生物、放射性、核武器)和网络攻击行为的防滥用策略,常规良性开发需求不受影响。3.8 Flash Cyber 则配了面向攻防场景的专用策略,但只定向开放给有防御需求的受信任团队。

在针对恶意提示词注入的 Gray Swan 鲁棒性评估里,Gemini 3.8 系列对注入攻击的拦截率也有提升。

Gemini 3.8 Flash Cyber:Gray Swan IPI benchmark

使用 Gemini 3.8 Flash 与 Cyber

  • 开发者:可以通过 Google Antigravity 搭建 Agent 工作流,或者在 Google AI Studio 和 Android Studio 的 Gemini API 中调用,也支持在 Stitch 中生成 UI。详见开发者文档
  • 企业客户:可以通过 Gemini Enterprise 接入 3.8 Flash。
  • 个人用户:Google AI Pro 和 Ultra 订阅用户可以在独立 Gemini 应用、Google 搜索的 AI 模式Google Sheets 的 Gemini 扩展中直接调用 3.8 Flash。
  • 网络安全机构:通过 Fairwind 计划,Gemini 3.8 Flash Cyber 会优先面向监管机构、关键基础设施运营方及重要开源软件维护团队开放申请。
赞(0)
分享到

评论 抢沙发