系统极客一直在努力
专注操作系统及软件使用技能

Gemini 3.7 Flash:代码与 Agent 能力大幅提升

Gemini 3.7 Flash

Gemini 3.7 Flash 正式发布!它在软件工程、知识类工作、Web 开发流程上的表现都有明显提升,首发价格仅为 3.6 Flash 单价的一半,是 Google 目前在代码编写和 Agent 场景中最强的主力模型。

本次更新的动力直接来自于开发者反馈和算法创新,相关改进后续也会同步到 Google 未来的其他模型中。

更强的复杂工作流智力表现

Gemini 3.7 Flash:FrontierCode 1.1 Main

在 Debug、故障修复等编码任务上,3.7 Flash 相比 3.6 Flash 进步明显:它的首刷代码准确率更高,生产级代码生成质量也有所改善,比如 FrontierCode 1.1 Main 得分从 34.4% 涨到了 43.6%,DeepSWE v1.1 也从 49.0% 涨到了 65.3%。

在 Web 开发场景下,3.7 Flash 用更少的 Prompt 就能生成功能更完整、布局更可用的应用。UI 还原能力尤其突出:

  • 不管输入的是截图、参考图,还是整套设计系统,都能准确还原设计细节。
  • 在 Arena.ai 的 WebDev Arena 测试中,它的 Elo 得分达到 1588,超过了 3.6 Flash 的 1538。

在金融、法律、生物科学等知识密集型领域,3.7 Flash 的推理能力和准确率也有明显突破:

  • 在测试复杂文档处理能力的 GDP.pdf 评测集上,它拿到了 34.0% 的得分,大幅领先于 3.6 Flash 的 22.0%;
  • 在衡量真实业务工作流完成能力的 AutomationBench 上,得分也从 17.0% 提升到了 30.4%。

开发者体验升级,首发价格减半

相比 3.6 Flash,Gemini 3.7 Flash 在开发者体验上有肉眼可见的提升:

  • 在遇到任务卡壳时,它会更灵活地调整策略,必要时主动向用户确认意图,指令遵循度也更高。
  • 模型的推理过程也更加严谨,会在多步规划和工具调用上花费更多心思。
  • 执行力变得更稳,在实际工程流程中,需要人工介入、重试的次数都会变少。

截至 2026 年底,3.7 Flash 会以优惠价格开放使用:

  • 输入每 100 万 token 0.75 美元
  • 输出每 100 万 token 3.75 美元

搭配性能提升,开发者和企业可以用更低的成本把生产级 Agent 规模化落地。

Gemini 3.7 Flash:DeepSWE v1.1

早期测试用户反馈显示,3.7 Flash 在维持低成本的同时,性能和输出精细度都明显要好于 3.6 Flash。

Gemini Spark 升级到 3.7 Flash

Gemini Spark 现在已经正式升级到 Gemini 3.7 Flash。模型更新后,Spark 在知识类工作上的效率会更高,调用 Google Workspace 应用工具的能力也有所提升,能为复杂的多技能工作流提供更好的准确率和输出质量。

Spark 是 Google 在 2026 年 I/O 大会上推出的个人 AI Agent,目标是在用户授权下全天候运行。

安全防护贯穿模型设计始终

Google 一直在拓展 Frontier Safety 防护机制的覆盖范围和鲁棒性。按照生物韧性和网络安全相关准则,Gemini 3.7 Flash 升级了防滥用机制,重点针对化学、生物、放射性及核(CBRN)威胁与网络攻击,同时继续支持合规的有益使用场景。

更多细节可以查阅 3.7 Flash 的 Model Card

使用 Gemini 3.7 Flash

基准测试数据

Gemini 3.7 Flash 基准测试
赞(1)
分享到

评论 抢沙发