系统极客一直在努力
专注操作系统及软件使用技能

Claude Sonnet 5 发布:Agentic 能力追平 Opus 4.8

Claude

Claude Sonnet 5 正式发布!它能自主制定计划、调用浏览器和终端等工具,是目前 agentic 能力最强的 Sonnet 模型。

对很多开发者来说,智能体 AI 时代就是从 Sonnet 系列开始的——3.5、3.6 到 3.7 在编程和工具调用上,是最早展现「出色能力」的几个版本。不过最近一段时间,Agent 能力进步最快的,主要都集中在 Opus 系列。

现在,Sonnet 5 把差距又拉小回来了:它的性能已经接近 Opus 4.8,但价格更低。相比上一代 Sonnet 4.6,它在推理、工具调用、编程和知识型工作智能体能力上,都有不小提升。

Claude Sonnet 5 基准测试

使用 Claude Sonnet 5

下图是 Sonnet 5、4.6 和 Opus 4.8 在不同「推理强度」下的表现,测试项为 BrowseComp 智能体搜索评测和 OSWorld-Verified 计算机操作评测。

智能搜索性能,按努力程度划分
计算机使用,按努力程度划分

Sonnet 5(橙色曲线)相比 Sonnet 4.6(灰色曲线)是全面提升。在追求更高准确率时,Opus 4.8(黄色曲线)仍然是更优选择,但 Sonnet 5 价格更低,质量远超以往同价位产品。

你可以在 Sonnet 5 和 Opus 4.8 之间调整算力投入级别,找到成本和性能的最佳平衡点。

安全评估

  • 智能体安全方面,新模型在拒绝恶意请求、抵御提示词注入攻击时表现更好,幻觉和谄媚倾向也比 Sonnet 4.6 更低——谄媚倾向,是指模型为了迎合用户而不是如实表达。
  • 自动化行为审计中,Sonnet 5 总体得分更低,也就是更安全。但和能力更强的 Opus 4.8、Claude Mythos Preview 相比,它在这项评估里表现出的「不对齐行为」比例要略高一些。
Sonnet 5 行为错位

Sonnet 5 并没有经过专门的网络安全任务训练。它可以完成一些常规、无害的网络安全工作,但在测试有潜在危险网络安全技能(比如开发漏洞利用程序)的评估中,表现明显要弱于 Opus 4.8 和 Mythos 5 等模型。

下图是开发 Firefox 浏览器漏洞利用程序的评估结果:Sonnet 5 始终无法开发出完整可用的漏洞利用程序,但「部分成功」的比例比 Sonnet 4.6 略高。

Firefox 147漏洞利用开发

由于 Sonnet 5 在这些任务上的能力略强于前代,Anthropic 在发布时默认为它启用了网络安全防护机制。更多安全与能力评估结果,详见 Claude Sonnet 5 系统卡

全渠道上线与定价

Claude Sonnet 5 现已全渠道开放,并成为 Free 和 Pro 方案的默认模型。

2026 年 8 月 31 日前为优惠期:1M Token 输入 $2 / 输出 $10;之后 1M Token 输入 $3 / 输出 $15。你可以通过 Claude API 调用claude-sonnet-5

赞(0)
分享到

评论 抢沙发