系统极客一直在努力
专注操作系统及软件使用技能

Claude Opus 5 发布:性能逼近 Fable 5,代码与科研能力 SOTA

anthropic

Claude Opus 5 正式发布!新模型推理能力扎实,主动性很强,能力表现很接近 Claude Fable 5,但价格只有它的一半。

在代码编写、知识工作等领域的评估基准上(比如 Frontier-Bench 和 GDPval-AA),Opus 5 拿下了 SOTA,但网络安全相关任务的表现仍稍逊于 Mythos 5。

Opus 5 主要面向高频日常使用场景优化,运行效率远超其他模型,它现在是 Claude Max 的默认模型,也是 Claude Pro 里综合能力最强的模型。

Claude Opus 5 基准测试
Claude Opus 5 基准测试

性能与性价比

在和前代 Opus 4.8 成本持平的前提下,Opus 5 的性能有了大幅提升。你可以调整模型的「思考努力程度」,在追求顶级能力与节省 Token 换取更快、更便宜的结果之间自由平衡。

Opus 5 在高价值软件工程任务上表现突出:

  • 以 Frontier-Bench v0.1 为例,Opus 5 得分超过了所有参测模型,单次任务成本更低,分数达到了 Opus 4.8 的两倍以上。
  • 在 CursorBench 3.2 的最高努力程度设置下,Opus 5 得分距离 Fable 5 的峰值只差 0.5%,单次任务成本直接减半;在 High、Xhigh、Max 模式下,相同成本时的性能均超过其他所有模型。
Opus 5 按努力程度进行智能体编码

在知识工作、复杂问题解决等场景里,Opus 5 也有同样的优势:

  • ARC-AGI 3 衡量模型解决全新陌生问题的能力,Opus 5 得分是次优模型的 3 倍。
  • Zapier AutomationBench 衡量端到端独立完成业务流程的能力,相同单任务成本下,通过率约为次优模型的 1.5 倍;哪怕调到最低努力程度,通过的任务数量也比其他模型多。
  • OSWorld 2.0 计算机操作能力基准测试,在任意成本档位下,Opus 5 的表现都优于其他模型,仅用 1/3 多一点的成本,就超过了 Fable 5 的最佳成绩。
Opus 5 通过成本实现新颖的问题解决

科研领域,Opus 5 相比 Opus 4.8 有明显提升。在涵盖结构生物学、有机化学、生物信息学等方向的生命科学评估中,Opus 5 的成绩全面超过了 Opus 4.8。提升最明显的是有机化学任务,比如根据光谱数据推断分子结构,内部基准测试得分比 Opus 4.8 高出 10.2 个百分点;蛋白质相关任务,比如预测蛋白质序列变异对功能的影响,得分高出 7.7 个百分点。

Claude Opus 5 实战表现

Claude Opus 5 的自我校验和迭代优化能力更强,能稳扎稳打把任务做完。评估测试和早期内测阶段有几个典型案例:

  • 在 Frontier-Bench 的一项任务中,测试方给了一张机械零部件图纸,要求模型写代码重建为 FreeCAD 3D 模型,还故意堵死了模型直接查看图像的通道。Opus 5 自己写了一套计算机视觉流水线,从原始像素里提取几何特征,完整重构出了零部件,多次重复测试全部成功。同等设置下的竞品模型,尝试 5 次全部失败。
  • 面对某个知名开源包管理器中的真实 Bug,Opus 5 不仅找到了根因,还修复了社区补丁漏掉的边缘情况。而某个竞品模型只修复了表面问题。就直接报告 Bug 已解决。
  • 某交易公司的一名工程师利用 Opus 5,仅一个会话就为新交易所写完了一套市场数据接入组件。之前哪怕工程师给了详尽的规划方案,旧模型也完全做不完这个任务。Opus 5 甚至还自己搭了一套测试套件,来验证代码能不能准确解析交易所返回的数据。

对齐与安全性

对齐机制

在部署前的测试阶段,自动化行为审计显示,Opus 5 是 Anthropic 迄今为止对齐程度最高的模型。它比 Opus 4.8、Sonnet 5 以及 Fable 5 更严格地遵循 Claude 准则,欺骗性行为发生率最低,也最不容易被诱导从事滥用行为。在避免(可能造成)不可逆后果的鲁莽操作上,也是目前最安全的模型。

Opus 5 自动化行为审计

安全防护

Opus 5 并没有推高高风险、军民两用能力的行业上限。在联合私营部门及政府合作伙伴的严格评估中,它在生物学研究、攻击性网络安全任务上的表现依然落后于 Mythos 5,更多细节可以查看官方系统卡

和前代 Opus 4.8 一样,官方刻意没有使用网络安全任务数据来训练 Opus 5。不过随着通用能力的提升,它在这类任务上的表现还是有明显进步:发现网络安全漏洞的能力已经逼近 Mythos 5,但在利用漏洞、把漏洞转化为实际网络威胁这一步,仍大幅落后。

OSS-Fuzz 的测试结果也能充分体现这一点。OSS-Fuzz 是 Anthropic 开发的一套评估工具,用来衡量模型在缺少大量人工指导的情况下,寻找并利用漏洞的能力。Mythos 5 和 Opus 5 识别漏洞的成功率都差不多,但 Opus 5 编写漏洞利用程序的得分要远低于 Mythos 5。

Opus 5 查找开源代码中的漏洞和攻击手段

Opus 5 安全防护机制

Claude Opus 5 的安全防护机制旨在支持网络安全和生物学领域的正当应用,整体方案和 Opus 4.8 类似,只针对少数特定网络安全任务加了更严格的护栏。

网络安全

相比 Fable 5,Opus 5 的网络安全分类器拦截策略更克制:它允许 Opus 5 在源代码里查找漏洞,但会拦截更接近恶意行为的二进制漏洞扫描、渗透测试和漏洞利用程序的生成请求。

根据测试预判,该分类器的拦截频率会比 Fable 5 低约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 中,任何被标记的请求默认会自动降级到 Opus 4.8 处理,API 用户也可以自行配置降级规则。

生物学领域

Opus 5 采用了和 Opus 4.8 类似的安全防护措施,它现在是面向公众开放的科研领域最强模型。不过它在长周期、自主化研究任务上,还有明显局限。本次发布后,之前在 Fable 5 上会被拦截的生物学相关请求,现在会自动路由到 Opus 5,而不是 Opus 4.8。

开始使用

Claude Opus 5 现已正式上线,定价为 1M 输入 Token 5 美元, 1M 输出 Token 25 美元,和 Opus 4.8 保持一致。开发者现在就可以在 Claude API 中调用claude-opus-5

同时,模型还支持极速模式,运行速度约为默认模式的 2.5 倍。和 Opus 4.8 一样,极速模式在 Claude Platform 上的价格为 Opus 5 基础价格的 2 倍,在 Claude Code 中也可以通过使用额度进行抵扣。

随 Opus 5 一同推出的,还有两个 Beta 阶段的功能更新:

  • 会话中工具动态切换:开发者可以在对话过程中,随时更改 Claude 可使用的工具,不会让提示词缓存失效。
  • API 自动降级重路由:用户可以将 Opus 5 或 Fable 5 上触发安全分类器拦截的请求,自动重路由到其他模型。开启自动降级后,API 请求默认会分配给当前可用的最佳模型,而不是直接阻断。
赞(0)
分享到

评论 抢沙发