系统极客一直在努力
专注操作系统及软件使用技能

Claude Fable 5.1 和 Mythos 5.1 发布:成本最高降 45%

Claude

Anthropic 正式发布了 Claude Fable 5.1 和 Claude Mythos 5.1,主打代码、知识工作与科研计算。两款模型基于同一个底层基础模型,区别主要在于安全防护策略的分级。Fable 5.1 现已全面开放商用;Mythos 5.1 则面向网络安全和生命科学研究,仅通过受信任访问计划受控开放。

相比前代,Fable 5.1 主要调整了成本结构、数据留存方案和误拦截机制:

使用成本:缓存读取(Cache Reads)降价后,标准工作负载下的综合成本预计能降低约 25%;在高频调用的 Agent 任务中,综合成本最高能降低约 45%。

数据留存:新推出的企业前沿安全防护体系(EFS)可以把数据保留在客户自有的云环境中,不经过 Anthropic 系统,在零数据留存的前提下提供滥用防御。EFS 计划会在今年秋季稍晚开始分阶段上线,上线前,合规企业可以直接开启零数据留存模式。

安全拦截:Fable 5.1 正式支持软件漏洞挖掘(禁止编写漏洞利用程序),官方降低了对良性内容的过滤误报率,网络安全方面的误拦截减少了 60%。生物学领域则通过与美国政府合作的专项计划,向专业科研人员受控开放 Mythos 5.1。

复杂任务性能表现

Claude Fable 5.1 在代码编写、知识工作和长程复杂问题求解上均有提升。在低或中等思考力度(Effort)下,模型能以更低成本达到甚至超过 Fable 5 的水平。在 Claude Code 中,默认思考力度为高,而在 Claude Cowork 和网页端则默认为中档。

排障方面,模型更偏向从底层根因入手。在投资机构千禧年(Millennium)的实测中,Fable 5.1 定位出了内部系统一个长期偶发的崩溃根因,该问题此前已经困扰工程团队很久,其他模型也未曾排查出来。

基准测试对比数据:

Fable 5.1Fable 5Opus 5GPT-5.6 Sol
Agentic scientific researchTerminal-Bench-Science 0.152.6%24.7%29.0%22.4%
Agentic codingTerminal-Bench 4.055.8%60.9% (Mythos 5.1)42.0%52.3%37.3%
Knowledge workGDPval-AA v21853172318241711
Computer useOSWorld 2.077.9%partial72.9%partial75.4%partial—partial
Computer useOSWorld 2.041.7%strict36.1%strict39.6%strict—strict
Multidisciplinary reasoningHumanity’s Last Exam60.9%no tools57.8%no tools56.6%no tools—no tools
65.0%with tools63.8%with tools63.6%with tools—with tools
Business workflowsAutomationBench31.4%17.1%26.9%19.6%
Agentic codingCursorBench 3.2.073.4%70.5%70.0%67.2%

科学研究能力

两款模型在跨学科研究中进行了多项实测,展示了其在具体科研计算场景中的应用能力。

  • 分子设计:高亲和力结合剂(Binder)是多数药物研发的第一步。评测团队为 Claude Mythos 5.1 接入了开源蛋白质设计与折叠工具,将设计方案交付给两家独立机构进行湿实验验证。在 3 个靶点上,Mythos 5.1 的结合亲和力比 Adaptyv Bio 竞赛的最优方案高出 10 倍;在 12 个靶点的测试中,有效结合分子的命中率接近 50%,高于行业常见的 10% 到 15%。
  • 计算分析与建模:Claude Fable 5.1 自主训练了一个神经网络,重构出了覆盖金星三分之一表面面积的高分辨率高程图。该成果基于麦哲伦号(Magellan)30 多年前的雷达数据以及覆盖五分之一表面的现存地形图,将有效分辨率从原先的 10–20 公里提升至 2–3 公里,高程测量精度提升了 25%。该地图已在知识共享(Creative Commons)协议下公开,供后续探测任务参考。
  • 计算生物学:计算生物学通常需要在 GPU 上运行专用模型,计算开销较大。Mythos 5.1 通过编写定制 GPU Kernel 并缓存中间计算结果,在输出一致的前提下,将 7 个开源深度学习模型的运行速度最高提升了 2.5 倍。在全突变扫描等大规模重复计算中,GPU 算力成本降低了 30% 到 60%。

配套支持方面,官方近期预览了「模型硬件标准」,用于规范模型直接操作实验设备时的安全机制。同时通过 AI for Science 计划向部分学者提供算力支持,并推出面向科研团队的 Claude Team 折扣。

安全、合规与对齐

两款模型在发布前联合外部机构开展了多项安全与风险压力测试,具体数据记录在《系统卡》中。主要评测结论如下:

  • 化学生物安全风险:经过专家红队对抗、自动化评测和专家沙盘演练,Mythos 5.1 的能力相比 Mythos 5 有所提升,但未达到《负责任扩展政策》中的更高风险等级,因此继续沿用 Mythos 5 的受控访问策略。
  • 网络安全风险:在关闭防护的极限测试下,Mythos 5.1 展现出目前各版本中最强的网络能力,但依然处于《前沿合规框架》的低风险区间内。针对 Fable 5.1 防护机制的第三方测试与自动化评估显示,目前尚未发现严重级别的越狱漏洞,表现与 Fable 5 和 Opus 5 一致。
  • Agent 安全性:面对恶意编程与计算机控制请求,Mythos 5.1 的拒绝拦截率与 Mythos 5、Sonnet 5 及 Opus 5 基本持平。在第三方公开的提示词注入基准测试中,防御表现保持在头部水平。
  • 模型对齐:自动化审查显示,Mythos 5.1 在面对不可行任务时,尝试调用沙盒外资源的概率明显低于 Mythos 5;借助动机性推理(Motivated Reasoning)为违规操作辩解的倾向有所减少(例如不再轻易以处于模拟环境为由来越权),也不会为了完成目标直接无视约束。训练数据审查也显示,模型尝试并成功进行奖励破解(Reward Hacking)的概率有所降低。

在极端测试下,模型仍偶发绕过人工审批与自主模式分类器的情况。目前的对齐评估在超长上下文和多 Agent 协同场景下的监测覆盖仍不够完整,针对不可行任务的测试样本也还在补充中。

针对企业使用与安全过滤的具体优化包括:

  • 企业端自动化安全机制:EFS 架构可将数据保留在客户自主控制的云端,人工复核默认全部由客户团队执行,在零数据留存的要求下完成滥用检测。该功能支持 AWS、Google Cloud 与 Azure 等云平台,将于今年秋季起分阶段上线 Claude Code、Claude Enterprise、Claude 开发者平台及各托管平台。在此之前,合规企业可直接在零数据留存模式下使用 Fable 5.1 和 Fable 5。
  • 过滤规则优化:新机制降低了良性内容的误判率:基础生物常识与常规医学咨询的误拦截降低了 85%;涉及生命科学研发的请求仍会自动流转至 Opus 系列,更深层次的能力则通过 Mythos 5.1 专项计划提供。网络安全方面,Fable 5.1 正式允许用于识别软件漏洞,Claude Code 中的误拦截降低了约 60%。但渗透测试、漏洞利用代码编写和二进制漏洞扫描等双重用途任务,依然会流转至 Opus 处理。
  • 反模型蒸馏限制:为了防范通过自动化账号批量提取模型能力,Fable 5.1 加强了接口限制。新注册的 API 账号在多轮对话中如果篡改上下文历史,将不再允许保留此前的思考轨迹记录。存量账号目前暂不受限制,但后续会逐步推广;极少数做了定制集成的调用方需要按照官方文档进行相应调整。

Claude Mythos 5.1 受信任访问计划

Claude Mythos 5.1 的底层架构与能力与 Fable 5.1 一致,主要差异在于对特定领域采取更宽松的拦截阈值。目前该模型通过两项计划受控提供:

  • 网络安全验证计划(CVP):面向防御性安全团队,此前开放了策略较宽松的 Opus 和 Sonnet,近期会正式接入 Mythos。
  • 生命科学验证计划(LSVP):供通过审核的专业人员调用高阶生命科学能力,其他维度的安全防护依然全量生效。首批机构准入已完成,后续将逐步放开。

此外,用于扫描代码漏洞并提供修复补丁建议的 Claude Security,底层也已由 Claude Mythos 5.1 提供支持。

价格与上线计划

Claude Fable 5.1 目前已经在官方 API、AWS、Google Cloud 和 Azure 等平台上线,模型标识为 claude-fable-5-1

定价方面,输入为每百万 Token 10 美元,输出为 50 美元,和 Fable 5 保持一致。主要调整在缓存读取(Cache Reads),单价下调 75% 到每百万 Token 0.25 美元。在标准负载下,综合成本降低约 25%;在高频调用的 Agent 任务中,综合成本最高可降低约 45%。

赞(0)
分享到

评论 抢沙发