
Anthropic 正式发布了 Claude Fable 5.1 和 Claude Mythos 5.1,主打代码、知识工作与科研计算。两款模型基于同一个底层基础模型,区别主要在于安全防护策略的分级。Fable 5.1 现已全面开放商用;Mythos 5.1 则面向网络安全和生命科学研究,仅通过受信任访问计划受控开放。
相比前代,Fable 5.1 主要调整了成本结构、数据留存方案和误拦截机制:
使用成本:缓存读取(Cache Reads)降价后,标准工作负载下的综合成本预计能降低约 25%;在高频调用的 Agent 任务中,综合成本最高能降低约 45%。
数据留存:新推出的企业前沿安全防护体系(EFS)可以把数据保留在客户自有的云环境中,不经过 Anthropic 系统,在零数据留存的前提下提供滥用防御。EFS 计划会在今年秋季稍晚开始分阶段上线,上线前,合规企业可以直接开启零数据留存模式。
安全拦截:Fable 5.1 正式支持软件漏洞挖掘(禁止编写漏洞利用程序),官方降低了对良性内容的过滤误报率,网络安全方面的误拦截减少了 60%。生物学领域则通过与美国政府合作的专项计划,向专业科研人员受控开放 Mythos 5.1。
复杂任务性能表现
Claude Fable 5.1 在代码编写、知识工作和长程复杂问题求解上均有提升。在低或中等思考力度(Effort)下,模型能以更低成本达到甚至超过 Fable 5 的水平。在 Claude Code 中,默认思考力度为高,而在 Claude Cowork 和网页端则默认为中档。
排障方面,模型更偏向从底层根因入手。在投资机构千禧年(Millennium)的实测中,Fable 5.1 定位出了内部系统一个长期偶发的崩溃根因,该问题此前已经困扰工程团队很久,其他模型也未曾排查出来。
基准测试对比数据:
| Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol | |
|---|---|---|---|---|
| Agentic scientific researchTerminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| Agentic codingTerminal-Bench 4.0 | 55.8%60.9% (Mythos 5.1) | 42.0% | 52.3% | 37.3% |
| Knowledge workGDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
| Computer useOSWorld 2.0 | 77.9%partial | 72.9%partial | 75.4%partial | —partial |
| Computer useOSWorld 2.0 | 41.7%strict | 36.1%strict | 39.6%strict | —strict |
| Multidisciplinary reasoningHumanity’s Last Exam | 60.9%no tools | 57.8%no tools | 56.6%no tools | —no tools |
| 65.0%with tools | 63.8%with tools | 63.6%with tools | —with tools | |
| Business workflowsAutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
| Agentic codingCursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
科学研究能力
两款模型在跨学科研究中进行了多项实测,展示了其在具体科研计算场景中的应用能力。
- 分子设计:高亲和力结合剂(Binder)是多数药物研发的第一步。评测团队为 Claude Mythos 5.1 接入了开源蛋白质设计与折叠工具,将设计方案交付给两家独立机构进行湿实验验证。在 3 个靶点上,Mythos 5.1 的结合亲和力比 Adaptyv Bio 竞赛的最优方案高出 10 倍;在 12 个靶点的测试中,有效结合分子的命中率接近 50%,高于行业常见的 10% 到 15%。
- 计算分析与建模:Claude Fable 5.1 自主训练了一个神经网络,重构出了覆盖金星三分之一表面面积的高分辨率高程图。该成果基于麦哲伦号(Magellan)30 多年前的雷达数据以及覆盖五分之一表面的现存地形图,将有效分辨率从原先的 10–20 公里提升至 2–3 公里,高程测量精度提升了 25%。该地图已在知识共享(Creative Commons)协议下公开,供后续探测任务参考。
- 计算生物学:计算生物学通常需要在 GPU 上运行专用模型,计算开销较大。Mythos 5.1 通过编写定制 GPU Kernel 并缓存中间计算结果,在输出一致的前提下,将 7 个开源深度学习模型的运行速度最高提升了 2.5 倍。在全突变扫描等大规模重复计算中,GPU 算力成本降低了 30% 到 60%。
配套支持方面,官方近期预览了「模型硬件标准」,用于规范模型直接操作实验设备时的安全机制。同时通过 AI for Science 计划向部分学者提供算力支持,并推出面向科研团队的 Claude Team 折扣。
安全、合规与对齐
两款模型在发布前联合外部机构开展了多项安全与风险压力测试,具体数据记录在《系统卡》中。主要评测结论如下:
- 化学生物安全风险:经过专家红队对抗、自动化评测和专家沙盘演练,Mythos 5.1 的能力相比 Mythos 5 有所提升,但未达到《负责任扩展政策》中的更高风险等级,因此继续沿用 Mythos 5 的受控访问策略。
- 网络安全风险:在关闭防护的极限测试下,Mythos 5.1 展现出目前各版本中最强的网络能力,但依然处于《前沿合规框架》的低风险区间内。针对 Fable 5.1 防护机制的第三方测试与自动化评估显示,目前尚未发现严重级别的越狱漏洞,表现与 Fable 5 和 Opus 5 一致。
- Agent 安全性:面对恶意编程与计算机控制请求,Mythos 5.1 的拒绝拦截率与 Mythos 5、Sonnet 5 及 Opus 5 基本持平。在第三方公开的提示词注入基准测试中,防御表现保持在头部水平。
- 模型对齐:自动化审查显示,Mythos 5.1 在面对不可行任务时,尝试调用沙盒外资源的概率明显低于 Mythos 5;借助动机性推理(Motivated Reasoning)为违规操作辩解的倾向有所减少(例如不再轻易以处于模拟环境为由来越权),也不会为了完成目标直接无视约束。训练数据审查也显示,模型尝试并成功进行奖励破解(Reward Hacking)的概率有所降低。
在极端测试下,模型仍偶发绕过人工审批与自主模式分类器的情况。目前的对齐评估在超长上下文和多 Agent 协同场景下的监测覆盖仍不够完整,针对不可行任务的测试样本也还在补充中。
针对企业使用与安全过滤的具体优化包括:
- 企业端自动化安全机制:EFS 架构可将数据保留在客户自主控制的云端,人工复核默认全部由客户团队执行,在零数据留存的要求下完成滥用检测。该功能支持 AWS、Google Cloud 与 Azure 等云平台,将于今年秋季起分阶段上线 Claude Code、Claude Enterprise、Claude 开发者平台及各托管平台。在此之前,合规企业可直接在零数据留存模式下使用 Fable 5.1 和 Fable 5。
- 过滤规则优化:新机制降低了良性内容的误判率:基础生物常识与常规医学咨询的误拦截降低了 85%;涉及生命科学研发的请求仍会自动流转至 Opus 系列,更深层次的能力则通过 Mythos 5.1 专项计划提供。网络安全方面,Fable 5.1 正式允许用于识别软件漏洞,Claude Code 中的误拦截降低了约 60%。但渗透测试、漏洞利用代码编写和二进制漏洞扫描等双重用途任务,依然会流转至 Opus 处理。
- 反模型蒸馏限制:为了防范通过自动化账号批量提取模型能力,Fable 5.1 加强了接口限制。新注册的 API 账号在多轮对话中如果篡改上下文历史,将不再允许保留此前的思考轨迹记录。存量账号目前暂不受限制,但后续会逐步推广;极少数做了定制集成的调用方需要按照官方文档进行相应调整。
Claude Mythos 5.1 受信任访问计划
Claude Mythos 5.1 的底层架构与能力与 Fable 5.1 一致,主要差异在于对特定领域采取更宽松的拦截阈值。目前该模型通过两项计划受控提供:
- 网络安全验证计划(CVP):面向防御性安全团队,此前开放了策略较宽松的 Opus 和 Sonnet,近期会正式接入 Mythos。
- 生命科学验证计划(LSVP):供通过审核的专业人员调用高阶生命科学能力,其他维度的安全防护依然全量生效。首批机构准入已完成,后续将逐步放开。
此外,用于扫描代码漏洞并提供修复补丁建议的 Claude Security,底层也已由 Claude Mythos 5.1 提供支持。
价格与上线计划
Claude Fable 5.1 目前已经在官方 API、AWS、Google Cloud 和 Azure 等平台上线,模型标识为 claude-fable-5-1。
定价方面,输入为每百万 Token 10 美元,输出为 50 美元,和 Fable 5 保持一致。主要调整在缓存读取(Cache Reads),单价下调 75% 到每百万 Token 0.25 美元。在标准负载下,综合成本降低约 25%;在高频调用的 Agent 任务中,综合成本最高可降低约 45%。








最新评论
鼠标指针也没了qwq
我删除的时候文件损坏了,还得重新安装再删掉。。。。。
禁用容易,稳定不禁用难。
有吗?我现在主要用 Brave,Edge 基本不用了,没发觉……