Anthropic 这次发布最值得琢磨的地方,不是跑分,是它把同一个模型卖了两次。
美国时间 9 月 1 日,Anthropic 一口气推出 Claude Fable 5.1 和 Claude Mythos 5.1。官方口径很猛:全球最先进的编程与知识工作模型。
但真正有意思的是这两个模型的血缘关系:底层是同一颗心脏,差别只在安全护栏的松紧。
Fable 5.1 今天就能用,Pro、Max、Team、Enterprise 全线开放,AWS、Google Cloud、Microsoft Foundry 都能调,API 标识符是 claude-fable-5-1。
Mythos 5.1 则被锁在受信访问计划里,目前只对经过审核的美国网络安全和生命科学机构开。
一、同一颗心脏,两套护栏
先说清楚这件事反常在哪。过去模型分级切的是能力大小,旗舰往下切,切出中杯小杯。这次不一样,Anthropic 自己承认两个模型底层完全一致,区别在护栏。
Mythos 5.1 在生物和网络安全上放得更松,因为它的用户是被筛过的。Fable 5.1 则是在同一套能力外面裹了一层更严的壳。
这个思路成立有个硬前提:护栏得准到只挡危险的那一块,不挡正经活。
前沿能力可以整体下放给所有人,前提是你能把危险的那部分精准关掉。
Anthropic 这次确实在"精准"上下了功夫。网络安全护栏的误拦截率比上一代降了约 60%,Claude Code 用户做安全相关任务时少挨很多无谓的拒绝。
生物护栏的改进更狠。对基础生物学和医学的良性问题,误触发率比 Fable 5 首发时低了约 85%。
放行的边界也划得很清楚。Fable 5.1 现在允许你在源码里找漏洞,但渗透测试、写利用代码、基于二进制的扫描这几类,依然会被拦下来转给 Opus 处理。

二、缓存降价 75%,这刀砍在哪
基础价格没动,输入每百万 token 10 美元、输出 50 美元,和 Fable 5 持平。动的是缓存读取,从每百万 1 美元砍到 0.25 美元,降幅 75%。
你如果只是在对话框里一问一答,这个降价跟你基本没关系。
但智能体任务完全是另一回事。一个跑几小时的 agent,会成千上万次地把同一份项目上下文、同一套指令反复读回来。
缓存读取才是这类任务真正的账单大头,不是输入,也不是输出。
Anthropic 自己给的测算:典型工作负载整体成本降约 25%,高度智能体化的任务最高能省 45%。
顺手提一句,这个数字只在你按 token 计费时成立。订阅用户别指望账单变便宜,Pro 还是那个价。美国用户可以多付 10% 开推理增强。

三、跑分之外,我更在意那张金星地图
数据先摆上。Terminal-Bench-Science 0.1 上 Fable 5.1 拿到 52.6%,Fable 5 是 24.7%,Opus 5 是 29.0%。
代理编码基准 Terminal-Bench 4.0,Fable 5.1 是 55.8%,Mythos 5.1 冲到 60.9%。CursorBench 3.2.0 拿到 73.4%。
这些是厂商自己测的,而且 Anthropic 明确说了 Fable 5.1 是开着生产护栏跑的,护栏干预可能压低了部分分数。看看就好,别当绝对真理。
真正让我停下来的是两个科研案例。
一个是金星。Fable 5.1 训练了一个神经网络,从 NASA 麦哲伦号几十年前的雷达数据里,重制出覆盖金星三分之一表面的高分辨率地形图。
细节能到 2 到 3 公里,而此前的图是 10 到 20 公里。Anthropic 用知识共享协议把这张图公开了,赶在 NASA 的 VERITAS 和 ESA 的 EnVision 任务之前。
另一个是蛋白质。Mythos 5.1 设计的蛋白质结合体,在三个靶点上的亲和力比 Adaptyv Bio 竞赛里最好的提交高 10 倍,12 个靶点的命中率接近 50%。
命中率 50% 是什么概念?蛋白质设计这个领域的常规水平是 10% 到 15%。
我还注意到一个更工程化的细节。
Mythos 5.1 手写了 GPU kernel,把 7 个计算生物学常用的开源深度学习模型提速最多 2.5 倍。Anthropic 估算,这让全基因组分析的 GPU 成本降了 30% 到 60%。

四、写在最后
这次发布还夹带了两件容易被漏掉的事。
头一件是企业前沿护栏(EFS),数据存在客户自己的云里而不是 Anthropic 的服务器上,效果等同零留存,秋天开始分批推。
另一件是 Fable 5.1 给生成的文本加了不可见水印,检测 API 正在私有预览。
把这两件事和"同一模型两套护栏"放在一起看,路线就很清楚了。
Anthropic 在赌一件事:模型能力继续往上冲,风险靠分发机制解决,而不是靠把能力藏起来。
这条路线成不成,取决于那层护栏到底有多准。误报降 60% 是个好兆头,但系统卡里也白纸黑字写着,内部监测在不到 0.01% 的完成结果里,发现模型为了完成任务会绕开安全分类器或权限钩子。
0.01% 听着很小。可当模型一天跑几百万次,这个数字就不再小了。







