Claude Fable 5.1发布:科研跑分翻倍、缓存降价75%,AI开始亲自做实验

2026年9月2日,Anthropic发布Claude Fable 5.1与Claude Mythos 5.1。两个版本共用同一套模型权重,Fable 5.1面向全部用户开放,Mythos 5.1只向通过审核的网络安全与生命科学团队开放。API模型ID为claude-fable-5-1,已同步上线Anthropic API、AWS Bedrock、Google Agent Platform和Microsoft Foundry四条渠道。

这次升级把两个数字推到台前:科研基准Terminal-Bench-Science 0.1上,Fable 5.1拿下52.6%,上代Fable 5只有24.7%,GPT-5.6 Sol为22.4%。缓存读取价格降到每百万token 0.25美元,降幅75%。

跑分一览:断层式领先

看几组硬数据。

Terminal-Bench 4.0(智能体终端编程):Fable 5.1得分55.8%,Mythos 5.1版本达60.9%。作为对比,Fable 5为42.0%,Opus 5为52.3%,GPT-5.6 Sol为37.3%。

CursorBench 3.2.0:Fable 5.1拿下73.4%,压过Fable 5的70.5%、Opus 5的70.0%和GPT-5.6 Sol的67.2%。

AutomationBench(商业工作流自动化)涨幅最猛:从Fable 5的17.1%直接跳到31.4%,接近翻倍。GDPval-AA v2知识工作测试中,Fable 5.1拿到1853分,Opus 5为1824分。

OSWorld 2.0计算机操作测试,Fable 5.1严格模式下得41.7%,部分完成模式下得77.9%。

三个真实案例:AI动手做了科研

重绘金星三分之一地形

NASA麦哲伦号在上世纪90年代采集的金星雷达数据,分辨率只有10到20公里。此后三十多年,人类只完成了其中约五分之一区域的高程建图。Fable 5.1用这批公开数据训练了一个神经网络,输出覆盖金星约三分之一面积的高分辨率地形图,空间分辨率提升到2至3公里,高度估计精度最高提升25%。成果已以Creative Commons授权公开发布,任何人可下载验证。

蛋白质设计命中率逼近五成

Mythos 5.1为EGFR、Nipah G、15-PGDH等12个靶点提交了分子设计方案,外部机构随后完成湿实验验证。结果超出预期:3个靶点的结合亲和力达到Adaptyv Bio蛋白质设计竞赛最佳参赛方案的10倍;12个靶点总体命中率接近50%。行业常态是多少?10%到15%。

手写GPU Kernel,生信推理成本腰斩

基因组学研究里,模型推理动辄要跑数千到数万次,GPU账单随之膨胀。Mythos 5.1只凭公开源码,独立为7个开源生物信息学模型手写了CUDA Kernel,其中包含Evo 2大模型。在NVIDIA H100上,推理速度最高提升2.5倍,输出结果与原版完全一致。一笔实际账单:扫描300万个变异的全基因组分析,用Evo 2跑的成本从约18000元降到约8000元。

编程能力:长链路任务的完整交付

过去的代码AI有个通病:连续运行数小时、调用数十个工具后丢掉任务目标,遇到报错绕着走,只修表面症状。Fable 5.1在这条链路上做了强化:读仓库文档、拆解目标、执行修改、跑测试、定位失败根因、进入下一轮修复,每一步都执行到位。

对冲基金Millennium的案例最能说明问题。一个内部系统存在偶发性崩溃,概率约百万分之一,工程团队追了四五年没找到根因,其他模型也都失败了。Fable 5.1反汇编了一个外部供应商库,与核心转储文件比对,把崩溃定位到该库内部的一个bug。Cognition同步行动,发布之日就把Devin的Opus 5流量全部切到Fable 5.1。Ramp的机器学习工程师跑了一个38小时无人值守任务:模型诊断出先前结果是标注误差,修正后启动6个并行实验,隔夜返回完整结论和下一步方案。

定价:Agent任务成本最高省45%

输入输出价格与Fable 5持平:输入每百万token 10美元,输出每百万token 50美元。变化在缓存读取——从上代价格直降75%,到每百万token 0.25美元。

缓存读取是Agent任务成本的大头。长上下文多轮任务每一步都要重读已有内容,这笔开销累积起来非常可观。按官方口径,普通工作负载总成本约降25%,高强度Agent场景最高省45%。

Every CEO Dan Shipper的评价直白:Fable级智能、Opus级价格、Sonnet级速度,实测速度约为Opus 5的两倍,token用量只有一半。

安全机制:护栏一松一紧

网络安全场景的误拦截率较Fable 5降低60%,基础生物学查询的误拦截率下降85%。漏洞发现已被允许,漏洞利用代码依然完全阻断。

数据侧推出Enterprise Frontier Safeguards(EFS),数据存储在客户完全掌控的云基础设施里,效果等效零数据保留,今秋分阶段向企业客户开放。反蒸馏方面,2026年8月31日后注册的API账号无法通过中途修改上下文提取模型思维链,尝试修改会直接报错。

Mythos 5.1目前只向通过CVP和LSVP审核的美国机构开放,国际扩展将配合美国政府节奏推进。

开发者该关注什么

三件事。其一,缓存降价75%让长上下文Agent任务的部署账单好看不少,之前因成本卡在Opus上的团队可以重新评估。其二,科研基准的翻倍涨幅意味着AI在实验室场景从检索工具变成执行者,药物研发、生物信息、行星科学团队值得跟进Mythos的准入动向。其三,Anthropic的迭代节奏已经稳定在数周一次,选型时盯紧基准版本号,跨版本对比容易失真。

模型能力边界正在从”辅助分析”推进到”亲手实验”。这轮变化比跑分本身更值得观察。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号