研究Artificial Analysis·原文 2026年9月1日本站收录 2026年9月7日

Claude Fable 5.1登顶Artificial Analysis智能指数,单任务成本比Fable 5高 20%

Anthropic新旗舰模型在最大推理强度下得 66 分,超越Claude Opus 5、Fable 5与GPT-5.6 Sol;缓存读取价格下调 75%,但仍因输出token用量约 1.7 倍于Fable 5而推高单任务成本。

据第三方评测机构Artificial Analysis发布的文章,Anthropic的Claude Fable 5.1在最大推理强度(max effort)下于Artificial Analysis智能指数(Intelligence Index)得 66 分,为该指数迄今测得的最高分。该机构在其网站公布评测结果,并说明曾在发布前为Anthropic提供预发布评测支持。作为对比,Claude Opus 5(max)得 63 分,Claude Fable 5(max)得 62 分,GPT-5.6 Sol(max)与Grok 4.6(high)均为 61 分。评测使用Anthropic的默认服务端回退机制,约 4% 的输出token(主要针对安全标记请求)被路由至Claude Opus 4.8或Claude Opus 5。

Fable 5.1在多项基准上创下最高分:HLE得分 59.1%,高于此前由Claude Fable 5保持的 55.5%;Terminal-Bench v2.1得分 91.4%;SciCode得分 62.0%;τ³-Banking较Fable 5提高 9 分。在代理型知识工作评测中,Fable 5.1(max)于GDPval-AA v2得 1,853 Elo,较Fable 5提高 130;在AA-Briefcase得 1,694 Elo,较Fable 5提高 122。但与Claude Opus 5相比,GDPval-AA v2的领先在置信区间内,AA-Briefcase得分(1,685)视为持平。

成本方面,Fable 5.1(max)在智能指数上每个任务平均花费 3.76 美元,比Fable 5(max)的 3.14 美元高 20%,是Claude Opus 5(max)2.34 美元的 1.6 倍。原因在于Fable 5.1(max)的每个任务输出token用量约为Fable 5的 1.7 倍。

Anthropic将缓存读取价格从每百万token 1美元降至 0.25 美元,降幅 75%,标准输入/输出价格维持每百万token 10美元/50 美元不变。缓存写入价格维持每百万token 12.5美元。根据Artificial Analysis估算,缓存降价使每个任务节省约 1.40 美元,若不降价Fable 5.1(max)的单任务成本约为 5.16 美元。

在xhigh推理强度下,Fable 5.1得 65 分,单任务成本为 2.72 美元,比max强度低 1.04 美元,但仍高于Claude Opus 5(max)的 63 分及 2.34 美元成本。

Fable 5.1的五个推理强度设置对应输出token用量从 13.1M(low)到 143.7M(max)11 倍区间,智能指数得分从 58 到 66。在所有强度中,Fable 5.1位于智能指数与每任务输出token的前沿(Pareto frontier)上,但其下限高于GPT-5.6家族:GPT-5.6 Sol(medium)每任务输出token用量约 12M,低于Fable 5.1(low)的 13.1M。

代理型工作得分与Opus 5互有胜负

在代理型知识工作评测中,Fable 5.1(max)与Claude Opus 5(max)的表现接近但侧重点不同。GDPval-AA v2上Fable 5.1得 1,853 Elo,Opus 5为 1,824,但置信区间重叠;AA-Briefcase上两者分别为 1,694 与 1,685,视为持平。分项得分显示,Fable 5.1在分析质量上领先(2,025 对 1,980),在呈现质量上落后(1,495 对 1,572)。两个基准均使用Artificial Analysis开源参考代理框架Stirrup测试模型能否生成准确且呈现良好的专业输出。

在AA-Omniscience上,Fable 5.1(max)尝试回答 93.4% 的问题,高于Claude Opus 5的 87.8%,并在答对率上以 67.2% 创下该机构测得的最高纪录,高于Claude Fable 5的 65.4%。但更高的尝试率伴随更高的幻觉率:在未能正确回答的问题中,Fable 5.1有 72.6% 仍给出回答,而Fable 5为 63.6%。两种效应相互抵消,使Fable 5.1的AA-Omniscience指数得分与Fable 5持平。

信息来源