Anthropic发布Claude Fable 5.1:科学基准大幅领先,但推理耗时可激增至近14分钟
Anthropic于9月1日发布Claude Fable 5.1,官方称其在科学领域基准Terminal-Bench-Science 0.1上得分52.6%,远超前代。开发者测试显示,推理级别从xhigh升至max时,任务耗时可达近14分钟。
AI解读:Claude Fable 5.1是Anthropic在9月1日发布的最新模型,官方宣称它在科学、编程和复杂问题解决上创下新标准。最突出的数据是它在全新科学基准Terminal-Bench-Science 0.1上拿到52.6%,比上一代Fable 5的24.7%翻了一倍多,也明显超过竞争对手。如果你做科研数据分析或需要模型处理长链条任务,这个分数意味着它能更可靠地完成实验设计、代码调试这类多步骤工作。但要注意,这样的能力有代价:模型把推理分成五档,开到最高档时,一个简单的SVG绘图任务耗时可长达近14分钟、花费3.3美元,而低档只需23秒、不到11美分,但质量差距也很大。实际使用时,你需要根据任务的复杂度和预算在速度与效果之间做权衡——简单任务用低档即可,复杂科学问题才值得花时间和金钱冲高档。目前这个分数只是基准测试,真正的科研场景表现还有待更多验证。
Anthropic于2026年9月1日发布Claude Fable 5.1(及Mythos 5.1)。官方称,Fable 5.1“为编程、知识工作和长期问题解决任务树立了新的标准”。在科学领域,该模型在8月27日首次发布的Terminal-Bench-Science 0.1基准上得分52.6%,而Fable 5为24.7%,Opus 5为29.0%,GPT-5.6 Sol为22.4%。其他基准测试分数提升较小,均不及科学基准的表现。
开发者Simon Willison在个人博客中测试了Fable 5.1在“生成一只骑自行车的鹈鹕SVG”这一提示词下的表现。他发现模型有五个推理级别:低、中、高、极高、最高,且无法完全关闭推理。测试中,在低和中等推理级别下,模型似乎完全跳过了推理,输出约2000个token,耗时23秒左右,成本约10美分。而将推理级别设为极高时,任务耗时7分51秒,输出36,767个token,成本1.83美元,推理过程明显更长。设为最高级别时,耗时进一步增至13分54秒,输出65,927个token,成本3.30美元,生成的SVG质量也被评价为“从Anthropic所有模型中见过最好的鹈鹕”。