Anthropic
·Released on 2026年9月1日

Claude Fable 5.1 API 基准测试 价格和服务商数据

选择与 Claude Fable 5.1 对比的模型

选择一个模型后会直接打开对应的对比页面。

分享到 X
LLM

Claude Fable 5.1 improves on Claude Fable 5 across the board, with the biggest gains in agentic coding, long-running agentic workflows, and knowledge work: long code refactors, front-end and visual...

质量
#4of 101
79.0
LMSpeed 评分

分类性能

基于独立 benchmark family 的实测能力估计,不确定性单独展示。

覆盖
4 / 8
方法论
V3.0
分类性能基于独立 benchmark family 的实测能力估计,不确定性单独展示。智能体64.4代码67.9综合推理61.3知识68.7数学-多语言-多模态-指令遵循-
#1知识68.7暂定评分1/4 实测维度
80% 区间: 54.782.7
broad knowledge68.7
aa_omniscience · aa_omniscience_index / benchlm_category_knowledge · benchlm_category_knowledge
professional knowledge仅先验
factuality仅先验
retrieval open book仅先验
#2代码67.9正式评分全站排名 #14/4 实测维度
80% 区间: 61.074.8
code generation65.5
scicode · scicode
repository engineering71.8
swe_pro · swe_pro
debugging testing74.8
swe_multilingual · benchlm_coding_swe_multilingual
tooling quality59.6
terminalbench · aa_terminal_bench21
#3智能体64.4正式评分全站排名 #43/4 实测维度
80% 区间: 55.873.0
planning仅先验
tool use62.7
tau · aa_tau3_banking
environment execution66.5
gdpval_aa · benchlm_agentic_gdpval_aa / osworld · os_world2
recovery reliability64
briefcase · aa_briefcase_elo / harvey_lab · aa_harvey_lab
#4综合推理61.3正式评分全站排名 #13/4 实测维度
80% 区间: 52.670.0
abstract logic59.1
arc_agi · arc_agi2
scientific causal66.7
critpt · critpt / gpqa · gpqa / hle · hle / hle · hle_no_tools
multistep constraints仅先验
evidence verification58.1
lcr · lcr
暂无数据:数学多语言多模态指令遵循

技术规格

Input and output token limits for this model, plus how it ranks on long-context understanding.

INPUT
1Mtokens
1.2K pages of text
OUTPUT
128Ktokens
8K128K1M4M
1M

能力

Technical Details

输入
输出
发布日期
Sep 2026
官方文档
Tokenizer
Claude
架构
text+image+file->text
内容审核
支持参数
include_reasoningmax_completion_tokensmax_tokensreasoningreasoning_effortresponse_formatstopstructured_outputstoolsverbosity

排名

擅长

相对落后

详细分数

更新时间: 2026年9月2日

综合

2 个指标

Overall score79.0#4 / 101DeepSWE67.4#5 / 17
Overall score
站内排名#4
分数79.0
更新时间2026年9月2日
置信度2
DeepSWE
站内排名#5
分数67.4
更新时间2026年9月2日
置信度2

速度与延迟

2 个指标

输出速度61.4 tok/s#54 / 78首字延迟16.07 s#69 / 78
输出速度
Output speed
站内排名#54
分数61.4 tok/s
更新时间2026年9月2日
置信度4
首字延迟
Time to first token
站内排名#69
分数16.07 s
更新时间2026年9月2日
置信度4

价格

2 个指标

输入价格$10.00/M#172 / 182输出价格$50.00/M#173 / 182
输入价格
Input price
站内排名#172
分数$10.00/M
更新时间2026年9月2日
置信度4
输出价格
Output price
站内排名#173
分数$50.00/M
更新时间2026年9月2日
置信度4

智能体

V3.0

15 个指标 · 正式评分

分数64.4#480% 区间55.8–73.03/4 实测维度Agentic score85.0#7 / 70Terminal-Bench 4.055.8#1 / 1
维度与证据
规划拆解仅先验
工具调用62.7
1 个基准族 · 1 个指标
tau · aa_tau3_banking · z 1.29 · q 1.00
环境与长程执行66.5
2 个基准族 · 2 个指标
gdpval_aa · benchlm_agentic_gdpval_aa · z 1.88 · q 1.00
osworld · os_world2 · z 0.81 · q 1.00
恢复与完成可靠性64
2 个基准族 · 2 个指标
briefcase · aa_briefcase_elo · z 0.91 · q 1.00
harvey_lab · aa_harvey_lab · z 0.55 · q 1.00
Agentic score
站内排名#7
分数85.0
更新时间2026年9月2日
置信度2
Terminal-Bench 4.0
站内排名#1
分数55.8
更新时间2026年9月2日
置信度2
Terminal-Bench-Science 0.1
站内排名#1
分数52.6
更新时间2026年9月2日
置信度2
OSWorld 2.0V3 计分证据
站内排名#6
分数41.7
更新时间2026年9月2日
置信度2
AutomationBench
站内排名#2
分数31.4
更新时间2026年9月2日
置信度2
Toolathlon-Verified
站内排名#2
分数77.8
更新时间2026年9月2日
置信度2
Toolathlon Verified Pass@3
站内排名#2
分数81.5
更新时间2026年9月2日
置信度2
Toolathlon Verified Pass³
站内排名#1
分数73.1
更新时间2026年9月2日
置信度2
Toolathlon Verified avg. turns
站内排名#1
分数23.7
更新时间2026年9月2日
置信度2
AA Agentic Index
站内排名#1
分数61.3
更新时间2026年9月2日
置信度2
GDPval-AA
站内排名#1
分数67.7
更新时间2026年9月2日
置信度2
GDPval-AAV3 计分证据
站内排名#2
分数1853.0
更新时间2026年9月2日
置信度2
AA BriefcaseV3 计分证据
站内排名#2
分数1694.0
更新时间2026年9月2日
置信度2
AA Harvey LABV3 计分证据
站内排名#5
分数93.0
更新时间2026年9月2日
置信度2
AA Tau3 BankingV3 计分证据
站内排名#2
分数47.2
更新时间2026年9月2日
置信度2

代码

V3.0

10 个指标 · 正式评分

分数67.9#180% 区间61.0–74.84/4 实测维度SciCode57.6%#5 / 207Coding score80.3#4 / 82
维度与证据
代码生成65.5
1 个基准族 · 1 个指标
scicode · scicode · z 1.94 · q 1.00
仓库工程71.8
1 个基准族 · 1 个指标
swe_pro · swe_pro · z 3.00 · q 1.00
调试与测试74.8
1 个基准族 · 1 个指标
swe_multilingual · benchlm_coding_swe_multilingual · z 3.00 · q 1.00
工具化开发与质量59.6
1 个基准族 · 1 个指标
terminalbench · aa_terminal_bench21 · z 1.10 · q 1.00
SciCodeV3 计分证据
站内排名#5
分数57.6%
更新时间2026年9月2日
置信度4
Coding score
站内排名#4
分数80.3
更新时间2026年9月2日
置信度2
AA Terminal-Bench 2.1V3 计分证据
站内排名#1
分数91.4
更新时间2026年9月2日
置信度2
SWE-bench ProV3 计分证据
站内排名#1
分数81.2
更新时间2026年9月2日
置信度2
SWE MultilingualV3 计分证据
站内排名#2
分数89.1
更新时间2026年9月2日
置信度2
SWE Multimodal
站内排名#2
分数54.7
更新时间2026年9月2日
置信度2
ProgramBench
站内排名#2
分数87.6
更新时间2026年9月2日
置信度2
CursorBench v3.2
站内排名#1
分数73.4
更新时间2026年9月2日
置信度2
AA Coding Index
站内排名#1
分数81.6
更新时间2026年9月2日
置信度2
AA-SciCodeV3 计分证据
站内排名#1
分数62.0
更新时间2026年9月2日
置信度2

综合推理

V3.0

7 个指标 · 正式评分

分数61.3#180% 区间52.6–70.03/4 实测维度GPQA90.6%#26 / 214HLE55.9%#3 / 211
维度与证据
抽象逻辑59.1
1 个基准族 · 1 个指标
arc_agi · arc_agi2 · z 1.07 · q 1.00
科学与因果推理66.7
3 个基准族 · 4 个指标
critpt · critpt · z 1.08 · q 1.00
gpqa · gpqa · z 1.36 · q 1.00
hle · hle · z 1.43 · q 1.00
hle · hle_no_tools · z 1.90 · q 1.00
多步约束仅先验
证据整合与验证58.1
1 个基准族 · 1 个指标
lcr · lcr · z 0.71 · q 1.00
GPQAV3 计分证据
站内排名#26
分数90.6%
更新时间2026年9月2日
置信度4
HLEV3 计分证据
站内排名#3
分数55.9%
更新时间2026年9月2日
置信度4
Reasoning score
站内排名#4
分数83.1
更新时间2026年9月2日
置信度2
ARC-AGI-1
站内排名#1
分数97.5
更新时间2026年9月2日
置信度2
ARC-AGI-2V3 计分证据
站内排名#3
分数90.0
更新时间2026年9月2日
置信度2
AA-LCRV3 计分证据
站内排名#5
分数80.0
更新时间2026年9月2日
置信度2
CritPtV3 计分证据
站内排名#5
分数29.7
更新时间2026年9月2日
置信度2

知识

V3.0

8 个指标 · 暂定评分

分数68.780% 区间54.7–82.71/4 实测维度Knowledge score97.0#1 / 70HLE w/o tools60.9#1 / 22
维度与证据
广泛知识68.7
2 个基准族 · 2 个指标
aa_omniscience · aa_omniscience_index · z 1.60 · q 1.00
benchlm_category_knowledge · benchlm_category_knowledge · z 1.83 · q 1.00
专业知识仅先验
事实性仅先验
检索与开放资料运用仅先验
Knowledge scoreV3 计分证据
站内排名#1
分数97.0
更新时间2026年9月2日
置信度2
HLE w/o tools
站内排名#1
分数60.9
更新时间2026年9月2日
置信度2
Artificial Analysis Intelligence IndexV3 计分证据
站内排名#1
分数65.7
更新时间2026年9月2日
置信度2
AA-GPQA Diamond
站内排名#5
分数93.7
更新时间2026年9月2日
置信度2
AA-HLE
站内排名#1
分数59.1
更新时间2026年9月2日
置信度2
AA-Omniscience IndexV3 计分证据
站内排名#1
分数43.5
更新时间2026年9月2日
置信度2
AA-Omniscience Accuracy
站内排名#1
分数67.2
更新时间2026年9月2日
置信度2
AA-Omniscience Hallucination Rate
站内排名#54
分数72.6
更新时间2026年9月2日
置信度2

数学

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
基础数学仅先验
竞赛数学仅先验
高阶证明仅先验
应用与工具辅助数学仅先验

多语言

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
跨语言理解仅先验
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验

多模态

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
感知与 OCR仅先验
文档与空间理解仅先验
视觉推理仅先验
视频与落地行动仅先验

指令遵循

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化仅先验
多轮与长指令仅先验

替代方案与相似模型

别名

anthropic/claude-fable-5.1

排名基于社区提交的测试数据与定期健康探测,仅供参考,非官方数据。标准基准数据可能包含 BenchLM 等公开来源。

通过 API 获取 LMSpeed 数据

免费

免费的大模型价格、基准测试和服务商数据公开 API

  • 实时价格与可用性
  • 速度与延迟基准测试
  • 300+ 模型,600+ 服务商
  • 每天 1,000 次请求
查看 API 文档