Anthropic
·Released on 2026年5月27日

Claude Opus 4.8 API 基准测试 价格和服务商数据

选择与 Claude Opus 4.8 对比的模型

选择一个模型后会直接打开对应的对比页面。

分享到 X
LLM

Claude Opus 4.8 页面汇总基准测试、API 价格和服务商数据,覆盖 718 家服务商,价格从 $0.015/M 起。Claude Opus 4.8 免费 API 额度来自 6 家服务商。页面同时展示实测速度和首字延迟。

Anthropic 的 Claude Opus 4.8是旗舰大语言模型,专为高复杂度通用任务与多步推理优化。

质量
#10of 112
73.0
LMSpeed 评分
速度
193char/s
4.02 s
成本
#168of 186
$0.015/ 1M · 8:1 in:out
$0.0024 in · $0.013 out

分类性能

基于独立 benchmark family 的实测能力估计,不确定性单独展示。

覆盖
8 / 8
方法论
V3.0
分类性能基于独立 benchmark family 的实测能力估计,不确定性单独展示。智能体61.8代码64综合推理55.9知识62.1数学57.2多语言55多模态59指令遵循50
#1代码64正式评分全站排名 #44/4 实测维度
80% 区间: 57.470.6
code generation59.5
scicode · scicode
repository engineering66.1
swe_pro · swe_pro
debugging testing77.2
swe_multilingual · benchlm_coding_swe_multilingual / swe_verified · swe_verified
tooling quality53.1
terminalbench · benchlm_coding_terminal_bench2
#2知识62.1暂定评分1/4 实测维度
80% 区间: 48.276.1
broad knowledge62.1
aa_omniscience · aa_omniscience_index / benchlm_category_knowledge · benchlm_category_knowledge
professional knowledge仅先验
factuality仅先验
retrieval open book仅先验
#3智能体61.8正式评分全站排名 #84/4 实测维度
80% 区间: 56.367.3
planning63.1
deep_planning · gert_labs
tool use62.9
mcp_atlas · mcp_atlas / tau · tau2_bench / toolathlon · toolathlon
environment execution61.2
browsecomp · browse_comp / deep_search_qa · deep_search_qa / gdpval_aa · benchlm_agentic_gdpval_aa / osworld · os_world2 / osworld · os_world_verified / terminalbench · benchlm_agentic_terminal_bench2
recovery reliability60.3
harvey_lab · aa_harvey_lab / researchclaw · research_claw_bench
#4多模态59估算2/4 实测维度
80% 区间: 47.070.9
perception ocr仅先验
document spatial58.6
charxiv · charxiv
visual reasoning仅先验
video action59.3
screenspot · screen_spot_pro
#5数学57.2暂定评分1/4 实测维度
80% 区间: 41.173.2
foundational math仅先验
competition math仅先验
proof frontier57.2
frontiermath · frontier_math_v2_tier4 / frontiermath · frontier_math_v2_tiers13
applied tool math仅先验
#6综合推理55.9正式评分全站排名 #153/4 实测维度
80% 区间: 47.264.6
abstract logic50
arc_agi · arc_agi2
scientific causal63
critpt · critpt / gpqa · gpqa / hle · hle / hle · hle_no_tools
multistep constraints仅先验
evidence verification54.8
lcr · lcr
#7多语言55暂定评分1/4 实测维度
80% 区间: 37.972.2
cross language understanding55
include · include
multilingual generation仅先验
reasoning transfer仅先验
low resource robustness仅先验
#8指令遵循50暂定评分1/4 实测维度
80% 区间: 34.066.0
constraint following仅先验
structured output仅先验
novel instruction generalization50
ifbench · aa_if_bench
long multiturn instruction仅先验

技术规格

Input and output token limits for this model, plus how it ranks on long-context understanding.

INPUT
1Mtokens
1.2K pages of text
OUTPUT
128Ktokens
8K128K1M4M
1M

能力

Technical Details

输入
输出
发布日期
May 2026
官方文档
Tokenizer
Claude
架构
text+image+file->text
内容审核
支持参数
include_reasoningmax_completion_tokensmax_tokensreasoningreasoning_effortresponse_formatstopstructured_outputstemperaturetool_choicetoolsverbosity

排名

擅长

表现尚可

相对落后

详细分数

更新时间: 2026年9月14日

综合

3 个指标

Overall score73.0#10 / 112Factuality hallucination rate3.4#1 / 4
Overall score
站内排名#10
分数73.0
更新时间2026年9月14日
置信度4
Factuality hallucination rate
站内排名#1
分数3.4
更新时间2026年8月20日
置信度3
HackerBench harmful compliance
站内排名#3
分数22.8
更新时间2026年8月20日
置信度3

价格

2 个指标

输入价格$5.00/M#168 / 186输出价格$25.00/M#169 / 186
输入价格
Input price
站内排名#168
分数$5.00/M
更新时间2026年9月14日
置信度4
输出价格
Output price
站内排名#169
分数$25.00/M
更新时间2026年9月14日
置信度4

智能体

V3.0

20 个指标 · 正式评分

分数61.8#880% 区间56.3–67.34/4 实测维度Agentic score76.7#22 / 77Terminal-Bench 2.074.6#14 / 53
维度与证据
规划拆解63.1
1 个基准族 · 1 个指标
deep_planning · gert_labs · z 1.75 · q 1.00
工具调用62.9
3 个基准族 · 3 个指标
mcp_atlas · mcp_atlas · z 0.95 · q 1.00
tau · tau2_bench · z 0.56 · q 1.00
toolathlon · toolathlon · z 1.22 · q 1.00
环境与长程执行61.2
5 个基准族 · 6 个指标
browsecomp · browse_comp · z 0.27 · q 1.00
deep_search_qa · deep_search_qa · z 0.89 · q 1.00
gdpval_aa · benchlm_agentic_gdpval_aa · z 1.07 · q 1.00
osworld · os_world2 · z 0.00 · q 1.00
osworld · os_world_verified · z 1.12 · q 1.00
terminalbench · benchlm_agentic_terminal_bench2 · z 0.75 · q 1.00
恢复与完成可靠性60.3
2 个基准族 · 2 个指标
harvey_lab · aa_harvey_lab · z 0.06 · q 1.00
researchclaw · research_claw_bench · z 0.90 · q 1.00
Agentic score
站内排名#22
分数76.7
更新时间2026年9月14日
置信度4
Terminal-Bench 2.0V3 计分证据
站内排名#14
分数74.6
更新时间2026年9月14日
置信度4
BrowseCompV3 计分证据
站内排名#10
分数84.3
更新时间2026年9月14日
置信度4
DeepSearchQAV3 计分证据
站内排名#3
分数93.1
更新时间2026年9月14日
置信度4
OSWorld-VerifiedV3 计分证据
站内排名#4
分数83.4
更新时间2026年9月14日
置信度4
Finance Agent v2
站内排名#4
分数53.9
更新时间2026年9月14日
置信度4
GDPval-AAV3 计分证据
站内排名#11
分数1593.0
更新时间2026年9月14日
置信度4
MCP AtlasV3 计分证据
站内排名#5
分数82.2
更新时间2026年9月14日
置信度4
ToolathlonV3 计分证据
站内排名#2
分数59.9
更新时间2026年9月14日
置信度4
Gert LabsV3 计分证据
站内排名#1
分数73.0
更新时间2026年9月14日
置信度4
AA Agentic Index
站内排名#18
分数42.6
更新时间2026年9月14日
置信度4
Τ²-bench resultsV3 计分证据
站内排名#22
分数94.4
更新时间2026年9月14日
置信度4
GDPval-AA
站内排名#14
分数49.5
更新时间2026年9月14日
置信度4
ResearchClawBenchV3 计分证据
站内排名#1
分数21.1
更新时间2026年9月14日
置信度4
OSWorld 2.0V3 计分证据
站内排名#10
分数20.6
更新时间2026年9月14日
置信度4
Terminal-Bench 3.0
站内排名#5
分数21.1
更新时间2026年9月14日
置信度4
Terminal-Bench 2.1 (Vals)
站内排名#16
分数71.9
更新时间2026年9月14日
置信度4
AA-AnalystAgent
站内排名#9
分数45.0
更新时间2026年9月14日
置信度4
AA AutomationBench
站内排名#16
分数48.5
更新时间2026年9月8日
置信度4
AA Harvey LABV3 计分证据
站内排名#7
分数91.1
更新时间2026年9月1日
置信度3

代码

V3.0

21 个指标 · 正式评分

分数64#480% 区间57.4–70.64/4 实测维度SciCode54.4%#17 / 89Coding score73.1#10 / 87
维度与证据
代码生成59.5
1 个基准族 · 1 个指标
scicode · scicode · z 1.09 · q 1.00
仓库工程66.1
1 个基准族 · 1 个指标
swe_pro · swe_pro · z 2.24 · q 1.00
调试与测试77.2
2 个基准族 · 2 个指标
swe_multilingual · benchlm_coding_swe_multilingual · z 2.17 · q 1.00
swe_verified · swe_verified · z 3.00 · q 1.00
工具化开发与质量53.1
1 个基准族 · 1 个指标
terminalbench · benchlm_coding_terminal_bench2 · z 0.44 · q 1.00
SciCodeV3 计分证据
站内排名#17
分数54.4%
更新时间2026年9月14日
置信度4
Coding score
站内排名#10
分数73.1
更新时间2026年9月14日
置信度4
SWE-bench VerifiedV3 计分证据
站内排名#3
分数88.6
更新时间2026年9月14日
置信度4
SWE-bench ProV3 计分证据
站内排名#4
分数69.2
更新时间2026年9月14日
置信度4
SWE MultilingualV3 计分证据
站内排名#3
分数84.4
更新时间2026年9月14日
置信度4
SWE Multimodal
站内排名#3
分数38.4
更新时间2026年9月14日
置信度4
Terminal-Bench 2.0V3 计分证据
站内排名#11
分数74.6
更新时间2026年9月14日
置信度4
CursorBench v3.1
站内排名#3
分数58.4
更新时间2026年9月14日
置信度4
AA Coding Index
站内排名#13
分数74.3
更新时间2026年9月14日
置信度4
AA-SciCodeV3 计分证据
站内排名#21
分数54.4
更新时间2026年9月14日
置信度4
CursorBench v3.2
站内排名#9
分数62.3
更新时间2026年9月14日
置信度4
FrontierCode 1.1 Main
站内排名#4
分数46.5
更新时间2026年9月14日
置信度4
LiveCodeBench (Vals)
站内排名#10
分数87.8
更新时间2026年9月14日
置信度4
SWE-bench (Vals)
站内排名#10
分数88.6
更新时间2026年9月14日
置信度4
APEX-SWE
站内排名#7
分数43.9
更新时间2026年8月20日
置信度3
EEBench
站内排名#3
分数51.4
更新时间2026年8月20日
置信度3
3DCodeBench
站内排名#3
分数47.0
更新时间2026年8月20日
置信度3
CADGenBench Generation
站内排名#6
分数27.4
更新时间2026年8月20日
置信度3
SpaceXAI MTS Eval
站内排名#3
分数55.8
更新时间2026年8月20日
置信度3
InferenceEval
站内排名#4
分数40.7
更新时间2026年8月20日
置信度3
KernelBench Internal
站内排名#4
分数67.6
更新时间2026年8月20日
置信度3

综合推理

V3.0

7 个指标 · 正式评分

分数55.9#1580% 区间47.2–64.63/4 实测维度GPQA92.0%#20 / 218HLE48.7%#8 / 216
维度与证据
抽象逻辑50
1 个基准族 · 1 个指标
arc_agi · arc_agi2 · z -0.08 · q 1.00
科学与因果推理63
3 个基准族 · 4 个指标
critpt · critpt · z 0.81 · q 1.00
gpqa · gpqa · z 1.11 · q 1.00
hle · hle · z 1.09 · q 1.00
hle · hle_no_tools · z 0.78 · q 1.00
多步约束仅先验
证据整合与验证54.8
1 个基准族 · 1 个指标
lcr · lcr · z 0.28 · q 1.00
GPQAV3 计分证据
站内排名#20
分数92.0%
更新时间2026年9月14日
置信度4
HLEV3 计分证据
站内排名#8
分数48.7%
更新时间2026年9月14日
置信度4
AA-LCRV3 计分证据
站内排名#37
分数77.7
更新时间2026年9月14日
置信度4
CritPtV3 计分证据
站内排名#13
分数20.9
更新时间2026年9月14日
置信度4
Reasoning score
站内排名#53
分数55.5
更新时间2026年9月14日
置信度4
ARC-AGI-2V3 计分证据
站内排名#12
分数72.1
更新时间2026年9月14日
置信度4
ARC-AGI-3
站内排名#4
分数1.5
更新时间2026年9月14日
置信度4

知识

V3.0

11 个指标 · 暂定评分

分数62.180% 区间48.2–76.11/4 实测维度Knowledge score86.3#6 / 83GPQA-D93.6#5 / 32
维度与证据
广泛知识62.1
2 个基准族 · 2 个指标
aa_omniscience · aa_omniscience_index · z 1.09 · q 1.00
benchlm_category_knowledge · benchlm_category_knowledge · z 0.99 · q 1.00
专业知识仅先验
事实性仅先验
检索与开放资料运用仅先验
Knowledge scoreV3 计分证据
站内排名#6
分数86.3
更新时间2026年9月14日
置信度4
GPQA-D
站内排名#5
分数93.6
更新时间2026年9月14日
置信度4
HLE w/o tools
站内排名#4
分数49.8
更新时间2026年9月14日
置信度4
Artificial Analysis Intelligence IndexV3 计分证据
站内排名#19
分数42.0
更新时间2026年9月14日
置信度4
AA-GPQA Diamond
站内排名#21
分数92.0
更新时间2026年9月14日
置信度4
AA-HLE
站内排名#6
分数48.7
更新时间2026年9月14日
置信度4
AA-Omniscience IndexV3 计分证据
站内排名#8
分数28.8
更新时间2026年9月14日
置信度4
AA-Omniscience Accuracy
站内排名#19
分数48.8
更新时间2026年9月14日
置信度4
AA-Omniscience Hallucination Rate
站内排名#88
分数39.3
更新时间2026年9月14日
置信度4
GPQA Diamond (Vals)
站内排名#16
分数92.4
更新时间2026年9月14日
置信度4
MMLU-Pro (Vals)
站内排名#7
分数89.6
更新时间2026年9月14日
置信度4

数学

V3.0

4 个指标 · 暂定评分

分数57.280% 区间41.1–73.21/4 实测维度USAMO 202696.7#1 / 2Math score65.4#23 / 63
维度与证据
基础数学仅先验
竞赛数学仅先验
高阶证明57.2
1 个基准族 · 2 个指标
frontiermath · frontier_math_v2_tier4 · z 1.01 · q 1.00
frontiermath · frontier_math_v2_tiers13 · z 0.60 · q 1.00
应用与工具辅助数学仅先验
USAMO 2026
站内排名#1
分数96.7
更新时间2026年9月14日
置信度4
Math score
站内排名#23
分数65.4
更新时间2026年9月14日
置信度4
FrontierMath v2 (Tiers 1-3)V3 计分证据
站内排名#8
分数47.2
更新时间2026年9月14日
置信度4
FrontierMath v2 (Tier 4)V3 计分证据
站内排名#8
分数31.3
更新时间2026年9月14日
置信度4

多语言

V3.0

1 个指标 · 暂定评分

分数5580% 区间37.9–72.21/4 实测维度INCLUDE87.6#2 / 4
维度与证据
跨语言理解55
1 个基准族 · 1 个指标
include · include · z 0.35 · q 0.33
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验
INCLUDEV3 计分证据
站内排名#2
分数87.6
更新时间2026年9月14日
置信度4

多模态

V3.0

6 个指标 · 估算

分数5980% 区间47.0–70.92/4 实测维度Multimodal Grounded score87.8#4 / 56OfficeQA Pro66.2#2 / 10
维度与证据
感知与 OCR仅先验
文档与空间理解58.6
1 个基准族 · 1 个指标
charxiv · charxiv · z 1.30 · q 1.00
视觉推理仅先验
视频与落地行动59.3
1 个基准族 · 1 个指标
screenspot · screen_spot_pro · z 0.90 · q 1.00
Multimodal Grounded score
站内排名#4
分数87.8
更新时间2026年9月14日
置信度4
OfficeQA Pro
站内排名#2
分数66.2
更新时间2026年9月14日
置信度4
ScreenSpot ProV3 计分证据
站内排名#2
分数87.9
更新时间2026年9月14日
置信度4
CharXivV3 计分证据
站内排名#5
分数89.9
更新时间2026年9月14日
置信度4
CharXiv w/o tools
站内排名#7
分数80.5
更新时间2026年9月14日
置信度4
Design Arena Website
站内排名#31
分数1267.0
更新时间2026年9月14日
置信度4

指令遵循

V3.0

2 个指标 · 暂定评分

分数5080% 区间34.0–66.01/4 实测维度AA-IFBench62.2#48 / 84Instruction Following score75.4#43 / 52
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化50
1 个基准族 · 1 个指标
ifbench · aa_if_bench · z -0.28 · q 1.00
多轮与长指令仅先验
AA-IFBenchV3 计分证据
站内排名#48
分数62.2
更新时间2026年9月14日
置信度4
Instruction Following score
站内排名#43
分数75.4
更新时间2026年9月14日
置信度4

OpenRouter 端点

11 个端点

来自 OpenRouter 的第三方端点数据,和 LMSpeed 自测数据分开展示。部分 30 分钟实时性能字段需要配置 OpenRouter API key 后同步才会出现。

Provider endpoint输入输出1 天在线率30m 延迟30m 吞吐上下文 / 输出
Amazon Bedrock
amazon-bedrock/eu-west-1
$5.50/M$27.50/M100%undefined tokens / undefined tokens
Anthropic
anthropic/fast
$10/M$50/M100%undefined tokens / undefined tokens
Google
google-vertex/global
$5/M$25/M100.0%undefined tokens / undefined tokens
Claude Platform on AWS
claude-on-aws
$5/M$25/M100.0%undefined tokens / undefined tokens
Amazon Bedrock
amazon-bedrock
$5/M$25/M100.0%undefined tokens / undefined tokens
Azure
azure/us
$5/M$25/M99.9%undefined tokens / undefined tokens
Anthropic
anthropic
$5/M$25/M99.9%undefined tokens / undefined tokens
Azure
azure/global
$5/M$25/Mundefined tokens / undefined tokens
Google
google-vertex/us
$5.50/M$27.50/Mundefined tokens / undefined tokens
Google
google-vertex/europe
$5.50/M$27.50/Mundefined tokens / undefined tokens
Amazon Bedrock
amazon-bedrock/us
$5.50/M$27.50/Mundefined tokens / undefined tokens

价格对比

对比 Claude Opus 4.8 在 712 家服务商的 API 价格。价格从 $0.015/M 到 $16900.00/M,其中 熊猫 API 提供最低价 $0.015/M。 6 家服务商提供免费 API 额度或免费套餐。

服务商健康度模型变体分组输入 ($/M)输出 ($/M)速度 (t/s)首字延迟检测
L1
100%
L2
100%
claude-opus-4-8
Claude-Code
-90%$0.500/M
Cache read$0.050/MCache write$0.625/MCache write 1h$1.00/M
-90%$2.50/M
89.1 t/s
3.21 s
L1
100%
claude-opus-4-8
Claude-Corp
-97%$0.169/M
Cache read$0.017/MCache write$0.211/MCache write 1h$0.338/M
-97%$0.844/M
50.5 t/s
4.82 s
L1
99%
claude-opus-4-8
claude-antig
-73%$1.37/M
Cache read$0.137/MCache write$1.71/MCache write 1h$2.74/M
-73%$6.85/M
46.6 t/s
3.31 s
L1
99%
claude-opus-4-8-thinking
claude-1
-73%$1.37/M
Cache read$0.137/MCache write$1.71/MCache write 1h$2.74/M
-73%$6.85/M
L1
100%
claude-opus-4-8
Claude-Entry
-94%$0.300/M
Cache read$0.030/M
-94%$1.50/M
46.4 t/s
2.54 s
L1
99%
claude-opus-4-8
default
-20%$4.00/M
Cache read$0.400/MCache write$5.00/MCache write 1h$8.00/M
-20%$20.00/M
45.6 t/s
2.08 s
L1
100%
claude-opus-4-8-low
claude_kiro
-65%$1.75/M
-65%$8.75/M
L1
100%
claude-opus-4-8-xhigh
claude_kiro
-65%$1.75/M
-65%$8.75/M
L1
100%
claude-opus-4-8-medium
claude_kiro
-65%$1.75/M
-65%$8.75/M
L1
100%
claude-opus-4-8-high
claude_kiro
-65%$1.75/M
-65%$8.75/M
L1
100%
claude-opus-4-8
claude_kiro
-65%$1.75/M
-65%$8.75/M
L1
100%
claude-opus-4-8-thinking
claude_kiro
-65%$1.75/M
-65%$8.75/M
L1
100%
claude-opus-4-8-max
claude_kiro
-65%$1.75/M
-65%$8.75/M
L1
100%
claude-opus-4-8
default
-93%$0.342/M
Cache read$0.034/M
-93%$1.71/M
L1
100%
claude-opus-4-8
cc
-64%$1.79/M
Cache read$0.179/M
-64%$8.93/M
L1
100%
claude-opus-4-8
default
$0.068/request
-
L1
100%
claude-opus-4-8-thinking
default
-86%$0.685/M
Cache read$0.068/MCache write$0.856/MCache write 1h$1.37/M
-86%$3.42/M
L1
100%
claude-opus-4-8
CC-KIRO
-97%$0.154/M
Cache read$0.015/M
-97%$0.768/M
L1
100%
claude-opus-4-8
default
-93%$0.342/M
Cache read$0.034/M
-93%$1.71/M
L1
100%
claude-opus-4-8
default
$5.00/M
Cache read$0.500/M
$25.00/M
当前显示 20 个模型 ID,共 173 个。

替代方案与相似模型

常见问题

Claude Opus 4.8 包含哪些基准测试数据?
LMSpeed 会在数据可用时展示 Claude Opus 4.8 的基准测试、API 价格、输出速度、首字延迟和 718 家服务商数据。
Claude Opus 4.8 API 价格是多少?
Claude Opus 4.8 在 718 家服务商有价格记录,价格从 $0.015/M$16900.00/M。最低价由 熊猫 API 提供。
Claude Opus 4.8 API 价格表包含什么?
Claude Opus 4.8 API 价格表会对比 718 家服务商的输入价格、输出价格、免费额度、速度、首字延迟和近期健康数据。
哪家服务商的 Claude Opus 4.8 API 价格最低?
熊猫 API 当前提供 Claude Opus 4.8 的最低收录价格:$0.015/M,共对比 718 家服务商。
可以同时对比 Claude Opus 4.8 API 价格和速度吗?
可以。LMSpeed 会在同一页展示 Claude Opus 4.8 API 价格、输出速度、首字延迟和服务商健康数据,方便一起比较成本和性能。
Claude Opus 4.8 的 API 免费吗?
是的,Claude Opus 4.8 免费 API 可通过 LMSpeed 上的 6 家服务商使用,包括兔子API, 我不是AI神, 我不是AI神, 兔子API, 兔子API。这些服务商提供免费 API 额度或免费套餐,无需按 token 计费。
哪里可以使用 Claude Opus 4.8 免费 API?
LMSpeed 当前收录了 6 家 Claude Opus 4.8 免费 API 服务商,包括兔子API, 我不是AI神, 我不是AI神, 兔子API, 兔子API。免费额度和限制可能变化,使用前请查看每一行服务商数据。

别名

26479061/claude-opus-4.83h15pm/claude-opus-4.8Claude-Opus-4.8[L]c/claude-opus-4-8[hm]q|aws测/claude-opus-4-8

排名基于社区提交的测试数据与定期健康探测,仅供参考,非官方数据。标准基准数据可能包含 BenchLM 等公开来源。

通过 API 获取 LMSpeed 数据

免费

免费的大模型价格、基准测试和服务商数据公开 API

  • 实时价格与可用性
  • 速度与延迟基准测试
  • 300+ 模型,600+ 服务商
  • 每天 1,000 次请求
查看 API 文档