DeepSeek
·Released on 2026年8月12日

DeepSeek V4 Pro 0813 API 基准测试 价格和服务商数据

选择与 DeepSeek V4 Pro 0813 对比的模型

选择一个模型后会直接打开对应的对比页面。

分享到 X
LLM

DeepSeek V4 Pro 0813 is a large-scale mixture-of-experts model from DeepSeek. This is the GA release of DeepSeek V4 Pro.

质量
#26of 100
67.0
LMSpeed 评分

分类性能

基于独立 benchmark family 的实测能力估计,不确定性单独展示。

覆盖
6 / 8
方法论
V3.0
分类性能基于独立 benchmark family 的实测能力估计,不确定性单独展示。智能体57.5代码57.1综合推理61知识58.4数学58.9多语言-多模态-指令遵循54.9
#1综合推理61正式评分全站排名 #23/4 实测维度
80% 区间: 52.669.3
abstract logic仅先验
scientific causal62.7
critpt · critpt / gpqa · aa_gpqa_diamond / hle · aa_hle
multistep constraints59
mmlu_pro · mmlu_pro
evidence verification61.1
lcr · lcr / mrcr · mrcr1m
#2数学58.9估算2/4 实测维度
80% 区间: 46.871.1
foundational math仅先验
competition math61.7
hmmt · hmmt_feb2026
proof frontier56.2
imo · imo_answer_bench
applied tool math仅先验
#3知识58.4暂定评分1/4 实测维度
80% 区间: 40.476.5
broad knowledge仅先验
professional knowledge仅先验
factuality58.4
simpleqa · simple_qa
retrieval open book仅先验
#4智能体57.5正式评分全站排名 #133/4 实测维度
80% 区间: 49.865.2
planning仅先验
tool use58.1
mcp_atlas · mcp_atlas / tau · aa_tau3_banking / tau · tau2_bench / toolathlon · toolathlon
environment execution55.9
browsecomp · browse_comp / gdpval_aa · benchlm_agentic_gdpval_aa / terminalbench · benchlm_agentic_terminal_bench2
recovery reliability58.6
apex_agents · apex_agents_aa / cyber_gym · cyber_gym
#5代码57.1正式评分全站排名 #104/4 实测维度
80% 区间: 50.963.2
code generation58.5
scicode · aa_sci_code
repository engineering62.4
nl2repo · nl2_repo / swe_pro · swe_pro / vibecode · vibe_code_bench
debugging testing56.9
swe_multilingual · benchlm_coding_swe_multilingual / swe_verified · swe_verified
tooling quality50.5
terminalbench · aa_terminal_bench21 / terminalbench · benchlm_coding_terminal_bench2
#6指令遵循54.9暂定评分1/4 实测维度
80% 区间: 38.970.9
constraint following仅先验
structured output仅先验
novel instruction generalization54.9
ifbench · aa_if_bench
long multiturn instruction仅先验
暂无数据:多语言多模态

技术规格

Input and output token limits for this model, plus how it ranks on long-context understanding.

INPUT
1.0Mtokens
1.3K pages of text
OUTPUT
384Ktokens
8K128K1M4M
1.0M

能力

Technical Details

输入
输出
发布日期
Aug 2026
Tokenizer
DeepSeek
架构
text->text
内容审核
支持参数
frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p

排名

擅长

表现尚可

相对落后

详细分数

更新时间: 2026年8月23日

综合

2 个指标

Overall score67.0#26 / 100DeepSWE62.7#8 / 16
Overall score
站内排名#26
分数67.0
更新时间2026年8月23日
置信度2
DeepSWE
站内排名#8
分数62.7
更新时间2026年8月23日
置信度2

智能体

V3.0

17 个指标 · 正式评分

分数57.5#1380% 区间49.8–65.23/4 实测维度Agentic score68.2#25 / 69Terminal-Bench 2.067.9#20 / 53
维度与证据
规划拆解仅先验
工具调用58.1
3 个基准族 · 4 个指标
mcp_atlas · mcp_atlas · z 0.04 · q 1.00
tau · aa_tau3_banking · z 0.59 · q 1.00
tau · tau2_bench · z 0.77 · q 1.00
toolathlon · toolathlon · z 0.38 · q 1.00
环境与长程执行55.9
3 个基准族 · 3 个指标
browsecomp · browse_comp · z 0.28 · q 1.00
gdpval_aa · benchlm_agentic_gdpval_aa · z 0.40 · q 1.00
terminalbench · benchlm_agentic_terminal_bench2 · z 0.27 · q 1.00
恢复与完成可靠性58.6
2 个基准族 · 2 个指标
apex_agents · apex_agents_aa · z -0.04 · q 1.00
cyber_gym · cyber_gym · z 0.72 · q 1.00
Agentic score
站内排名#25
分数68.2
更新时间2026年8月23日
置信度2
Terminal-Bench 2.0V3 计分证据
站内排名#20
分数67.9
更新时间2026年8月23日
置信度2
BrowseCompV3 计分证据
站内排名#12
分数83.4
更新时间2026年8月23日
置信度2
HLE w/ tools
站内排名#2
分数60.0
更新时间2026年8月23日
置信度2
MCP AtlasV3 计分证据
站内排名#16
分数73.6
更新时间2026年8月23日
置信度2
ToolathlonV3 计分证据
站内排名#9
分数51.8
更新时间2026年8月23日
置信度2
Terminal-Bench 2.1
站内排名#1
分数87.9
更新时间2026年8月23日
置信度2
CyberGymV3 计分证据
站内排名#2
分数83.3
更新时间2026年8月23日
置信度2
Toolathlon-Verified
站内排名#2
分数74.1
更新时间2026年8月23日
置信度2
Agents' Last Exam
站内排名#4
分数25.7
更新时间2026年8月23日
置信度2
AutomationBench
站内排名#1
分数31.8
更新时间2026年8月23日
置信度2
GDPval-AAV3 计分证据
站内排名#22
分数1306.0
更新时间2026年8月23日
置信度2
AA Agentic Index
站内排名#9
分数49.6
更新时间2026年8月23日
置信度2
APEX-Agents-AAV3 计分证据
站内排名#13
分数24.3
更新时间2026年8月23日
置信度2
Τ²-bench resultsV3 计分证据
站内排名#12
分数96.2
更新时间2026年8月23日
置信度2
GDPval-AA
站内排名#9
分数54.5
更新时间2026年8月23日
置信度2
AA Tau3 BankingV3 计分证据
站内排名#6
分数39.6
更新时间2026年8月23日
置信度2

代码

V3.0

15 个指标 · 正式评分

分数57.1#1080% 区间50.9–63.24/4 实测维度Coding score57.6#36 / 81Codeforces3206.0#1 / 4
维度与证据
代码生成58.5
1 个基准族 · 1 个指标
scicode · aa_sci_code · z 0.99 · q 1.00
仓库工程62.4
3 个基准族 · 3 个指标
nl2repo · nl2_repo · z 3.00 · q 1.00
swe_pro · swe_pro · z -0.26 · q 1.00
vibecode · vibe_code_bench · z 0.86 · q 1.00
调试与测试56.9
2 个基准族 · 2 个指标
swe_multilingual · benchlm_coding_swe_multilingual · z 0.30 · q 1.00
swe_verified · swe_verified · z 0.80 · q 1.00
工具化开发与质量50.5
1 个基准族 · 2 个指标
terminalbench · aa_terminal_bench21 · z -0.10 · q 1.00
terminalbench · benchlm_coding_terminal_bench2 · z 0.00 · q 1.00
Coding score
站内排名#36
分数57.6
更新时间2026年8月23日
置信度2
Codeforces
站内排名#1
分数3206.0
更新时间2026年8月23日
置信度2
SWE-bench VerifiedV3 计分证据
站内排名#9
分数80.6
更新时间2026年8月23日
置信度2
SWE-bench ProV3 计分证据
站内排名#33
分数55.4
更新时间2026年8月23日
置信度2
SWE MultilingualV3 计分证据
站内排名#10
分数76.2
更新时间2026年8月23日
置信度2
Terminal-Bench 2.0V3 计分证据
站内排名#17
分数67.9
更新时间2026年8月23日
置信度2
LiveCodeBench Pass@1-COT
站内排名#1
分数93.5
更新时间2026年8月23日
置信度2
Terminal-Bench 2.1
站内排名#1
分数87.9
更新时间2026年8月23日
置信度2
NL2RepoV3 计分证据
站内排名#1
分数61.5
更新时间2026年8月23日
置信度2
DSBench-FullStack
站内排名#1
分数71.1
更新时间2026年8月23日
置信度2
DSBench-Hard
站内排名#1
分数67.2
更新时间2026年8月23日
置信度2
Vibe Code BenchV3 计分证据
站内排名#8
分数49.9
更新时间2026年8月23日
置信度2
AA Coding Index
站内排名#21
分数68.8
更新时间2026年8月23日
置信度2
AA-SciCodeV3 计分证据
站内排名#32
分数49.2
更新时间2026年8月23日
置信度2
AA Terminal-Bench 2.1V3 计分证据
站内排名#10
分数78.7
更新时间2026年8月23日
置信度2

综合推理

V3.0

7 个指标 · 正式评分

分数61#280% 区间52.6–69.33/4 实测维度MMLU-Pro87.5%#9 / 129GPQA90.1%#28 / 211
维度与证据
抽象逻辑仅先验
科学与因果推理62.7
3 个基准族 · 3 个指标
critpt · critpt · z 0.83 · q 1.00
gpqa · aa_gpqa_diamond · z 1.27 · q 1.00
hle · aa_hle · z 0.95 · q 1.00
多步约束59
1 个基准族 · 1 个指标
mmlu_pro · mmlu_pro · z 1.00 · q 1.00
证据整合与验证61.1
2 个基准族 · 2 个指标
lcr · lcr · z 0.36 · q 1.00
mrcr · mrcr1m · z 1.52 · q 0.75
MMLU-ProV3 计分证据
站内排名#9
分数87.5%
更新时间2026年8月23日
置信度2
GPQAV3 计分证据
站内排名#28
分数90.1%
更新时间2026年8月23日
置信度2
HLEV3 计分证据
站内排名#16
分数42.7%
更新时间2026年8月23日
置信度2
MRCR 1MV3 计分证据
站内排名#1
分数83.5
更新时间2026年8月23日
置信度2
CorpusQA 1M
站内排名#1
分数62.0
更新时间2026年8月23日
置信度2
AA-LCRV3 计分证据
站内排名#25
分数75.3
更新时间2026年8月23日
置信度2
CritPtV3 计分证据
站内排名#14
分数18.0
更新时间2026年8月23日
置信度2

知识

V3.0

11 个指标 · 暂定评分

分数58.480% 区间40.4–76.51/4 实测维度Knowledge score77.0#20 / 69SimpleQA57.9#1 / 4
维度与证据
广泛知识仅先验
专业知识仅先验
事实性58.4
1 个基准族 · 1 个指标
simpleqa · simple_qa · z 1.39 · q 0.17
检索与开放资料运用仅先验
Knowledge score
站内排名#20
分数77.0
更新时间2026年8月23日
置信度2
SimpleQAV3 计分证据
站内排名#1
分数57.9
更新时间2026年8月23日
置信度2
Chinese-SimpleQA
站内排名#1
分数84.4
更新时间2026年8月23日
置信度2
GPQA-D
站内排名#16
分数90.1
更新时间2026年8月23日
置信度2
Artificial Analysis Intelligence Index
站内排名#15
分数53.2
更新时间2026年8月23日
置信度2
AA-GPQA Diamond
站内排名#10
分数92.8
更新时间2026年8月23日
置信度2
AA-HLE
站内排名#21
分数41.0
更新时间2026年8月23日
置信度2
AA-Omniscience Index
站内排名#37
分数0.8
更新时间2026年8月23日
置信度2
AA-Omniscience Accuracy
站内排名#14
分数49.1
更新时间2026年8月23日
置信度2
AA-Omniscience Hallucination Rate
站内排名#2
分数94.1
更新时间2026年8月23日
置信度2
AA Openness Index
站内排名#1
分数44.4
更新时间2026年8月23日
置信度2

数学

V3.0

5 个指标 · 估算

分数58.980% 区间46.8–71.12/4 实测维度HMMT Feb 202695.2#2 / 18IMOAnswerBench89.8#2 / 7
维度与证据
基础数学仅先验
竞赛数学61.7
1 个基准族 · 1 个指标
hmmt · hmmt_feb2026 · z 1.69 · q 1.00
高阶证明56.2
1 个基准族 · 1 个指标
imo · imo_answer_bench · z 0.34 · q 0.88
应用与工具辅助数学仅先验
HMMT Feb 2026V3 计分证据
站内排名#2
分数95.2
更新时间2026年8月23日
置信度2
IMOAnswerBenchV3 计分证据
站内排名#2
分数89.8
更新时间2026年8月23日
置信度2
Apex
站内排名#2
分数38.3
更新时间2026年8月23日
置信度2
Apex Shortlist
站内排名#1
分数90.2
更新时间2026年8月23日
置信度2
Math score
站内排名#4
分数81.8
更新时间2026年8月23日
置信度2

多语言

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
跨语言理解仅先验
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验

多模态

V3.0

1 个指标 · 暂无数据

80% 区间30.8–69.20/4 实测维度Design Arena Website1258.0#33 / 75
维度与证据
感知与 OCR仅先验
文档与空间理解仅先验
视觉推理仅先验
视频与落地行动仅先验
Design Arena Website
站内排名#33
分数1258.0
更新时间2026年8月23日
置信度2

指令遵循

V3.0

1 个指标 · 暂定评分

分数54.980% 区间38.9–70.91/4 实测维度AA-IFBench76.5#10 / 84
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化54.9
1 个基准族 · 1 个指标
ifbench · aa_if_bench · z 0.38 · q 1.00
多轮与长指令仅先验
AA-IFBenchV3 计分证据
站内排名#10
分数76.5
更新时间2026年8月23日
置信度2

OpenRouter 端点

14 个端点

来自 OpenRouter 的第三方端点数据,和 LMSpeed 自测数据分开展示。部分 30 分钟实时性能字段需要配置 OpenRouter API key 后同步才会出现。

Provider endpoint输入输出1 天在线率30m 延迟30m 吞吐上下文 / 输出
Alibaba
alibaba
$1.16/M$3.48/M100.0%undefined tokens / undefined tokens
DeepSeek
deepseek
$0.660/M$1.98/M100.0%undefined tokens / undefined tokens
DigitalOcean
digitalocean
$1.32/M$3.96/M99.9%undefined tokens / —
Phala
phala
$1.45/M$4.36/M99.9%undefined tokens / undefined tokens
Fireworks
fireworks
$1.32/M$3.96/M99.9%undefined tokens / —
Novita
novita/fp8
$1.32/M$3.96/M99.9%undefined tokens / undefined tokens
GMICloud
gmicloud/fp8
$1.12/M$3.37/M99.9%undefined tokens / —
Sail Research
sail-research/fp4
$1.32/M$3.96/M99.8%undefined tokens / undefined tokens
BaseTen
baseten/fp4
$1.32/M$3.96/M99.5%undefined tokens / undefined tokens
StreamLake
streamlake
$1.32/M$3.96/M99.4%undefined tokens / undefined tokens
Parasail
parasail/fp8
$1.32/M$3.96/M99.4%undefined tokens / undefined tokens
SiliconFlow
siliconflow/fp8
$1.32/M$3.96/M98.6%undefined tokens / undefined tokens
Together
together
$1.32/M$3.96/M98.4%undefined tokens / —
Cloudflare
cloudflare
$1.32/M$3.96/M98.3%undefined tokens / undefined tokens

排名基于社区提交的测试数据与定期健康探测,仅供参考,非官方数据。标准基准数据可能包含 BenchLM 等公开来源。

通过 API 获取 LMSpeed 数据

免费

免费的大模型价格、基准测试和服务商数据公开 API

  • 实时价格与可用性
  • 速度与延迟基准测试
  • 300+ 模型,600+ 服务商
  • 每天 1,000 次请求
查看 API 文档