DeepSeek
·Released on 2026年8月12日DeepSeek V4 Pro 0813 API 基准测试 价格和服务商数据
选择与 DeepSeek V4 Pro 0813 对比的模型
选择一个模型后会直接打开对应的对比页面。
LLM
DeepSeek V4 Pro 0813 is a large-scale mixture-of-experts model from DeepSeek. This is the GA release of DeepSeek V4 Pro.
质量
#26of 100
67.0
LMSpeed 评分
分类性能
基于独立 benchmark family 的实测能力估计,不确定性单独展示。
- 覆盖
- 6 / 8
- 方法论
- V3.0
#1综合推理61正式评分全站排名 #23/4 实测维度
80% 区间: 52.6–69.3
abstract logic仅先验
scientific causal62.7
critpt · critpt / gpqa · aa_gpqa_diamond / hle · aa_hle
multistep constraints59
mmlu_pro · mmlu_pro
evidence verification61.1
lcr · lcr / mrcr · mrcr1m
#2数学58.9估算2/4 实测维度
80% 区间: 46.8–71.1
foundational math仅先验
competition math61.7
hmmt · hmmt_feb2026
proof frontier56.2
imo · imo_answer_bench
applied tool math仅先验
#3知识58.4暂定评分1/4 实测维度
80% 区间: 40.4–76.5
broad knowledge仅先验
professional knowledge仅先验
factuality58.4
simpleqa · simple_qa
retrieval open book仅先验
#4智能体57.5正式评分全站排名 #133/4 实测维度
80% 区间: 49.8–65.2
planning仅先验
tool use58.1
mcp_atlas · mcp_atlas / tau · aa_tau3_banking / tau · tau2_bench / toolathlon · toolathlon
environment execution55.9
browsecomp · browse_comp / gdpval_aa · benchlm_agentic_gdpval_aa / terminalbench · benchlm_agentic_terminal_bench2
recovery reliability58.6
apex_agents · apex_agents_aa / cyber_gym · cyber_gym
#5代码57.1正式评分全站排名 #104/4 实测维度
80% 区间: 50.9–63.2
code generation58.5
scicode · aa_sci_code
repository engineering62.4
nl2repo · nl2_repo / swe_pro · swe_pro / vibecode · vibe_code_bench
debugging testing56.9
swe_multilingual · benchlm_coding_swe_multilingual / swe_verified · swe_verified
tooling quality50.5
terminalbench · aa_terminal_bench21 / terminalbench · benchlm_coding_terminal_bench2
#6指令遵循54.9暂定评分1/4 实测维度
80% 区间: 38.9–70.9
constraint following仅先验
structured output仅先验
novel instruction generalization54.9
ifbench · aa_if_bench
long multiturn instruction仅先验
暂无数据:多语言多模态
技术规格
Input and output token limits for this model, plus how it ranks on long-context understanding.
INPUT
1.0Mtokens
≈ 1.3K pages of text
OUTPUT
384Ktokens
8K128K1M4M
1.0M
能力
排名
擅长
表现尚可
相对落后
详细分数
更新时间: 2026年8月23日综合
2 个指标
Overall score67.0#26 / 100DeepSWE62.7#8 / 16
综合
2 个指标
基准
站内排名
分数
来源
更新时间
置信度
智能体
V3.017 个指标 · 正式评分
分数57.5#1380% 区间49.8–65.23/4 实测维度Agentic score68.2#25 / 69Terminal-Bench 2.067.9#20 / 53
智能体
V3.017 个指标 · 正式评分
维度与证据
规划拆解仅先验
工具调用58.1
3 个基准族 · 4 个指标
mcp_atlas · mcp_atlas · z 0.04 · q 1.00
tau · aa_tau3_banking · z 0.59 · q 1.00
tau · tau2_bench · z 0.77 · q 1.00
toolathlon · toolathlon · z 0.38 · q 1.00
环境与长程执行55.9
3 个基准族 · 3 个指标
browsecomp · browse_comp · z 0.28 · q 1.00
gdpval_aa · benchlm_agentic_gdpval_aa · z 0.40 · q 1.00
terminalbench · benchlm_agentic_terminal_bench2 · z 0.27 · q 1.00
恢复与完成可靠性58.6
2 个基准族 · 2 个指标
apex_agents · apex_agents_aa · z -0.04 · q 1.00
cyber_gym · cyber_gym · z 0.72 · q 1.00
基准
站内排名
分数
来源
更新时间
置信度
代码
V3.015 个指标 · 正式评分
分数57.1#1080% 区间50.9–63.24/4 实测维度Coding score57.6#36 / 81Codeforces3206.0#1 / 4
代码
V3.015 个指标 · 正式评分
维度与证据
代码生成58.5
1 个基准族 · 1 个指标
scicode · aa_sci_code · z 0.99 · q 1.00
仓库工程62.4
3 个基准族 · 3 个指标
nl2repo · nl2_repo · z 3.00 · q 1.00
swe_pro · swe_pro · z -0.26 · q 1.00
vibecode · vibe_code_bench · z 0.86 · q 1.00
调试与测试56.9
2 个基准族 · 2 个指标
swe_multilingual · benchlm_coding_swe_multilingual · z 0.30 · q 1.00
swe_verified · swe_verified · z 0.80 · q 1.00
工具化开发与质量50.5
1 个基准族 · 2 个指标
terminalbench · aa_terminal_bench21 · z -0.10 · q 1.00
terminalbench · benchlm_coding_terminal_bench2 · z 0.00 · q 1.00
基准
站内排名
分数
来源
更新时间
置信度
综合推理
V3.07 个指标 · 正式评分
分数61#280% 区间52.6–69.33/4 实测维度MMLU-Pro87.5%#9 / 129GPQA90.1%#28 / 211
综合推理
V3.07 个指标 · 正式评分
维度与证据
抽象逻辑仅先验
科学与因果推理62.7
3 个基准族 · 3 个指标
critpt · critpt · z 0.83 · q 1.00
gpqa · aa_gpqa_diamond · z 1.27 · q 1.00
hle · aa_hle · z 0.95 · q 1.00
多步约束59
1 个基准族 · 1 个指标
mmlu_pro · mmlu_pro · z 1.00 · q 1.00
证据整合与验证61.1
2 个基准族 · 2 个指标
lcr · lcr · z 0.36 · q 1.00
mrcr · mrcr1m · z 1.52 · q 0.75
基准
站内排名
分数
来源
更新时间
置信度
知识
V3.011 个指标 · 暂定评分
分数58.480% 区间40.4–76.51/4 实测维度Knowledge score77.0#20 / 69SimpleQA57.9#1 / 4
知识
V3.011 个指标 · 暂定评分
维度与证据
广泛知识仅先验
专业知识仅先验
事实性58.4
1 个基准族 · 1 个指标
simpleqa · simple_qa · z 1.39 · q 0.17
检索与开放资料运用仅先验
基准
站内排名
分数
来源
更新时间
置信度
数学
V3.05 个指标 · 估算
分数58.980% 区间46.8–71.12/4 实测维度HMMT Feb 202695.2#2 / 18IMOAnswerBench89.8#2 / 7
数学
V3.05 个指标 · 估算
维度与证据
基础数学仅先验
竞赛数学61.7
1 个基准族 · 1 个指标
hmmt · hmmt_feb2026 · z 1.69 · q 1.00
高阶证明56.2
1 个基准族 · 1 个指标
imo · imo_answer_bench · z 0.34 · q 0.88
应用与工具辅助数学仅先验
基准
站内排名
分数
来源
更新时间
置信度
多语言
V3.00 个指标 · 暂无数据
暂无数据80% 区间30.8–69.20/4 实测维度
多语言
V3.00 个指标 · 暂无数据
维度与证据
跨语言理解仅先验
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验
多模态
V3.01 个指标 · 暂无数据
80% 区间30.8–69.20/4 实测维度Design Arena Website1258.0#33 / 75
多模态
V3.01 个指标 · 暂无数据
维度与证据
感知与 OCR仅先验
文档与空间理解仅先验
视觉推理仅先验
视频与落地行动仅先验
基准
站内排名
分数
来源
更新时间
置信度
指令遵循
V3.01 个指标 · 暂定评分
分数54.980% 区间38.9–70.91/4 实测维度AA-IFBench76.5#10 / 84
指令遵循
V3.01 个指标 · 暂定评分
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化54.9
1 个基准族 · 1 个指标
ifbench · aa_if_bench · z 0.38 · q 1.00
多轮与长指令仅先验
基准
站内排名
分数
来源
更新时间
置信度
OpenRouter 端点
14 个端点来自 OpenRouter 的第三方端点数据,和 LMSpeed 自测数据分开展示。部分 30 分钟实时性能字段需要配置 OpenRouter API key 后同步才会出现。
| Provider endpoint | 输入 | 输出 | 1 天在线率 | 30m 延迟 | 30m 吞吐 | 上下文 / 输出 |
|---|---|---|---|---|---|---|
Alibaba alibaba | $1.16/M | $3.48/M | 100.0% | — | — | undefined tokens / undefined tokens |
DeepSeek deepseek | $0.660/M | $1.98/M | 100.0% | — | — | undefined tokens / undefined tokens |
DigitalOcean digitalocean | $1.32/M | $3.96/M | 99.9% | — | — | undefined tokens / — |
Phala phala | $1.45/M | $4.36/M | 99.9% | — | — | undefined tokens / undefined tokens |
Fireworks fireworks | $1.32/M | $3.96/M | 99.9% | — | — | undefined tokens / — |
Novita novita/fp8 | $1.32/M | $3.96/M | 99.9% | — | — | undefined tokens / undefined tokens |
GMICloud gmicloud/fp8 | $1.12/M | $3.37/M | 99.9% | — | — | undefined tokens / — |
Sail Research sail-research/fp4 | $1.32/M | $3.96/M | 99.8% | — | — | undefined tokens / undefined tokens |
BaseTen baseten/fp4 | $1.32/M | $3.96/M | 99.5% | — | — | undefined tokens / undefined tokens |
StreamLake streamlake | $1.32/M | $3.96/M | 99.4% | — | — | undefined tokens / undefined tokens |
Parasail parasail/fp8 | $1.32/M | $3.96/M | 99.4% | — | — | undefined tokens / undefined tokens |
SiliconFlow siliconflow/fp8 | $1.32/M | $3.96/M | 98.6% | — | — | undefined tokens / undefined tokens |
Together together | $1.32/M | $3.96/M | 98.4% | — | — | undefined tokens / — |
Cloudflare cloudflare | $1.32/M | $3.96/M | 98.3% | — | — | undefined tokens / undefined tokens |
