DeepSeek
·Released on Aug 12, 2026

DeepSeek V4 Pro 0813 API Benchmarks, Pricing & Provider Data

Compare DeepSeek V4 Pro 0813 with another model

Choose a model to open its comparison page.

Share on X
LLM

DeepSeek V4 Pro 0813 is a large-scale mixture-of-experts model from DeepSeek. This is the GA release of DeepSeek V4 Pro.

Quality
#26of 100
67.0
LMSpeed score

Category Performance

Observed-capability estimates with uncertainty reported separately from independent benchmark families.

Coverage
6 / 8
Methodology
V3.0
Category PerformanceObserved-capability estimates with uncertainty reported separately from independent benchmark families.Agents57.5Coding57.1Reasoning61Knowledge58.4Math58.9Multilingual-Multimodal-Instruction following54.9
#1Reasoning61RatedGlobal rank #23/4 Measured dimensions
80% interval: 52.669.3
abstract logicPrior only
scientific causal62.7
critpt · critpt / gpqa · aa_gpqa_diamond / hle · aa_hle
multistep constraints59
mmlu_pro · mmlu_pro
evidence verification61.1
lcr · lcr / mrcr · mrcr1m
#2Math58.9Estimated2/4 Measured dimensions
80% interval: 46.871.1
foundational mathPrior only
competition math61.7
hmmt · hmmt_feb2026
proof frontier56.2
imo · imo_answer_bench
applied tool mathPrior only
#3Knowledge58.4Provisional1/4 Measured dimensions
80% interval: 40.476.5
broad knowledgePrior only
professional knowledgePrior only
factuality58.4
simpleqa · simple_qa
retrieval open bookPrior only
#4Agents57.5RatedGlobal rank #133/4 Measured dimensions
80% interval: 49.865.2
planningPrior only
tool use58.1
mcp_atlas · mcp_atlas / tau · aa_tau3_banking / tau · tau2_bench / toolathlon · toolathlon
environment execution55.9
browsecomp · browse_comp / gdpval_aa · benchlm_agentic_gdpval_aa / terminalbench · benchlm_agentic_terminal_bench2
recovery reliability58.6
apex_agents · apex_agents_aa / cyber_gym · cyber_gym
#5Coding57.1RatedGlobal rank #104/4 Measured dimensions
80% interval: 50.963.2
code generation58.5
scicode · aa_sci_code
repository engineering62.4
nl2repo · nl2_repo / swe_pro · swe_pro / vibecode · vibe_code_bench
debugging testing56.9
swe_multilingual · benchlm_coding_swe_multilingual / swe_verified · swe_verified
tooling quality50.5
terminalbench · aa_terminal_bench21 / terminalbench · benchlm_coding_terminal_bench2
#6Instruction following54.9Provisional1/4 Measured dimensions
80% interval: 38.970.9
constraint followingPrior only
structured outputPrior only
novel instruction generalization54.9
ifbench · aa_if_bench
long multiturn instructionPrior only
No data:MultilingualMultimodal

Specifications

Input and output token limits for this model, plus how it ranks on long-context understanding.

INPUT
1.0Mtokens
1.3K pages of text
OUTPUT
384Ktokens
8K128K1M4M
1.0M

Features

Technical Details

Input
Output
Released
Aug 2026
Tokenizer
DeepSeek
Architecture
text->text
Moderated
No
Supported parameters
frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p

Rankings

Excels at

It's decent at

Falls behind in

Detailed scores

Updated: Aug 23, 2026

Overall

undefined metric} other undefined metrics}}

Overall score67.0#26 / 100DeepSWE62.7#8 / 16
Overall score
LMSpeed rank#26
Score67.0
UpdatedAug 23, 2026
Confidence2
DeepSWE
LMSpeed rank#8
Score62.7
UpdatedAug 23, 2026
Confidence2

Agents

V3.0

undefined metric} other undefined metrics}} · Rated

Score57.5#1380% interval49.8–65.23/4 Measured dimensionsAgentic score68.2#25 / 69Terminal-Bench 2.067.9#20 / 53
Dimensions and evidence
Planning & decompositionPrior only
Tool use58.1
undefined family} other undefined families}} · undefined metric} other undefined metrics}}
mcp_atlas · mcp_atlas · z 0.04 · q 1.00
tau · aa_tau3_banking · z 0.59 · q 1.00
tau · tau2_bench · z 0.77 · q 1.00
toolathlon · toolathlon · z 0.38 · q 1.00
Environment & long-horizon execution55.9
undefined family} other undefined families}} · undefined metric} other undefined metrics}}
browsecomp · browse_comp · z 0.28 · q 1.00
gdpval_aa · benchlm_agentic_gdpval_aa · z 0.40 · q 1.00
terminalbench · benchlm_agentic_terminal_bench2 · z 0.27 · q 1.00
Recovery & completion reliability58.6
undefined family} other undefined families}} · undefined metric} other undefined metrics}}
apex_agents · apex_agents_aa · z -0.04 · q 1.00
cyber_gym · cyber_gym · z 0.72 · q 1.00
Agentic score
LMSpeed rank#25
Score68.2
UpdatedAug 23, 2026
Confidence2
Terminal-Bench 2.0V3 evidence
LMSpeed rank#20
Score67.9
UpdatedAug 23, 2026
Confidence2
BrowseCompV3 evidence
LMSpeed rank#12
Score83.4
UpdatedAug 23, 2026
Confidence2
HLE w/ tools
LMSpeed rank#2
Score60.0
UpdatedAug 23, 2026
Confidence2
MCP AtlasV3 evidence
LMSpeed rank#16
Score73.6
UpdatedAug 23, 2026
Confidence2
ToolathlonV3 evidence
LMSpeed rank#9
Score51.8
UpdatedAug 23, 2026
Confidence2
Terminal-Bench 2.1
LMSpeed rank#1
Score87.9
UpdatedAug 23, 2026
Confidence2
CyberGymV3 evidence
LMSpeed rank#2
Score83.3
UpdatedAug 23, 2026
Confidence2
Toolathlon-Verified
LMSpeed rank#2
Score74.1
UpdatedAug 23, 2026
Confidence2
Agents' Last Exam
LMSpeed rank#4
Score25.7
UpdatedAug 23, 2026
Confidence2
AutomationBench
LMSpeed rank#1
Score31.8
UpdatedAug 23, 2026
Confidence2
GDPval-AAV3 evidence
LMSpeed rank#22
Score1306.0
UpdatedAug 23, 2026
Confidence2
AA Agentic Index
LMSpeed rank#9
Score49.6
UpdatedAug 23, 2026
Confidence2
APEX-Agents-AAV3 evidence
LMSpeed rank#13
Score24.3
UpdatedAug 23, 2026
Confidence2
Τ²-bench resultsV3 evidence
LMSpeed rank#12
Score96.2
UpdatedAug 23, 2026
Confidence2
GDPval-AA
LMSpeed rank#9
Score54.5
UpdatedAug 23, 2026
Confidence2
AA Tau3 BankingV3 evidence
LMSpeed rank#6
Score39.6
UpdatedAug 23, 2026
Confidence2

Coding

V3.0

undefined metric} other undefined metrics}} · Rated

Score57.1#1080% interval50.9–63.24/4 Measured dimensionsCoding score57.6#36 / 81Codeforces3206.0#1 / 4
Dimensions and evidence
Code generation58.5
undefined family} other undefined families}} · undefined metric} other undefined metrics}}
scicode · aa_sci_code · z 0.99 · q 1.00
Repository engineering62.4
undefined family} other undefined families}} · undefined metric} other undefined metrics}}
nl2repo · nl2_repo · z 3.00 · q 1.00
swe_pro · swe_pro · z -0.26 · q 1.00
vibecode · vibe_code_bench · z 0.86 · q 1.00
Debugging & testing56.9
undefined family} other undefined families}} · undefined metric} other undefined metrics}}
swe_multilingual · benchlm_coding_swe_multilingual · z 0.30 · q 1.00
swe_verified · swe_verified · z 0.80 · q 1.00
Tool-assisted development & quality50.5
undefined family} other undefined families}} · undefined metric} other undefined metrics}}
terminalbench · aa_terminal_bench21 · z -0.10 · q 1.00
terminalbench · benchlm_coding_terminal_bench2 · z 0.00 · q 1.00
Coding score
LMSpeed rank#36
Score57.6
UpdatedAug 23, 2026
Confidence2
Codeforces
LMSpeed rank#1
Score3206.0
UpdatedAug 23, 2026
Confidence2
SWE-bench VerifiedV3 evidence
LMSpeed rank#9
Score80.6
UpdatedAug 23, 2026
Confidence2
SWE-bench ProV3 evidence
LMSpeed rank#33
Score55.4
UpdatedAug 23, 2026
Confidence2
SWE MultilingualV3 evidence
LMSpeed rank#10
Score76.2
UpdatedAug 23, 2026
Confidence2
Terminal-Bench 2.0V3 evidence
LMSpeed rank#17
Score67.9
UpdatedAug 23, 2026
Confidence2
LiveCodeBench Pass@1-COT
LMSpeed rank#1
Score93.5
UpdatedAug 23, 2026
Confidence2
Terminal-Bench 2.1
LMSpeed rank#1
Score87.9
UpdatedAug 23, 2026
Confidence2
NL2RepoV3 evidence
LMSpeed rank#1
Score61.5
UpdatedAug 23, 2026
Confidence2
DSBench-FullStack
LMSpeed rank#1
Score71.1
UpdatedAug 23, 2026
Confidence2
DSBench-Hard
LMSpeed rank#1
Score67.2
UpdatedAug 23, 2026
Confidence2
Vibe Code BenchV3 evidence
LMSpeed rank#8
Score49.9
UpdatedAug 23, 2026
Confidence2
AA Coding Index
LMSpeed rank#21
Score68.8
UpdatedAug 23, 2026
Confidence2
AA-SciCodeV3 evidence
LMSpeed rank#32
Score49.2
UpdatedAug 23, 2026
Confidence2
AA Terminal-Bench 2.1V3 evidence
LMSpeed rank#10
Score78.7
UpdatedAug 23, 2026
Confidence2

Reasoning

V3.0

undefined metric} other undefined metrics}} · Rated

Score61#280% interval52.6–69.33/4 Measured dimensionsMMLU-Pro87.5%#9 / 129GPQA90.1%#28 / 211
Dimensions and evidence
Abstract logicPrior only
Scientific & causal reasoning62.7
undefined family} other undefined families}} · undefined metric} other undefined metrics}}
critpt · critpt · z 0.83 · q 1.00
gpqa · aa_gpqa_diamond · z 1.27 · q 1.00
hle · aa_hle · z 0.95 · q 1.00
Multi-step constraints59
undefined family} other undefined families}} · undefined metric} other undefined metrics}}
mmlu_pro · mmlu_pro · z 1.00 · q 1.00
Evidence integration & verification61.1
undefined family} other undefined families}} · undefined metric} other undefined metrics}}
lcr · lcr · z 0.36 · q 1.00
mrcr · mrcr1m · z 1.52 · q 0.75
MMLU-ProV3 evidence
LMSpeed rank#9
Score87.5%
UpdatedAug 23, 2026
Confidence2
GPQAV3 evidence
LMSpeed rank#28
Score90.1%
UpdatedAug 23, 2026
Confidence2
HLEV3 evidence
LMSpeed rank#16
Score42.7%
UpdatedAug 23, 2026
Confidence2
MRCR 1MV3 evidence
LMSpeed rank#1
Score83.5
UpdatedAug 23, 2026
Confidence2
CorpusQA 1M
LMSpeed rank#1
Score62.0
UpdatedAug 23, 2026
Confidence2
AA-LCRV3 evidence
LMSpeed rank#25
Score75.3
UpdatedAug 23, 2026
Confidence2
CritPtV3 evidence
LMSpeed rank#14
Score18.0
UpdatedAug 23, 2026
Confidence2

Knowledge

V3.0

undefined metric} other undefined metrics}} · Provisional

Score58.480% interval40.4–76.51/4 Measured dimensionsKnowledge score77.0#20 / 69SimpleQA57.9#1 / 4
Dimensions and evidence
Broad knowledgePrior only
Professional knowledgePrior only
Factuality58.4
undefined family} other undefined families}} · undefined metric} other undefined metrics}}
simpleqa · simple_qa · z 1.39 · q 0.17
Retrieval & open-book usePrior only
Knowledge score
LMSpeed rank#20
Score77.0
UpdatedAug 23, 2026
Confidence2
SimpleQAV3 evidence
LMSpeed rank#1
Score57.9
UpdatedAug 23, 2026
Confidence2
Chinese-SimpleQA
LMSpeed rank#1
Score84.4
UpdatedAug 23, 2026
Confidence2
GPQA-D
LMSpeed rank#16
Score90.1
UpdatedAug 23, 2026
Confidence2
Artificial Analysis Intelligence Index
LMSpeed rank#15
Score53.2
UpdatedAug 23, 2026
Confidence2
AA-GPQA Diamond
LMSpeed rank#10
Score92.8
UpdatedAug 23, 2026
Confidence2
AA-HLE
LMSpeed rank#21
Score41.0
UpdatedAug 23, 2026
Confidence2
AA-Omniscience Index
LMSpeed rank#37
Score0.8
UpdatedAug 23, 2026
Confidence2
AA-Omniscience Accuracy
LMSpeed rank#14
Score49.1
UpdatedAug 23, 2026
Confidence2
AA-Omniscience Hallucination Rate
LMSpeed rank#2
Score94.1
UpdatedAug 23, 2026
Confidence2
AA Openness Index
LMSpeed rank#1
Score44.4
UpdatedAug 23, 2026
Confidence2

Math

V3.0

undefined metric} other undefined metrics}} · Estimated

Score58.980% interval46.8–71.12/4 Measured dimensionsHMMT Feb 202695.2#2 / 18IMOAnswerBench89.8#2 / 7
Dimensions and evidence
Foundational mathPrior only
Competition math61.7
undefined family} other undefined families}} · undefined metric} other undefined metrics}}
hmmt · hmmt_feb2026 · z 1.69 · q 1.00
Advanced proofs56.2
undefined family} other undefined families}} · undefined metric} other undefined metrics}}
imo · imo_answer_bench · z 0.34 · q 0.88
Applied & tool-assisted mathPrior only
HMMT Feb 2026V3 evidence
LMSpeed rank#2
Score95.2
UpdatedAug 23, 2026
Confidence2
IMOAnswerBenchV3 evidence
LMSpeed rank#2
Score89.8
UpdatedAug 23, 2026
Confidence2
Apex
LMSpeed rank#2
Score38.3
UpdatedAug 23, 2026
Confidence2
Apex Shortlist
LMSpeed rank#1
Score90.2
UpdatedAug 23, 2026
Confidence2
Math score
LMSpeed rank#4
Score81.8
UpdatedAug 23, 2026
Confidence2

Multilingual

V3.0

undefined metric} other undefined metrics}} · No data

No data80% interval30.8–69.20/4 Measured dimensions
Dimensions and evidence
Cross-language understandingPrior only
Multilingual generationPrior only
Reasoning transferPrior only
Low-resource robustnessPrior only

Multimodal

V3.0

undefined metric} other undefined metrics}} · No data

80% interval30.8–69.20/4 Measured dimensionsDesign Arena Website1258.0#33 / 75
Dimensions and evidence
Perception & OCRPrior only
Document & spatial understandingPrior only
Visual reasoningPrior only
Video & grounded actionPrior only
Design Arena Website
LMSpeed rank#33
Score1258.0
UpdatedAug 23, 2026
Confidence2

Instruction following

V3.0

undefined metric} other undefined metrics}} · Provisional

Score54.980% interval38.9–70.91/4 Measured dimensionsAA-IFBench76.5#10 / 84
Dimensions and evidence
Constraint followingPrior only
Structured outputPrior only
Novel-instruction generalization54.9
undefined family} other undefined families}} · undefined metric} other undefined metrics}}
ifbench · aa_if_bench · z 0.38 · q 1.00
Multi-turn & long instructionsPrior only
AA-IFBenchV3 evidence
LMSpeed rank#10
Score76.5
UpdatedAug 23, 2026
Confidence2

OpenRouter endpoints

14 endpoints

Third-party OpenRouter endpoint data, shown separately from LMSpeed measurements. Some 30-minute live performance fields only appear after syncing with an OpenRouter API key.

Provider endpointInputOutput1d uptime30m latency30m throughputContext / output
Alibaba
alibaba
$1.16/M$3.48/M100.0%undefined tokens / undefined tokens
DeepSeek
deepseek
$0.660/M$1.98/M100.0%undefined tokens / undefined tokens
DigitalOcean
digitalocean
$1.32/M$3.96/M99.9%undefined tokens / —
Phala
phala
$1.45/M$4.36/M99.9%undefined tokens / undefined tokens
Fireworks
fireworks
$1.32/M$3.96/M99.9%undefined tokens / —
Novita
novita/fp8
$1.32/M$3.96/M99.9%undefined tokens / undefined tokens
GMICloud
gmicloud/fp8
$1.12/M$3.37/M99.9%undefined tokens / —
Sail Research
sail-research/fp4
$1.32/M$3.96/M99.8%undefined tokens / undefined tokens
BaseTen
baseten/fp4
$1.32/M$3.96/M99.5%undefined tokens / undefined tokens
StreamLake
streamlake
$1.32/M$3.96/M99.4%undefined tokens / undefined tokens
Parasail
parasail/fp8
$1.32/M$3.96/M99.4%undefined tokens / undefined tokens
SiliconFlow
siliconflow/fp8
$1.32/M$3.96/M98.6%undefined tokens / undefined tokens
Together
together
$1.32/M$3.96/M98.4%undefined tokens / —
Cloudflare
cloudflare
$1.32/M$3.96/M98.3%undefined tokens / undefined tokens

Rankings are based on community-submitted tests and periodic health probes. Advisory only, not official data.Standard benchmark data may include BenchLM and other public sources.

Build with LMSpeed Data

Free

Free public API for LLM pricing, benchmarks & provider data

  • Real-time pricing & availability
  • Speed & latency benchmarks
  • 300+ models, 600+ providers
  • 1,000 requests/day
View API Documentation