Sponsored byFusecodeEnterprise coding API for Claude Code, Codex, and model workflows.
LogoLMSpeed
  • Free
  • Models
  • Providers
  • Leaderboard
LogoLMSpeed
  1. Home
  2. Leaderboard
  3. Best Model For Coding
LogoLMSpeed

The best API speed test tool

GitHubGitHubTwitterX (Twitter)Email
Product
  • Features
  • Pricing
  • FAQ
Leaderboard
  • Overview
  • Speed Ranking
  • Latency Ranking
  • Health Ranking
  • Model Pricing
  • Model Speed
  • Reasoning
  • Coding
Models
  • All Models
  • GPT
  • Claude
  • Gemini
  • DeepSeek
  • Llama
  • Qwen
Free Models
  • All Free Models
  • Free GPT
  • Free Claude
  • Free Gemini
  • Free DeepSeek
  • Free Llama
  • Free Qwen
Tools
  • Speed Test
  • Provider Audit
Company
  • About
Resources
  • Provider Directory
  • Documentation
  • Public API
  • Botab
  • VidBee
Legal
  • Cookie Policy
  • Privacy Policy
  • Terms of Service
© 2026 LMSpeed All Rights Reserved.Made by Nexmoe with ❤️
AgentsCodingReasoningKnowledgeMathMultilingualMultimodalInstruction following

Category Score V3 leaderboard

LMSpeed Best Models for Coding

Compare the best AI coding models across code generation, repository engineering, debugging, testing, and tool-assisted development benchmarks in one evidence-rich leaderboard.

Updated August 9, 2026·Methodology 3.0·Methodology

Current answer

Among the currently visible formally ranked models, Claude Opus 5 has the highest position at global rank 1. Its Category Score is 70.1, with an 80% uncertainty range of ±6.6. 37 visible models have a formal rank. This result applies only to this score run.

View Claude Opus 5 detailsRankings can change when data or methods change. The run date appears above.

Available leaderboard data

Models shown
100
Formally ranked models
37
Benchmark columns
16
Dimensions with evidence
4/4

How to read the benchmark bars

Each bar compares models only within the same benchmark column. Bar lengths are relative to the models shown here; they are not Category Scores and cannot be compared across benchmark columns.

RankModelLMSpeed scoreCode generationRepository engineeringDebugging & testingTool-assisted development & qualityStatusEvidenceUpdated
SciCode197 modelsLiveCodeBench115 modelsAA-SciCode5 modelsLiveCodeBench v65 modelsLiveCodeBench Pro4 modelsAA Coding Index2 modelsSWE-bench Pro45 modelsVibe Code Bench34 modelsNL2Repo12 modelsReact Native Evals12 modelsSWE-bench Verified46 modelsSWE Multilingual20 modelsSWE-Rebench11 modelsTerminal-Bench 2.031 modelsAA Terminal-Bench 2.117 modelsTerminal-Bench Hard12 models
Formally ranked models37
1ClaudeClaude Opus 5Anthropic
70.1±6.6
50.7%—————79.2———96.089.5——89.1—Rated4/4 dimensions · 5 familiesAug 9, 2026
2ClaudeClaude Fable 5Anthropic
68.1±6.9
60.2%—————80.0———95.0——84.384.662.9Rated4/4 dimensions · 4 familiesAug 9, 2026
3ClaudeClaude Opus 4.8Anthropic
66±6.6
53.5%—————69.2———88.684.4—74.684.658.3Rated4/4 dimensions · 5 familiesAug 9, 2026
4ClaudeClaude Opus 4.7 MaxAnthropic
61.2±6.9
——54.5———64.3———87.6——69.4——Rated4/4 dimensions · 4 familiesAug 9, 2026
5OpenAIGPT-5.5OpenAI
60±8.7
53.5%—————58.669.8—84.7———82.0——Rated3/4 dimensions · 5 familiesAug 9, 2026
6ClaudeClaude Opus 4.6Anthropic
59.2±8.0
51.9%———70.7—53.457.6—84.180.8—65.3———Rated3/4 dimensions · 7 familiesAug 9, 2026
7ClaudeClaude Sonnet 5Anthropic
59.1±6.6
48.6%—————63.2———85.278.3—80.480.5—Rated4/4 dimensions · 5 familiesAug 9, 2026
8GrokGrok 4.5SpaceXAI
59±6.9
54.1%—————64.7————78.0—83.381.6—Rated4/4 dimensions · 4 familiesAug 9, 2026
9OpenAIGPT-5.3 CodexOpenAI
58.7±8.5
53.2%—————56.861.8——85.0—58.2———Rated3/4 dimensions · 5 familiesAug 9, 2026
10MoonshotAIKimi K2.6MoonshotAI
57.4±6.1
53.5%——89.6——58.637.9——80.276.7—66.7——Rated4/4 dimensions · 7 familiesAug 9, 2026
11QwenQwen3.7 MaxQwen
57±6.0
48.8%91.6%————60.6—47.2—80.478.3—69.774.550.8Rated4/4 dimensions · 7 familiesAug 9, 2026
12OpenAIGPT-5.2OpenAI
56.4±8.5
46.2%89.4%————55.653.5——80.0—————Rated3/4 dimensions · 5 familiesAug 9, 2026
13GeminiGemini 3.5 FlashGoogle
56.1±8.9
53.0%—————55.148.7—————76.2——Rated3/4 dimensions · 4 familiesAug 9, 2026
14ClaudeClaude Sonnet 4.6Anthropic
56.1±8.6
44.1%——————51.5—80.679.6—60.7———Rated3/4 dimensions · 5 familiesAug 9, 2026
15ClaudeClaude Opus 4.5Anthropic
56.1±8.1
49.5%87.1%—84.8——57.1—43.2—80.977.5————Rated3/4 dimensions · 6 familiesAug 9, 2026
16ChatGLMGLM-5.2Z.ai
54.4±8.9
36.1%—————62.1—48.9————81.077.950.8Rated3/4 dimensions · 4 familiesAug 9, 2026
17ChatGLMGLM-5.1Z.ai
54±8.8
36.1%—————58.431.542.7———62.7———Rated3/4 dimensions · 5 familiesAug 9, 2026
18QwenQwen3.7 PlusQwen
53.2±6.0
45.5%89.6%————57.6—41.1—77.775.8—70.3——Rated4/4 dimensions · 7 familiesAug 9, 2026
19Inkling SmallThinking Machines
53±6.9
48.7%—————55.9———80.2——64.7——Rated4/4 dimensions · 4 familiesAug 9, 2026
20QwenQwen3.6 PlusQwen
52.3±8.2
40.7%——87.1——56.625.6——78.873.8————Rated3/4 dimensions · 6 familiesAug 9, 2026
21QwenQwen3.6 Max PreviewQwen
52.2±8.9
46.9%—————57.3—42.9————65.4——Rated3/4 dimensions · 4 familiesAug 9, 2026
22MinimaxMiniMax M3MiniMax
52.1±6.6
45.4%—————59.0—42.1—80.5——66.065.242.4Rated4/4 dimensions · 5 familiesAug 9, 2026
23ChatGLMGLM-5Z.ai
51.6±8.1
38.3%—————55.123.4—74.877.873.362.8———Rated3/4 dimensions · 7 familiesAug 9, 2026
24DeepSeekDeepSeek V3.2DeepSeek
51.3±8.6
44.0%89.6%—————5.1—71.5——60.9———Rated3/4 dimensions · 5 familiesAug 9, 2026
25InklingThinking Machines
50.8±6.9
46.1%—————54.3———77.6——63.8——Rated4/4 dimensions · 4 familiesAug 9, 2026
26DeepSeekDeepSeek V4 FlashDeepSeek
50.7±6.3
49.9%—————49.1—54.2—73.769.7—49.178.7—Rated4/4 dimensions · 6 familiesAug 9, 2026
27MoonshotAIKimi K2.5MoonshotAI
48.5±7.8
49.0%——85.0——50.717.5—77.276.873.058.5———Rated3/4 dimensions · 8 familiesAug 9, 2026
28DeepSeekDeepSeek V4 ProDeepSeek
48±6.3
42.4%—————52.149.9——73.669.8—59.164.046.2Rated4/4 dimensions · 6 familiesAug 9, 2026
29MinimaxMiniMax M2.7MiniMax
47.5±8.2
47.0%—————56.227.039.871.4—76.551.9———Rated3/4 dimensions · 7 familiesAug 9, 2026
30GrokGrok 4.20SpaceXAI
47.4±8.6
45.6%———74.2—51.84.1——76.7—————Rated3/4 dimensions · 5 familiesAug 9, 2026
31QwenQwen3.6 27BQwen
47.2±6.0
37.3%83.9%————53.5—36.2—77.271.3—59.3——Rated4/4 dimensions · 7 familiesAug 9, 2026
32OpenAIgpt-oss-120bOpenAI
46.3±9.0
38.9%87.8%———————71.6—————23.5Rated3/4 dimensions · 4 familiesAug 9, 2026
33QwenQwen3.5
39.9±9.0
2.8%——83.6——50.9———76.2—————Rated3/4 dimensions · 4 familiesAug 9, 2026
34Laguna M 1Poolside
39.8±8.9
——————49.2———74.663.1—45.8——Rated3/4 dimensions · 4 familiesAug 9, 2026
35GeminiGemini 2.5 ProGoogle
39.2±8.9
42.8%80.1%—————0.4——63.8—————Rated3/4 dimensions · 4 familiesAug 9, 2026
36QwenQwen3.6 35B A3BQwen
38±6.0
1.3%80.4%————49.5—29.4—73.467.2—51.5——Rated4/4 dimensions · 7 familiesAug 9, 2026
37Laguna Xs 2Poolside
34.4±8.9
——————46.3———69.957.7—35.7——Rated3/4 dimensions · 4 familiesAug 9, 2026
Estimated models — unranked49
—QwenQwen3.8 MaxQwen
67.3±11.2
52.9%—————67.7—55.9———————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—OpenAIGPT-5.6 SolOpenAI
63.2±9.3
56.0%—————64.6——————91.988.065.9Estimated3/4 dimensions · 3 familiesAug 9, 2026
—OpenAIGPT-5.4OpenAI
62.8±10.3
50.3%———87.5—57.767.4—85.3——————Estimated2/4 dimensions · 5 familiesAug 9, 2026
—ClaudeClaude Opus 4.7Anthropic
60.4±11.2
50.1%——————71.0—82.8——————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—OpenAIGPT-5.6 TerraOpenAI
60.2±9.3
50.1%—————63.4——————87.488.057.6Estimated3/4 dimensions · 3 familiesAug 9, 2026
—MoonshotAIKimi K3MoonshotAI
59.6±11.9
51.2%—————————————85.0—Estimated2/4 dimensions · 2 familiesAug 9, 2026
—GeminiGemini 3.1 ProGoogle
59.2±10.7
——58.9—82.9——32.0—78.9——————Estimated2/4 dimensions · 4 familiesAug 9, 2026
—OpenAIGPT-5.2 CodexOpenAI
58.3±11.8
54.6%——————37.9————————Estimated2/4 dimensions · 2 familiesAug 9, 2026
—SparkMuse Spark 1.1Meta
58.1±9.3
58.2%—————61.5——————80.077.9—Estimated3/4 dimensions · 3 familiesAug 9, 2026
—OpenAIGPT-5.4 MiniOpenAI
57.8±11.8
49.9%——————48.0————————Estimated2/4 dimensions · 2 familiesAug 9, 2026
—OpenAIGPT-5.6 LunaOpenAI
56.9±9.3
45.8%—————62.7——————84.780.9—Estimated3/4 dimensions · 3 familiesAug 9, 2026
—GeminiGemini 3 ProGoogle
55.8±11.2
56.1%91.7%—————14.3————————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—GeminiGemini 3.6 FlashGoogle
54.7±11.9
52.7%—————————————77.5—Estimated2/4 dimensions · 2 familiesAug 9, 2026
—GeminiGemini 3 FlashGoogle
53.9±11.2
49.9%79.7%—————20.2————————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—Laguna S 2.1Poolside
53.8±9.3
——————59.4————78.5—70.2——Estimated3/4 dimensions · 3 familiesAug 9, 2026
—MiMo-V2-Pro
53.6±11.8
42.5%—————————78.0—————Estimated2/4 dimensions · 2 familiesAug 9, 2026
—ChatGLMGLM-4.7Z.ai
53.4±10.5
45.1%89.4%————————73.8—58.7———Estimated2/4 dimensions · 4 familiesAug 9, 2026
—ClaudeClaude Sonnet 4.5Anthropic
52.1±11.2
42.8%59.0%————————77.2—————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—MiMo-V2-Flash
51.1±11.2
39.4%86.8%————————73.4—————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—MiMo-V2.5Xiaomi
50.9±9.3
43.1%—————56.1——————65.8——Estimated3/4 dimensions · 3 familiesAug 9, 2026
—OpenAIGPT-5.1 Codex MaxOpenAI
50.9±11.8
——40.2————22.2————————Estimated2/4 dimensions · 2 familiesAug 9, 2026
—OpenAIGPT-5.1 CodexOpenAI
50.6±11.2
40.2%84.9%—————13.1————————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—Ling-3.0-flashInclusionai
50.4±9.3
41.1%—————56.6————72.4————Estimated3/4 dimensions · 3 familiesAug 9, 2026
—MinimaxMiniMax M2.5MiniMax
50.3±11.8
42.6%——————14.9————————Estimated2/4 dimensions · 2 familiesAug 9, 2026
—MistralMistral Medium 3.5Mistral
49.7±9.4
39.6%—————————77.6————33.3Estimated3/4 dimensions · 3 familiesAug 9, 2026
—OpenAIGPT-5.4 NanoOpenAI
49.7±11.8
35.2%——————26.1————————Estimated2/4 dimensions · 2 familiesAug 9, 2026
—OpenAIGPT-5 MiniOpenAI
49.6±11.2
41.0%69.2%—————14.2————————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—StepfunStep 3.7 FlashStepFun
49.4±9.3
40.0%—————56.3——————59.5——Estimated3/4 dimensions · 3 familiesAug 9, 2026
—QwenQwen3.5-27BQwen
49.3±11.2
39.5%—————————72.4—58.9———Estimated2/4 dimensions · 3 familiesAug 9, 2026
—QwenQwen3.5-122B-A10BQwen
49.2±11.8
42.0%—————————72.0—————Estimated2/4 dimensions · 2 familiesAug 9, 2026
—MiMo-V2-Omni
49.1±11.8
36.7%—————————74.8—————Estimated2/4 dimensions · 2 familiesAug 9, 2026
—OpenAIGPT-5.1OpenAI
49.1±11.2
36.5%49.4%—————24.6————————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—MiMo-V2.5-ProXiaomi
49.1±9.3
39.1%—————57.2——————68.465.243.2Estimated3/4 dimensions · 3 familiesAug 9, 2026
—OpenAIGPT-5OpenAI
49±11.2
37.8%54.3%—————20.1————————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—OpenAIgpt-oss-20bOpenAI
48.1±11.2
34.4%77.7%———————71.0——————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—HunyuanHy3 previewTencent
48±9.3
39.4%—————————74.4——54.4——Estimated3/4 dimensions · 3 familiesAug 9, 2026
—GeminiGemini 3.5 Flash-LiteGoogle
47.9±9.3
40.9%—————54.2——————54.0——Estimated3/4 dimensions · 3 familiesAug 9, 2026
—ClaudeClaude Haiku 4.5Anthropic
46.8±11.2
34.4%51.1%————————73.3—————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—ClaudeClaude Sonnet 4Anthropic
46.7±11.2
37.3%44.9%————————72.7—————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—QwenQwen3 MaxQwen
45.1±11.2
38.3%76.7%—————3.5————————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—CohereCommand ACohere
42.7±11.4
37.8%28.7%—————————————25.0Estimated2/4 dimensions · 3 familiesAug 9, 2026
—QwenQwen3.5-35B-A3BQwen
42.3±11.2
37.7%—————————69.2—53.7———Estimated2/4 dimensions · 3 familiesAug 9, 2026
—ChatGLMGLM-4.6Z.ai
41.8±11.2
33.1%56.1%—————3.1————————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—OpenAIO3 MiniOpenAI
40.8±11.2
39.9%71.7%————————49.3—————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—GeminiGemini 3.1 Flash LiteGoogle
40.8±11.8
——41.9————0.0————————Estimated2/4 dimensions · 2 familiesAug 9, 2026
—OpenAIGPT-4.1 MiniOpenAI
39.3±11.2
40.4%48.3%————————23.6—————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—OpenAIGPT-4.1OpenAI
38.5±11.2
38.1%45.7%————————54.6—————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—DeepSeekDeepSeek V3
37.6±11.2
35.8%40.5%————————42.0—————Estimated2/4 dimensions · 3 familiesAug 9, 2026
—ClaudeClaude 3.5 SonnetAnthropic
36.3±11.2
31.6%38.1%————————49.0—————Estimated2/4 dimensions · 3 familiesAug 9, 2026
Provisional models — unranked14
—GeminiGemini 3.1 Pro PreviewGoogle
66.4±16.0
58.9%———————————————Provisional1/4 dimensions · 1 familiesAug 9, 2026
—SparkMuse Spark 1.2Meta
64.6±16.0
56.4%———————————————Provisional1/4 dimensions · 1 familiesAug 9, 2026
—GeminiGemini 3 Flash PreviewGoogle
63±13.9
50.6%90.8%——————————————Provisional1/4 dimensions · 2 familiesAug 9, 2026
—GrokGrok Build 0 1SpaceXAI
60.2±16.0
50.2%———————————————Provisional1/4 dimensions · 1 familiesAug 9, 2026
—OpenAIO4 MiniOpenAI
59.5±13.9
46.5%85.9%——————————————Provisional1/4 dimensions · 2 familiesAug 9, 2026
—HunyuanHy3Tencent
58.4±16.0
47.6%———————————————Provisional1/4 dimensions · 1 familiesAug 9, 2026
—MoonshotAIKimi K2.7 CodeMoonshotAI
58.3±16.0
47.5%———————————————Provisional1/4 dimensions · 1 familiesAug 9, 2026
—MoonshotAIKimi K2 ThinkingMoonshotAI
57.4±13.9
42.4%85.3%——————————————Provisional1/4 dimensions · 2 familiesAug 9, 2026
—OpenAIGPT-5.1 Codex MiniOpenAI
57.1±13.9
42.6%83.6%——————————————Provisional1/4 dimensions · 2 familiesAug 9, 2026
—OpenAIGPT-5 CodexOpenAI
56.4±13.9
40.9%84.0%——————————————Provisional1/4 dimensions · 2 familiesAug 9, 2026
—GrokGrok 4.3SpaceXAI
56.3±16.0
44.6%———————————————Provisional1/4 dimensions · 1 familiesAug 9, 2026
—QwenQwen3 235B A22B Instruct 2507Qwen
56±13.9
42.4%78.8%——————————————Provisional1/4 dimensions · 2 familiesAug 9, 2026
—OpenAIO3OpenAI
55.7±13.9
41.0%80.8%——————————————Provisional1/4 dimensions · 2 familiesAug 9, 2026
—MinimaxMiniMax M2.1MiniMax
55.6±13.9
40.7%81.0%——————————————Provisional1/4 dimensions · 2 familiesAug 9, 2026

What this leaderboard measures

Which AI model is better suited to coding?

This leaderboard covers code generation, repository understanding, debugging, testing, and tool-assisted development. A single coding problem cannot represent full software engineering ability.

Available data covers 4/4 dimensions and shows 16 benchmark columns.

Four capability dimensions

The four dimensions come from the category blueprint. Available data may cover only some of them. A dimension without evidence is not presented as a verified capability.

Code generation

6 benchmark columns currently provide evidence for this dimension.

  • SciCode
  • LiveCodeBench
  • AA-SciCode
  • LiveCodeBench v6
  • LiveCodeBench Pro
  • AA Coding Index

Repository engineering

4 benchmark columns currently provide evidence for this dimension.

  • SWE-bench Pro
  • Vibe Code Bench
  • NL2Repo
  • React Native Evals

Debugging & testing

3 benchmark columns currently provide evidence for this dimension.

  • SWE-bench Verified
  • SWE Multilingual
  • SWE-Rebench

Tool-assisted development & quality

3 benchmark columns currently provide evidence for this dimension.

  • Terminal-Bench 2.0
  • AA Terminal-Bench 2.1
  • Terminal-Bench Hard

Coding tasks this page can help with

  • Daily coding work such as completing functions, explaining code, and building small features.
  • Cross-file repository changes that require understanding the existing structure and limiting the edit scope.
  • Coding agents that use a terminal, tests, and code tools to finish a task.

How to choose a model with this leaderboard

  1. Step 1

    Check the rating status first

    Only Rated models receive a rank. Estimated and Provisional models do not have a formal position.

  2. Step 2

    Review uncertainty and evidence

    When scores are close, do not rely on rank alone. Check uncertainty, dimension coverage, and benchmark count.

  3. Step 3

    Test the real task last

    A leaderboard cannot replace your own test. Check quality, speed, price, context, and provider limits together.

Filter by language, repository size, and toolchain first. Also check test success, edit scope, speed, and cost.

Rating status guide

Rated

Rated means the evidence and overlap rules are met. The model can receive a formal rank.

Estimated

Estimated means there is useful evidence, but it is not enough for a formal rank.

Provisional

Provisional means evidence is limited or dimension and benchmark-family coverage is below the estimated threshold. Use the result only as an early signal.

Benchmarks and evidence sources

Evidence source names and benchmark groups come from the currently available score data. One source may contribute several benchmarks.

  • Artificial Analysis

    AA Coding Index, LiveCodeBench, and SciCode

  • BenchLM

    AA Terminal-Bench 2.1, AA-SciCode, LiveCodeBench, LiveCodeBench Pro, LiveCodeBench v6, NL2Repo, React Native Evals, SWE Multilingual, SWE-bench Pro, SWE-bench Verified, SWE-Rebench, Terminal-Bench 2.0, Terminal-Bench Hard, and Vibe Code Bench

How the coding model ranking is built

LMSpeed combines eligible third-party benchmarks inside four fixed capability dimensions. Rated models meet the evidence and overlap requirements for a formal rank; Estimated and Provisional models remain visible without receiving a rank.

Read the Category Score methodology

Leaderboard limits

Category Scores use the third-party benchmarks currently included by LMSpeed. Tests can use different data, prompts, and scoring rules. The result is not permanent and cannot represent every real task. Test important choices with your own data and workflow.

Frequently asked questions

Which visible model has the highest formal rank now?

Among the currently visible models, Claude Opus 5 has the highest formal position at global rank 1. Its Category Score is 70.1. 37 visible models meet the formal ranking rules. This result applies only to the run date and methodology version shown on the page.

Can I compare scores across different categories?

No. Each category uses different capability dimensions and evidence. A Category Score is comparable only inside the same leaderboard. Review the matching category for each task.

Are Estimated and Provisional models still useful?

They can help you find candidates, but their evidence is not complete enough for a formal rank. Review coverage and uncertainty, then test the model on a real task.

How often does the leaderboard update?

The leaderboard updates after a new completed score run is published. The current run date and methodology version appear above. LMSpeed does not promise a fixed daily or weekly schedule.

Is the number one model always best for me?

No. Your result also depends on speed, price, context length, tool support, region, and provider limits. Use the leaderboard to narrow the field, then run your own test.

How is the coding ranking different from general reasoning?

The coding ranking gives more weight to code, repository, debugging, and testing tasks. A reasoning score can explain part of a model's behavior, but it cannot replace executed code and real test results.