Category Score V3 leaderboard

LMSpeed Best Models for Coding

Compare the best AI coding models across code generation, repository engineering, debugging, testing, and tool-assisted development benchmarks in one evidence-rich leaderboard.

Methodology 3.0Methodology

Current answer

Among the currently visible formally ranked models, Claude Opus 5 has the highest position at global rank 1. Its Category Score is 67.7, with an 80% uncertainty range of ±6.6. 40 visible models have a formal rank. This result applies only to this score run.

View Claude Opus 5 detailsRankings can change when data or methods change. The run date appears above.

Available leaderboard data

Models shown
100
Formally ranked models
40
Benchmark columns
16
Dimensions with evidence
4/4

How to read the benchmark bars

Each bar compares models only within the same benchmark column. Bar lengths are relative to the models shown here; they are not Category Scores and cannot be compared across benchmark columns.

RankModelLMSpeed scoreCode generationRepository engineeringDebugging & testingTool-assisted development & qualityStatusEvidenceUpdated
SciCodeundefined modelsLiveCodeBenchundefined modelsAA-SciCodeundefined modelsLiveCodeBench v6undefined modelsLiveCodeBench Proundefined modelsAA Coding Indexundefined modelsSWE-bench Proundefined modelsVibe Code Benchundefined modelsNL2Repoundefined modelsReact Native Evalsundefined modelsSWE-bench Verifiedundefined modelsSWE Multilingualundefined modelsSWE-Rebenchundefined modelsTerminal-Bench 2.0undefined modelsAA Terminal-Bench 2.1undefined modelsTerminal-Bench Hardundefined models
Formally ranked models40
1Claude Opus 5Anthropic
67.7±6.6
50.7%79.296.089.589.1Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
2Claude Fable 5Anthropic
67.1±6.9
60.2%80.095.084.384.662.9Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
3Claude Opus 4.8Anthropic
65.2±6.6
53.5%69.288.684.474.6Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
4Claude Opus 4.7 MaxAnthropic
60.8±6.9
54.564.387.669.4Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
5GPT-5.5OpenAI
59.7±8.7
53.5%58.669.884.782.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
6Claude Sonnet 5Anthropic
59.6±6.6
48.6%63.285.278.380.4Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
7Grok 4.5SpaceXAI
59.5±6.9
54.1%64.778.083.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
8Claude Opus 4.6Anthropic
58.9±8.0
51.9%70.753.457.684.180.865.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
9GPT-5.3 CodexOpenAI
58.3±8.5
53.2%56.861.885.058.2Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
10DeepSeek V4 Pro 0813DeepSeek
57.1±6.1
49.255.449.961.580.676.267.978.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
11Qwen3.7 MaxQwen
57±6.0
48.8%91.6%60.647.280.478.369.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
12GPT-5.2OpenAI
56.2±8.5
46.2%89.4%55.653.580.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
13Claude Sonnet 4.6Anthropic
55.9±8.5
44.1%51.580.679.660.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
14Gemini 3.5 FlashGoogle
55.8±8.9
53.0%55.148.776.2Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
15Claude Opus 4.5Anthropic
55.7±8.1
49.5%87.1%84.857.143.280.977.5Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
16Kimi K2.6MoonshotAI
55.5±6.0
53.5%89.658.637.980.276.766.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
17GLM-5.2Z.ai
54.3±8.9
36.1%62.148.981.077.950.8Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
18GLM-5.1Z.ai
53.7±8.8
36.1%58.431.542.762.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
19DeepSeek V4 Flash 0731DeepSeek
52.9±6.3
49.952.654.279.073.356.9Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
20Qwen3.7 PlusQwen
52.9±6.0
45.5%89.6%57.641.177.775.870.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
21Inkling SmallThinking Machines
52.7±6.9
48.7%55.980.264.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
22MiniMax M3MiniMax
52.7±6.6
45.4%59.042.180.566.065.242.4Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
23Qwen3.6 Max PreviewQwen
51.6±8.9
46.9%57.342.965.4Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
24GLM-5Z.ai
51.5±8.1
38.3%55.123.474.877.873.362.8Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
25Qwen3.6 PlusQwen
51.3±8.2
40.7%87.156.625.678.873.8Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
26DeepSeek V3.2DeepSeek
51.2±8.6
44.0%89.6%5.171.560.9Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
27InklingThinking Machines
49.8±6.9
46.1%54.377.663.855.1Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
28Kimi K2.5MoonshotAI
48.4±7.8
49.0%85.050.717.577.276.873.058.5Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
29gpt-oss-120bOpenAI
47.8±9.1
38.9%87.8%71.623.5Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
30DeepSeek V4 ProDeepSeek
47.8±6.6
49.2%52.173.669.859.1Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
31MiniMax M2.7MiniMax
47.2±8.2
47.0%56.227.039.871.476.551.9Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
32Grok 4.20SpaceXAI
47.2±8.6
45.6%74.251.84.176.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
33Qwen3.6 27BQwen
46.9±6.0
37.3%83.9%53.536.277.271.359.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
34Muse Glimmer 30BMeta
46.6±6.9
43.651.276.051.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
35DeepSeek V4 FlashDeepSeek
45.9±6.6
49.9%49.173.769.749.1Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
36Qwen3.5
40.5±8.9
2.8%83.650.976.2Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
37Laguna M 1Poolside
39.4±8.9
49.274.663.145.8Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
38Gemini 2.5 ProGoogle
39.1±8.9
42.8%80.1%0.463.8Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
39Qwen3.6 35B A3BQwen
37.7±6.0
1.3%80.4%49.529.473.467.251.5Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
40Laguna Xs 2Poolside
34±8.9
46.369.957.735.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
Estimated models — unranked52
Qwen3.8 MaxQwen
66.1±11.2
52.9%67.755.9Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.4OpenAI
62.4±10.3
50.3%87.557.767.485.3Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.6 SolOpenAI
61.7±9.3
56.0%64.691.988.065.9Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Opus 4.7Anthropic
60±11.2
50.1%71.082.8Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Muse Spark 1.1Meta
59±9.3
58.2%61.580.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.6 TerraOpenAI
58.9±9.3
50.1%63.487.488.057.6Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Grok 4.6SpaceXAI
58.7±11.9
51.6%88.4Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3.1 ProGoogle
58.7±10.7
58.982.932.078.9Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3.7 FlashGoogle
58.3±11.9
53.6%85.8Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.2 CodexOpenAI
57.8±11.8
54.6%37.9Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Muse Spark 1.2Meta
57.5±11.9
56.4%80.1Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.4 MiniOpenAI
57.5±11.8
49.9%48.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Kimi K3MoonshotAI
57.3±11.9
51.2%85.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.6 LunaOpenAI
56.7±9.3
45.8%62.784.780.9Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3.6 FlashGoogle
55.6±11.9
52.7%77.5Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3 ProGoogle
55.5±11.2
56.1%91.7%14.3Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Laguna S 2.1Poolside
54.1±9.3
59.478.570.2Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.8 27BQwen
54±10.6
35.6%90.361.742.3Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3 FlashGoogle
53.7±11.2
49.9%79.7%20.2Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
MiMo-V2-Pro
53.1±11.8
42.5%78.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GLM-4.7Z.ai
53±10.5
45.1%89.4%73.858.7Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Sonnet 4.5Anthropic
51.8±11.2
42.8%59.0%77.2Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
MiMo-V2.5-ProXiaomi
50.9±9.3
39.1%57.268.443.2Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.1 Codex MaxOpenAI
50.8±11.8
40.222.2Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
MiMo-V2-Flash
50.8±11.2
39.4%86.8%73.4Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
MiMo-V2.5Xiaomi
50.7±9.3
43.1%56.165.8Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.1 CodexOpenAI
50.6±11.2
40.2%84.9%13.1Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
MiniMax M2.5MiniMax
50.2±11.8
42.6%14.9Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Ling-3.0-flashInclusionai
50.1±9.3
41.1%56.672.4Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.4 NanoOpenAI
49.7±11.8
35.2%26.1Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5 MiniOpenAI
49.5±11.2
41.0%69.2%14.2Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Step 3.7 FlashStepFun
49.2±9.3
40.0%56.359.5Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.1OpenAI
49.1±11.2
36.5%49.4%24.6Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Mistral Medium 3.5Mistral
49.1±9.3
39.6%77.650.633.3Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5OpenAI
49±11.2
37.8%54.3%20.1Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.5-27BQwen
48.9±11.2
39.5%72.458.9Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
MiMo-V2-Omni
48.8±11.8
36.7%74.8Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.5-122B-A10BQwen
48.7±11.8
42.0%72.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
gpt-oss-20bOpenAI
48±11.2
34.4%77.7%71.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Hy3 previewTencent
47.7±9.3
39.4%74.454.4Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3.5 Flash-LiteGoogle
47.2±9.3
40.9%54.254.053.6Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Haiku 4.5Anthropic
46.5±11.2
34.4%51.1%73.3Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Sonnet 4Anthropic
46.4±11.2
37.3%44.9%72.7Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3 MaxQwen
45.1±11.2
38.3%76.7%3.5Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Command ACohere
44.7±11.4
37.8%28.7%25.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.5-35B-A3BQwen
42±11.2
37.7%69.253.7Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GLM-4.6Z.ai
41.9±11.2
33.1%56.1%3.1Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
O3 MiniOpenAI
40.5±11.2
39.9%71.7%49.3Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-4.1 MiniOpenAI
39±11.2
40.4%48.3%23.6Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-4.1OpenAI
38.3±11.2
38.1%45.7%54.6Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
DeepSeek V3
37.4±11.2
35.8%40.5%42.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Claude 3.5 SonnetAnthropic
36.2±11.2
31.6%38.1%49.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Provisional models — unranked8
Gemini 3.1 Pro PreviewGoogle
64.9±16.0
58.9%Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GLM 5.3Z.ai
63.3±16.0
56.5%Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3 Flash PreviewGoogle
62.2±13.9
50.6%90.8%Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.8 2.4T A95BQwen
60.1±16.0
51.6%Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Grok Build 0 1SpaceXAI
59.1±16.0
50.2%Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
O4 MiniOpenAI
58.9±13.9
46.5%85.9%Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Hy3Tencent
57.4±16.0
47.6%Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Kimi K2.7 CodeMoonshotAI
57.4±16.0
47.5%Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026

What this leaderboard measures

Which AI model is better suited to coding?

This leaderboard covers code generation, repository understanding, debugging, testing, and tool-assisted development. A single coding problem cannot represent full software engineering ability.

Available data covers 4/4 dimensions and shows 16 benchmark columns.

Four capability dimensions

The four dimensions come from the category blueprint. Available data may cover only some of them. A dimension without evidence is not presented as a verified capability.

Code generation

6 benchmark columns currently provide evidence for this dimension.

  • SciCode
  • LiveCodeBench
  • AA-SciCode
  • LiveCodeBench v6
  • LiveCodeBench Pro
  • AA Coding Index

Repository engineering

4 benchmark columns currently provide evidence for this dimension.

  • SWE-bench Pro
  • Vibe Code Bench
  • NL2Repo
  • React Native Evals

Debugging & testing

3 benchmark columns currently provide evidence for this dimension.

  • SWE-bench Verified
  • SWE Multilingual
  • SWE-Rebench

Tool-assisted development & quality

3 benchmark columns currently provide evidence for this dimension.

  • Terminal-Bench 2.0
  • AA Terminal-Bench 2.1
  • Terminal-Bench Hard

Coding tasks this page can help with

  • Daily coding work such as completing functions, explaining code, and building small features.
  • Cross-file repository changes that require understanding the existing structure and limiting the edit scope.
  • Coding agents that use a terminal, tests, and code tools to finish a task.

How to choose a model with this leaderboard

  1. Step 1

    Check the rating status first

    Only Rated models receive a rank. Estimated and Provisional models do not have a formal position.

  2. Step 2

    Review uncertainty and evidence

    When scores are close, do not rely on rank alone. Check uncertainty, dimension coverage, and benchmark count.

  3. Step 3

    Test the real task last

    A leaderboard cannot replace your own test. Check quality, speed, price, context, and provider limits together.

Filter by language, repository size, and toolchain first. Also check test success, edit scope, speed, and cost.

Rating status guide

Rated

Rated means the evidence and overlap rules are met. The model can receive a formal rank.

Estimated

Estimated means there is useful evidence, but it is not enough for a formal rank.

Provisional

Provisional means evidence is limited or dimension and benchmark-family coverage is below the estimated threshold. Use the result only as an early signal.

Benchmarks and evidence sources

Evidence source names and benchmark groups come from the currently available score data. One source may contribute several benchmarks.

  • Artificial Analysis

    AA Coding Index, LiveCodeBench, and SciCode

  • BenchLM

    AA Terminal-Bench 2.1, AA-SciCode, LiveCodeBench, LiveCodeBench Pro, LiveCodeBench v6, NL2Repo, React Native Evals, SWE Multilingual, SWE-bench Pro, SWE-bench Verified, SWE-Rebench, Terminal-Bench 2.0, Terminal-Bench Hard, and Vibe Code Bench

How the coding model ranking is built

LMSpeed combines eligible third-party benchmarks inside four fixed capability dimensions. Rated models meet the evidence and overlap requirements for a formal rank; Estimated and Provisional models remain visible without receiving a rank.

Read the Category Score methodology

Leaderboard limits

Category Scores use the third-party benchmarks currently included by LMSpeed. Tests can use different data, prompts, and scoring rules. The result is not permanent and cannot represent every real task. Test important choices with your own data and workflow.

Frequently asked questions

Which visible model has the highest formal rank now?

Among the currently visible models, Claude Opus 5 has the highest formal position at global rank 1. Its Category Score is 67.7. 40 visible models meet the formal ranking rules. This result applies only to the run date and methodology version shown on the page.

Can I compare scores across different categories?

No. Each category uses different capability dimensions and evidence. A Category Score is comparable only inside the same leaderboard. Review the matching category for each task.

Are Estimated and Provisional models still useful?

They can help you find candidates, but their evidence is not complete enough for a formal rank. Review coverage and uncertainty, then test the model on a real task.

How often does the leaderboard update?

The leaderboard updates after a new completed score run is published. The current run date and methodology version appear above. LMSpeed does not promise a fixed daily or weekly schedule.

Is the number one model always best for me?

No. Your result also depends on speed, price, context length, tool support, region, and provider limits. Use the leaderboard to narrow the field, then run your own test.

How is the coding ranking different from general reasoning?

The coding ranking gives more weight to code, repository, debugging, and testing tasks. A reasoning score can explain part of a model's behavior, but it cannot replace executed code and real test results.