Category Score V3 leaderboard
LMSpeed Best Models for Coding
Compare the best AI coding models across code generation, repository engineering, debugging, testing, and tool-assisted development benchmarks in one evidence-rich leaderboard.
Methodology 3.0Methodology
Current answer
Among the currently visible formally ranked models, Claude Opus 5 has the highest position at global rank 1. Its Category Score is 67.7, with an 80% uncertainty range of ±6.6. 40 visible models have a formal rank. This result applies only to this score run.
Available leaderboard data
- Models shown
- 100
- Formally ranked models
- 40
- Benchmark columns
- 16
- Dimensions with evidence
- 4/4
How to read the benchmark bars
Each bar compares models only within the same benchmark column. Bar lengths are relative to the models shown here; they are not Category Scores and cannot be compared across benchmark columns.
| Rank | Model | LMSpeed score | Code generation | Repository engineering | Debugging & testing | Tool-assisted development & quality | Status | Evidence | Updated | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SciCodeundefined models | LiveCodeBenchundefined models | AA-SciCodeundefined models | LiveCodeBench v6undefined models | LiveCodeBench Proundefined models | AA Coding Indexundefined models | SWE-bench Proundefined models | Vibe Code Benchundefined models | NL2Repoundefined models | React Native Evalsundefined models | SWE-bench Verifiedundefined models | SWE Multilingualundefined models | SWE-Rebenchundefined models | Terminal-Bench 2.0undefined models | AA Terminal-Bench 2.1undefined models | Terminal-Bench Hardundefined models | ||||||
| Formally ranked models40 | |||||||||||||||||||||
| 1 | Claude Opus 5Anthropic | 67.7±6.6 | 50.7% | — | — | — | — | — | 79.2 | — | — | — | 96.0 | 89.5 | — | — | 89.1 | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 2 | Claude Fable 5Anthropic | 67.1±6.9 | 60.2% | — | — | — | — | — | 80.0 | — | — | — | 95.0 | — | — | 84.3 | 84.6 | 62.9 | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 3 | Claude Opus 4.8Anthropic | 65.2±6.6 | 53.5% | — | — | — | — | — | 69.2 | — | — | — | 88.6 | 84.4 | — | 74.6 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 4 | Claude Opus 4.7 MaxAnthropic | 60.8±6.9 | — | — | 54.5 | — | — | — | 64.3 | — | — | — | 87.6 | — | — | 69.4 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 5 | GPT-5.5OpenAI | 59.7±8.7 | 53.5% | — | — | — | — | — | 58.6 | 69.8 | — | 84.7 | — | — | — | 82.0 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 6 | Claude Sonnet 5Anthropic | 59.6±6.6 | 48.6% | — | — | — | — | — | 63.2 | — | — | — | 85.2 | 78.3 | — | 80.4 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 7 | Grok 4.5SpaceXAI | 59.5±6.9 | 54.1% | — | — | — | — | — | 64.7 | — | — | — | — | 78.0 | — | 83.3 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 8 | Claude Opus 4.6Anthropic | 58.9±8.0 | 51.9% | — | — | — | 70.7 | — | 53.4 | 57.6 | — | 84.1 | 80.8 | — | 65.3 | — | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 9 | GPT-5.3 CodexOpenAI | 58.3±8.5 | 53.2% | — | — | — | — | — | 56.8 | 61.8 | — | — | 85.0 | — | 58.2 | — | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 10 | DeepSeek V4 Pro 0813DeepSeek | 57.1±6.1 | — | — | 49.2 | — | — | — | 55.4 | 49.9 | 61.5 | — | 80.6 | 76.2 | — | 67.9 | 78.7 | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 11 | Qwen3.7 MaxQwen | 57±6.0 | 48.8% | 91.6% | — | — | — | — | 60.6 | — | 47.2 | — | 80.4 | 78.3 | — | 69.7 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 12 | GPT-5.2OpenAI | 56.2±8.5 | 46.2% | 89.4% | — | — | — | — | 55.6 | 53.5 | — | — | 80.0 | — | — | — | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 13 | Claude Sonnet 4.6Anthropic | 55.9±8.5 | 44.1% | — | — | — | — | — | — | 51.5 | — | 80.6 | 79.6 | — | 60.7 | — | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 14 | Gemini 3.5 FlashGoogle | 55.8±8.9 | 53.0% | — | — | — | — | — | 55.1 | 48.7 | — | — | — | — | — | 76.2 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 15 | Claude Opus 4.5Anthropic | 55.7±8.1 | 49.5% | 87.1% | — | 84.8 | — | — | 57.1 | — | 43.2 | — | 80.9 | 77.5 | — | — | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 16 | Kimi K2.6MoonshotAI | 55.5±6.0 | 53.5% | — | — | 89.6 | — | — | 58.6 | 37.9 | — | — | 80.2 | 76.7 | — | 66.7 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 17 | GLM-5.2Z.ai | 54.3±8.9 | 36.1% | — | — | — | — | — | 62.1 | — | 48.9 | — | — | — | — | 81.0 | 77.9 | 50.8 | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 18 | GLM-5.1Z.ai | 53.7±8.8 | 36.1% | — | — | — | — | — | 58.4 | 31.5 | 42.7 | — | — | — | 62.7 | — | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 19 | DeepSeek V4 Flash 0731DeepSeek | 52.9±6.3 | — | — | 49.9 | — | — | — | 52.6 | — | 54.2 | — | 79.0 | 73.3 | — | 56.9 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 20 | Qwen3.7 PlusQwen | 52.9±6.0 | 45.5% | 89.6% | — | — | — | — | 57.6 | — | 41.1 | — | 77.7 | 75.8 | — | 70.3 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 21 | Inkling SmallThinking Machines | 52.7±6.9 | 48.7% | — | — | — | — | — | 55.9 | — | — | — | 80.2 | — | — | 64.7 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 22 | MiniMax M3MiniMax | 52.7±6.6 | 45.4% | — | — | — | — | — | 59.0 | — | 42.1 | — | 80.5 | — | — | 66.0 | 65.2 | 42.4 | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 23 | Qwen3.6 Max PreviewQwen | 51.6±8.9 | 46.9% | — | — | — | — | — | 57.3 | — | 42.9 | — | — | — | — | 65.4 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 24 | GLM-5Z.ai | 51.5±8.1 | 38.3% | — | — | — | — | — | 55.1 | 23.4 | — | 74.8 | 77.8 | 73.3 | 62.8 | — | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 25 | Qwen3.6 PlusQwen | 51.3±8.2 | 40.7% | — | — | 87.1 | — | — | 56.6 | 25.6 | — | — | 78.8 | 73.8 | — | — | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 26 | DeepSeek V3.2DeepSeek | 51.2±8.6 | 44.0% | 89.6% | — | — | — | — | — | 5.1 | — | 71.5 | — | — | 60.9 | — | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 27 | InklingThinking Machines | 49.8±6.9 | 46.1% | — | — | — | — | — | 54.3 | — | — | — | 77.6 | — | — | 63.8 | 55.1 | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 28 | Kimi K2.5MoonshotAI | 48.4±7.8 | 49.0% | — | — | 85.0 | — | — | 50.7 | 17.5 | — | 77.2 | 76.8 | 73.0 | 58.5 | — | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 29 | gpt-oss-120bOpenAI | 47.8±9.1 | 38.9% | 87.8% | — | — | — | — | — | — | — | 71.6 | — | — | — | — | — | 23.5 | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 30 | DeepSeek V4 ProDeepSeek | 47.8±6.6 | 49.2% | — | — | — | — | — | 52.1 | — | — | — | 73.6 | 69.8 | — | 59.1 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 31 | MiniMax M2.7MiniMax | 47.2±8.2 | 47.0% | — | — | — | — | — | 56.2 | 27.0 | 39.8 | 71.4 | — | 76.5 | 51.9 | — | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 32 | Grok 4.20SpaceXAI | 47.2±8.6 | 45.6% | — | — | — | 74.2 | — | 51.8 | 4.1 | — | — | 76.7 | — | — | — | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 33 | Qwen3.6 27BQwen | 46.9±6.0 | 37.3% | 83.9% | — | — | — | — | 53.5 | — | 36.2 | — | 77.2 | 71.3 | — | 59.3 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 34 | Muse Glimmer 30BMeta | 46.6±6.9 | — | — | 43.6 | — | — | — | 51.2 | — | — | — | 76.0 | — | — | — | 51.7 | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 35 | DeepSeek V4 FlashDeepSeek | 45.9±6.6 | 49.9% | — | — | — | — | — | 49.1 | — | — | — | 73.7 | 69.7 | — | 49.1 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 36 | Qwen3.5 | 40.5±8.9 | 2.8% | — | — | 83.6 | — | — | 50.9 | — | — | — | 76.2 | — | — | — | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 37 | Laguna M 1Poolside | 39.4±8.9 | — | — | — | — | — | — | 49.2 | — | — | — | 74.6 | 63.1 | — | 45.8 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 38 | Gemini 2.5 ProGoogle | 39.1±8.9 | 42.8% | 80.1% | — | — | — | — | — | 0.4 | — | — | 63.8 | — | — | — | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 39 | Qwen3.6 35B A3BQwen | 37.7±6.0 | 1.3% | 80.4% | — | — | — | — | 49.5 | — | 29.4 | — | 73.4 | 67.2 | — | 51.5 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| 40 | Laguna Xs 2Poolside | 34±8.9 | — | — | — | — | — | — | 46.3 | — | — | — | 69.9 | 57.7 | — | 35.7 | — | — | Rated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| Estimated models — unranked52 | |||||||||||||||||||||
| — | Qwen3.8 MaxQwen | 66.1±11.2 | 52.9% | — | — | — | — | — | 67.7 | — | 55.9 | — | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GPT-5.4OpenAI | 62.4±10.3 | 50.3% | — | — | — | 87.5 | — | 57.7 | 67.4 | — | 85.3 | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GPT-5.6 SolOpenAI | 61.7±9.3 | 56.0% | — | — | — | — | — | 64.6 | — | — | — | — | — | — | 91.9 | 88.0 | 65.9 | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Claude Opus 4.7Anthropic | 60±11.2 | 50.1% | — | — | — | — | — | — | 71.0 | — | 82.8 | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Muse Spark 1.1Meta | 59±9.3 | 58.2% | — | — | — | — | — | 61.5 | — | — | — | — | — | — | 80.0 | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GPT-5.6 TerraOpenAI | 58.9±9.3 | 50.1% | — | — | — | — | — | 63.4 | — | — | — | — | — | — | 87.4 | 88.0 | 57.6 | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Grok 4.6SpaceXAI | 58.7±11.9 | 51.6% | — | — | — | — | — | — | — | — | — | — | — | — | — | 88.4 | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Gemini 3.1 ProGoogle | 58.7±10.7 | — | — | 58.9 | — | 82.9 | — | — | 32.0 | — | 78.9 | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Gemini 3.7 FlashGoogle | 58.3±11.9 | 53.6% | — | — | — | — | — | — | — | — | — | — | — | — | — | 85.8 | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GPT-5.2 CodexOpenAI | 57.8±11.8 | 54.6% | — | — | — | — | — | — | 37.9 | — | — | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Muse Spark 1.2Meta | 57.5±11.9 | 56.4% | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.1 | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GPT-5.4 MiniOpenAI | 57.5±11.8 | 49.9% | — | — | — | — | — | — | 48.0 | — | — | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Kimi K3MoonshotAI | 57.3±11.9 | 51.2% | — | — | — | — | — | — | — | — | — | — | — | — | — | 85.0 | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GPT-5.6 LunaOpenAI | 56.7±9.3 | 45.8% | — | — | — | — | — | 62.7 | — | — | — | — | — | — | 84.7 | 80.9 | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Gemini 3.6 FlashGoogle | 55.6±11.9 | 52.7% | — | — | — | — | — | — | — | — | — | — | — | — | — | 77.5 | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Gemini 3 ProGoogle | 55.5±11.2 | 56.1% | 91.7% | — | — | — | — | — | 14.3 | — | — | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Laguna S 2.1Poolside | 54.1±9.3 | — | — | — | — | — | — | 59.4 | — | — | — | — | 78.5 | — | 70.2 | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Qwen3.8 27BQwen | 54±10.6 | 35.6% | — | — | 90.3 | — | — | 61.7 | — | 42.3 | — | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Gemini 3 FlashGoogle | 53.7±11.2 | 49.9% | 79.7% | — | — | — | — | — | 20.2 | — | — | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | MiMo-V2-Pro | 53.1±11.8 | 42.5% | — | — | — | — | — | — | — | — | — | 78.0 | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GLM-4.7Z.ai | 53±10.5 | 45.1% | 89.4% | — | — | — | — | — | — | — | — | 73.8 | — | 58.7 | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Claude Sonnet 4.5Anthropic | 51.8±11.2 | 42.8% | 59.0% | — | — | — | — | — | — | — | — | 77.2 | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | MiMo-V2.5-ProXiaomi | 50.9±9.3 | 39.1% | — | — | — | — | — | 57.2 | — | — | — | — | — | — | 68.4 | — | 43.2 | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GPT-5.1 Codex MaxOpenAI | 50.8±11.8 | — | — | 40.2 | — | — | — | — | 22.2 | — | — | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | MiMo-V2-Flash | 50.8±11.2 | 39.4% | 86.8% | — | — | — | — | — | — | — | — | 73.4 | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | MiMo-V2.5Xiaomi | 50.7±9.3 | 43.1% | — | — | — | — | — | 56.1 | — | — | — | — | — | — | 65.8 | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GPT-5.1 CodexOpenAI | 50.6±11.2 | 40.2% | 84.9% | — | — | — | — | — | 13.1 | — | — | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | MiniMax M2.5MiniMax | 50.2±11.8 | 42.6% | — | — | — | — | — | — | 14.9 | — | — | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Ling-3.0-flashInclusionai | 50.1±9.3 | 41.1% | — | — | — | — | — | 56.6 | — | — | — | — | 72.4 | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GPT-5.4 NanoOpenAI | 49.7±11.8 | 35.2% | — | — | — | — | — | — | 26.1 | — | — | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GPT-5 MiniOpenAI | 49.5±11.2 | 41.0% | 69.2% | — | — | — | — | — | 14.2 | — | — | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Step 3.7 FlashStepFun | 49.2±9.3 | 40.0% | — | — | — | — | — | 56.3 | — | — | — | — | — | — | 59.5 | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GPT-5.1OpenAI | 49.1±11.2 | 36.5% | 49.4% | — | — | — | — | — | 24.6 | — | — | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Mistral Medium 3.5Mistral | 49.1±9.3 | 39.6% | — | — | — | — | — | — | — | — | — | 77.6 | — | — | — | 50.6 | 33.3 | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GPT-5OpenAI | 49±11.2 | 37.8% | 54.3% | — | — | — | — | — | 20.1 | — | — | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Qwen3.5-27BQwen | 48.9±11.2 | 39.5% | — | — | — | — | — | — | — | — | — | 72.4 | — | 58.9 | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | MiMo-V2-Omni | 48.8±11.8 | 36.7% | — | — | — | — | — | — | — | — | — | 74.8 | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Qwen3.5-122B-A10BQwen | 48.7±11.8 | 42.0% | — | — | — | — | — | — | — | — | — | 72.0 | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | gpt-oss-20bOpenAI | 48±11.2 | 34.4% | 77.7% | — | — | — | — | — | — | — | 71.0 | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Hy3 previewTencent | 47.7±9.3 | 39.4% | — | — | — | — | — | — | — | — | — | 74.4 | — | — | 54.4 | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Gemini 3.5 Flash-LiteGoogle | 47.2±9.3 | 40.9% | — | — | — | — | — | 54.2 | — | — | — | — | — | — | 54.0 | 53.6 | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Claude Haiku 4.5Anthropic | 46.5±11.2 | 34.4% | 51.1% | — | — | — | — | — | — | — | — | 73.3 | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Claude Sonnet 4Anthropic | 46.4±11.2 | 37.3% | 44.9% | — | — | — | — | — | — | — | — | 72.7 | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Qwen3 MaxQwen | 45.1±11.2 | 38.3% | 76.7% | — | — | — | — | — | 3.5 | — | — | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Command ACohere | 44.7±11.4 | 37.8% | 28.7% | — | — | — | — | — | — | — | — | — | — | — | — | — | 25.0 | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Qwen3.5-35B-A3BQwen | 42±11.2 | 37.7% | — | — | — | — | — | — | — | — | — | 69.2 | — | 53.7 | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GLM-4.6Z.ai | 41.9±11.2 | 33.1% | 56.1% | — | — | — | — | — | 3.1 | — | — | — | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | O3 MiniOpenAI | 40.5±11.2 | 39.9% | 71.7% | — | — | — | — | — | — | — | — | 49.3 | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GPT-4.1 MiniOpenAI | 39±11.2 | 40.4% | 48.3% | — | — | — | — | — | — | — | — | 23.6 | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GPT-4.1OpenAI | 38.3±11.2 | 38.1% | 45.7% | — | — | — | — | — | — | — | — | 54.6 | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | DeepSeek V3 | 37.4±11.2 | 35.8% | 40.5% | — | — | — | — | — | — | — | — | 42.0 | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Claude 3.5 SonnetAnthropic | 36.2±11.2 | 31.6% | 38.1% | — | — | — | — | — | — | — | — | 49.0 | — | — | — | — | — | Estimated | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| Provisional models — unranked8 | |||||||||||||||||||||
| — | Gemini 3.1 Pro PreviewGoogle | 64.9±16.0 | 58.9% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | GLM 5.3Z.ai | 63.3±16.0 | 56.5% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Gemini 3 Flash PreviewGoogle | 62.2±13.9 | 50.6% | 90.8% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Qwen3.8 2.4T A95BQwen | 60.1±16.0 | 51.6% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Grok Build 0 1SpaceXAI | 59.1±16.0 | 50.2% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | O4 MiniOpenAI | 58.9±13.9 | 46.5% | 85.9% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Hy3Tencent | 57.4±16.0 | 47.6% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | undefined/4 dimensions · undefined families | Aug 28, 2026 |
| — | Kimi K2.7 CodeMoonshotAI | 57.4±16.0 | 47.5% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | undefined/4 dimensions · undefined families | Aug 28, 2026 |
What this leaderboard measures
Which AI model is better suited to coding?
This leaderboard covers code generation, repository understanding, debugging, testing, and tool-assisted development. A single coding problem cannot represent full software engineering ability.
Four capability dimensions
The four dimensions come from the category blueprint. Available data may cover only some of them. A dimension without evidence is not presented as a verified capability.
Code generation
6 benchmark columns currently provide evidence for this dimension.
- SciCode
- LiveCodeBench
- AA-SciCode
- LiveCodeBench v6
- LiveCodeBench Pro
- AA Coding Index
Repository engineering
4 benchmark columns currently provide evidence for this dimension.
- SWE-bench Pro
- Vibe Code Bench
- NL2Repo
- React Native Evals
Debugging & testing
3 benchmark columns currently provide evidence for this dimension.
- SWE-bench Verified
- SWE Multilingual
- SWE-Rebench
Tool-assisted development & quality
3 benchmark columns currently provide evidence for this dimension.
- Terminal-Bench 2.0
- AA Terminal-Bench 2.1
- Terminal-Bench Hard
Coding tasks this page can help with
- Daily coding work such as completing functions, explaining code, and building small features.
- Cross-file repository changes that require understanding the existing structure and limiting the edit scope.
- Coding agents that use a terminal, tests, and code tools to finish a task.
How to choose a model with this leaderboard
- Step 1
Check the rating status first
Only Rated models receive a rank. Estimated and Provisional models do not have a formal position.
- Step 2
Review uncertainty and evidence
When scores are close, do not rely on rank alone. Check uncertainty, dimension coverage, and benchmark count.
- Step 3
Test the real task last
A leaderboard cannot replace your own test. Check quality, speed, price, context, and provider limits together.
Filter by language, repository size, and toolchain first. Also check test success, edit scope, speed, and cost.
Rating status guide
Rated
Rated means the evidence and overlap rules are met. The model can receive a formal rank.
Estimated
Estimated means there is useful evidence, but it is not enough for a formal rank.
Provisional
Provisional means evidence is limited or dimension and benchmark-family coverage is below the estimated threshold. Use the result only as an early signal.
Benchmarks and evidence sources
Evidence source names and benchmark groups come from the currently available score data. One source may contribute several benchmarks.
Artificial Analysis
AA Coding Index, LiveCodeBench, and SciCode
BenchLM
AA Terminal-Bench 2.1, AA-SciCode, LiveCodeBench, LiveCodeBench Pro, LiveCodeBench v6, NL2Repo, React Native Evals, SWE Multilingual, SWE-bench Pro, SWE-bench Verified, SWE-Rebench, Terminal-Bench 2.0, Terminal-Bench Hard, and Vibe Code Bench
How the coding model ranking is built
LMSpeed combines eligible third-party benchmarks inside four fixed capability dimensions. Rated models meet the evidence and overlap requirements for a formal rank; Estimated and Provisional models remain visible without receiving a rank.
Read the Category Score methodologyLeaderboard limits
Category Scores use the third-party benchmarks currently included by LMSpeed. Tests can use different data, prompts, and scoring rules. The result is not permanent and cannot represent every real task. Test important choices with your own data and workflow.
Frequently asked questions
Which visible model has the highest formal rank now?
Among the currently visible models, Claude Opus 5 has the highest formal position at global rank 1. Its Category Score is 67.7. 40 visible models meet the formal ranking rules. This result applies only to the run date and methodology version shown on the page.
Can I compare scores across different categories?
No. Each category uses different capability dimensions and evidence. A Category Score is comparable only inside the same leaderboard. Review the matching category for each task.
Are Estimated and Provisional models still useful?
They can help you find candidates, but their evidence is not complete enough for a formal rank. Review coverage and uncertainty, then test the model on a real task.
How often does the leaderboard update?
The leaderboard updates after a new completed score run is published. The current run date and methodology version appear above. LMSpeed does not promise a fixed daily or weekly schedule.
Is the number one model always best for me?
No. Your result also depends on speed, price, context length, tool support, region, and provider limits. Use the leaderboard to narrow the field, then run your own test.
How is the coding ranking different from general reasoning?
The coding ranking gives more weight to code, repository, debugging, and testing tasks. A reasoning score can explain part of a model's behavior, but it cannot replace executed code and real test results.
