Category Score V3 leaderboard

LMSpeed Best Models for Reasoning

Compare the best AI reasoning models across abstract logic, scientific reasoning, multi-step constraints, and evidence verification benchmarks with uncertainty-aware Category Scores.

Methodology 3.0Methodology

Current answer

Among the currently visible formally ranked models, GPT-5.6 Sol has the highest position at global rank 1. Its Category Score is 61.2, with an 80% uncertainty range of ±8.7. 64 visible models have a formal rank. This result applies only to this score run.

View GPT-5.6 Sol detailsRankings can change when data or methods change. The run date appears above.

Available leaderboard data

Models shown
100
Formally ranked models
64
Benchmark columns
12
Dimensions with evidence
4/4

How to read the benchmark bars

Each bar compares models only within the same benchmark column. Bar lengths are relative to the models shown here; they are not Category Scores and cannot be compared across benchmark columns.

RankModelLMSpeed scoreAbstract logicScientific & causal reasoningMulti-step constraintsEvidence integration & verificationStatusEvidenceUpdated
ARC-AGI-2undefined modelsGPQAundefined modelsHLEundefined modelsCritPtundefined modelsHLE w/o toolsundefined modelsAA-GPQA Diamondundefined modelsAA-HLEundefined modelsMMLU-Proundefined modelsAA-LCRundefined modelsLongBench v2undefined modelsMRCR 1Mundefined modelsAI-Needleundefined models
Formally ranked models64
1GPT-5.6 SolOpenAI
61.2±8.7
92.593.1%47.3%32.377.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
2DeepSeek V4 Pro 0813DeepSeek
61±8.3
18.092.841.087.5%75.383.5Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
3Claude Opus 4.5Anthropic
60.7±8.1
86.6%30.1%0.389.5%67.364.474.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
4Claude Opus 5Anthropic
60.3±8.7
90.491.9%51.3%29.156.375.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
5Qwen3.7 MaxQwen
59.6±8.7
92.3%40.5%13.489.6%74.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
6DeepSeek V4 Flash 0731DeepSeek
59.4±8.3
16.690.838.686.2%74.378.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
7GPT-5.5OpenAI
59.2±8.7
85.092.6%42.4%27.141.479.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
8GPT-5.6 TerraOpenAI
58.7±8.7
83.989.6%38.5%30.079.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
9Gemini 3.1 ProGoogle
58.2±8.7
77.117.745.494.147.079.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
10Qwen3.7 PlusQwen
57.4±8.7
90.0%35.6%9.188.5%69.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
11Claude Opus 4.7 MaxAnthropic
56.7±8.7
75.812.046.991.442.375.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
12Qwen3.6 PlusQwen
56.6±8.1
88.2%27.8%2.988.5%72.362.068.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
13Claude Opus 4.8Anthropic
56.4±8.7
72.192.0%48.7%20.949.873.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
14GPT-5.4OpenAI
56.2±8.7
74.087.1%30.8%23.439.877.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
15Kimi K2.5MoonshotAI
55.5±8.3
87.9%30.7%3.187.1%73.061.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
16GPT-5.1 CodexOpenAI
55.3±8.7
86.0%25.7%5.786.0%69.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
17DeepSeek V4 ProDeepSeek
54.8±9.0
92.8%41.0%82.9%44.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
18GPT-5.6 LunaOpenAI
54.4±8.7
59.585.9%25.8%20.678.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
19GLM-4.7Z.ai
54.4±8.7
85.9%27.4%1.785.6%68.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
20Qwen3.6 27BQwen
54.4±8.7
82.9%15.1%1.186.2%73.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
21Grok 4.5SpaceXAI
54.4±8.7
52.693.1%42.7%15.474.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
22O3OpenAI
54.3±8.7
82.7%20.1%1.185.3%73.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
23Gemini 2.5 ProGoogle
54.2±8.7
84.4%22.5%2.686.2%66.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
24Gemini 3 ProGoogle
54.1±6.4
31.190.8%39.7%9.189.8%73.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
25GPT-5.1OpenAI
54±8.7
64.3%5.3%4.987.0%76.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
26DeepSeek V4 FlashDeepSeek
53.7±9.0
90.8%38.6%83.0%37.5Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
27Qwen3.5-27BQwen
53.6±8.3
85.8%23.9%0.986.1%72.360.6Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
28GPT-5.2OpenAI
53.5±6.4
52.986.4%26.7%11.681.4%79.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
29Claude Opus 4.6Anthropic
53.4±8.7
89.6%39.9%2.840.082.0%62.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
30Gemini 3.5 FlashGoogle
53.4±8.4
72.192.1%41.3%13.169.326.6Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
31Qwen3.5-122B-A10BQwen
53.1±8.3
85.7%25.2%0.686.7%70.360.2Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
32GPT-5OpenAI
52.7±8.7
68.6%6.6%5.782.0%76.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
33Qwen3.6 35B A3BQwen
52.4±8.7
81.7%13.9%0.385.2%66.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
34Qwen3.5
52.3±8.1
45.6%2.6%1.787.8%72.763.268.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
35Gemini 3 FlashGoogle
52.2±8.7
81.2%15.0%1.488.2%53.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
36Qwen3.5-35B-A3BQwen
51.2±8.3
84.5%21.0%0.985.3%68.359.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
37DeepSeek V3.2DeepSeek
51±8.7
87.1%28.7%0.986.3%42.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
38Inkling SmallThinking Machines
50.9±8.7
40.189.5%33.3%8.331.669.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
39O1OpenAI
50.7±8.7
76.5%7.0%0.384.8%63.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
40DeepSeek R1DeepSeek
50.2±8.7
70.8%8.5%1.484.9%56.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
41Claude Sonnet 4.6Anthropic
49.8±8.7
79.7%11.2%0.979.2%62.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
42gpt-oss-120bOpenAI
49.2±8.7
78.2%19.6%1.180.8%51.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
43Gemini 2.5 FlashGoogle
48.9±8.7
76.6%8.7%1.483.6%48.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
44GLM-5Z.ai
48.9±8.1
66.6%7.6%2.085.7%70.760.863.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
45Qwen3 MaxQwen
48.9±8.7
76.4%11.9%0.084.1%48.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
46DeepSeek V3.1DeepSeek
48.7±8.7
77.9%14.3%0.083.3%46.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
47Kimi K2MoonshotAI
48.6±8.7
76.6%7.4%0.082.4%53.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
48GPT-4.1OpenAI
48.5±8.7
66.6%4.2%0.080.6%64.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
49MiMo-V2-Flash
48.4±8.7
84.6%22.8%0.084.3%35.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
50Claude Sonnet 4Anthropic
47.4±8.7
68.3%4.3%1.183.7%45.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
51GLM-4.5 AirZ.ai
47±8.7
73.3%7.0%0.081.5%45.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
52Llama 4 MaverickMeta
46.8±8.7
67.1%4.9%0.080.9%50.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
53Command ACohere
45.5±8.7
76.1%12.0%0.371.2%48.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
54GPT-4.1 MiniOpenAI
45.4±8.7
66.4%5.0%0.078.1%45.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
55Mistral Large 3
44.5±8.7
68.0%4.2%0.080.7%34.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
56DeepSeek V3
44.4±8.7
65.5%4.7%0.081.9%31.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
57gpt-oss-20bOpenAI
44.2±8.7
68.8%11.0%1.474.8%33.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
58GLM-4.6Z.ai
42.8±8.7
63.2%5.5%0.078.4%28.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
59Mistral Medium 3Mistral
42.3±8.7
57.8%4.1%0.076.0%31.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
60Llama 4 ScoutMeta
41.8±8.7
58.7%3.8%0.075.2%30.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
61GPT-4oOpenAI
39.9±8.7
51.1%2.7%0.077.3%0.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
62DeepSeek R1 Distill QwenDeepSeek
39.1±8.9
48.4%4.1%74.0%8.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
63Phi 4Microsoft
39.1±8.7
57.5%3.8%0.071.4%0.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
64GPT-4.1 NanoOpenAI
37.6±8.7
51.2%3.8%0.065.7%19.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
Estimated models — unranked36
Qwen3.8 MaxQwen
64.5±10.1
92.7%43.0%20.043.674.366.3Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Muse Spark 1.2Meta
61.3±10.8
90.4%45.5%17.783.3Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Fable 5Anthropic
60.6±10.8
92.6%55.5%28.676.7Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3 Flash PreviewGoogle
60.2±11.1
89.8%36.6%89.0%Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3.6 FlashGoogle
59.7±10.8
92.8%40.8%10.679.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.3 CodexOpenAI
59.7±10.8
91.5%42.5%16.978.3Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Muse Spark 1.1Meta
59.5±10.2
89.8%46.2%15.152.281.354.1Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3.7 FlashGoogle
59.3±10.8
90.1%35.1%14.380.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Grok 4.6SpaceXAI
59.3±10.8
93.5%44.1%17.175.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Kimi K3MoonshotAI
59.3±10.8
84.2%25.0%23.443.582.7Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
MiniMax M3MiniMax
59.2±10.8
92.9%39.0%3.780.3Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.4 ProOpenAI
59.1±11.3
83.358.7%30.042.7Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.2 CodexOpenAI
58.7±10.8
89.9%35.7%8.779.3Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Kimi K2.7 CodeMoonshotAI
57.5±10.8
89.6%35.0%10.075.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
MiniMax M2.1MiniMax
56.8±11.1
83.0%23.2%87.5%Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Hy3Tencent
56.7±10.8
89.7%33.5%4.974.7Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5 CodexOpenAI
56.7±11.1
83.7%27.8%86.5%Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Sonnet 5Anthropic
56.3±10.8
80.0%19.0%16.943.277.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Muse Glimmer 30BMeta
56.1±10.8
2.683.522.080.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Opus 4.7Anthropic
55.9±10.8
88.5%33.3%5.172.3Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.4 MiniOpenAI
55.6±10.8
87.5%28.1%10.028.273.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.6 Max PreviewQwen
55.5±10.8
88.8%30.8%3.772.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Kimi K2 ThinkingMoonshotAI
55.5±11.1
83.8%23.8%84.8%Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
InklingThinking Machines
55.4±10.8
87.2%31.9%5.430.073.3Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 2.5 Pro Preview 06-05Google
55.4±11.1
83.6%18.0%85.8%Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Kimi K2.6MoonshotAI
55.3±10.8
78.8%19.6%8.076.7Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3 Max ThinkingQwen
55.1±11.1
86.1%28.0%82.4%Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
MiniMax M2.7MiniMax
54.6±10.8
87.4%29.6%0.675.3Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GLM-5.2Z.ai
54.5±10.8
68.6%9.8%20.940.576.7Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.1 Codex MaxOpenAI
54.3±10.8
5.786.025.769.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Grok 4.3SpaceXAI
54.3±10.8
89.0%30.0%8.064.3Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
MiMo-V2.5-ProXiaomi
54.2±10.8
76.2%14.8%4.034.077.7Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
DeepSeek V3.1 TerminusDeepSeek
54.1±11.1
79.2%16.4%85.1%Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
DeepSeek V3.2 ExpDeepSeek
54±11.1
79.7%14.9%85.0%Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GLM-5.1Z.ai
53.8±10.8
83.9%27.9%4.668.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3 235B A22B Instruct 2507Qwen
53.6±11.1
79.0%15.9%84.3%Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026

What this leaderboard measures

Which AI model is better suited to complex reasoning?

This leaderboard covers logic, causality, multi-step constraints, and evidence verification. It measures reasoning performance, not a model's total ability across every task.

Available data covers 4/4 dimensions and shows 12 benchmark columns.

Four capability dimensions

The four dimensions come from the category blueprint. Available data may cover only some of them. A dimension without evidence is not presented as a verified capability.

Abstract logic

1 benchmark columns currently provide evidence for this dimension.

  • ARC-AGI-2

Scientific & causal reasoning

6 benchmark columns currently provide evidence for this dimension.

  • GPQA
  • HLE
  • CritPt
  • HLE w/o tools
  • AA-GPQA Diamond
  • AA-HLE

Multi-step constraints

1 benchmark columns currently provide evidence for this dimension.

  • MMLU-Pro

Evidence integration & verification

4 benchmark columns currently provide evidence for this dimension.

  • AA-LCR
  • LongBench v2
  • MRCR 1M
  • AI-Needle

Reasoning tasks this page can help with

  • Complex analysis that requires keeping several conditions and intermediate conclusions aligned.
  • Scientific questions that require causal reasoning, hypotheses, and evidence.
  • Conclusion checks that look for gaps and test whether evidence supports a claim.

How to choose a model with this leaderboard

  1. Step 1

    Check the rating status first

    Only Rated models receive a rank. Estimated and Provisional models do not have a formal position.

  2. Step 2

    Review uncertainty and evidence

    When scores are close, do not rely on rank alone. Check uncertainty, dimension coverage, and benchmark count.

  3. Step 3

    Test the real task last

    A leaderboard cannot replace your own test. Check quality, speed, price, context, and provider limits together.

Do not rely on one high score. Review the uncertainty range, task type, answer stability, and cost of verification.

Rating status guide

Rated

Rated means the evidence and overlap rules are met. The model can receive a formal rank.

Estimated

Estimated means there is useful evidence, but it is not enough for a formal rank.

Provisional

Provisional means evidence is limited or dimension and benchmark-family coverage is below the estimated threshold. Use the result only as an early signal.

Benchmarks and evidence sources

Evidence source names and benchmark groups come from the currently available score data. One source may contribute several benchmarks.

  • Artificial Analysis

    GPQA, HLE, and MMLU-Pro

  • BenchLM

    AA-GPQA Diamond, AA-HLE, AA-LCR, AI-Needle, ARC-AGI-2, CritPt, GPQA, HLE, HLE w/o tools, LongBench v2, MMLU-Pro, and MRCR 1M

How the reasoning model ranking is built

LMSpeed combines eligible third-party benchmarks inside four fixed capability dimensions. Rated models meet the evidence and overlap requirements for a formal rank; Estimated and Provisional models remain visible without receiving a rank.

Read the Category Score methodology

Leaderboard limits

Category Scores use the third-party benchmarks currently included by LMSpeed. Tests can use different data, prompts, and scoring rules. The result is not permanent and cannot represent every real task. Test important choices with your own data and workflow.

Frequently asked questions

Which visible model has the highest formal rank now?

Among the currently visible models, GPT-5.6 Sol has the highest formal position at global rank 1. Its Category Score is 61.2. 64 visible models meet the formal ranking rules. This result applies only to the run date and methodology version shown on the page.

Can I compare scores across different categories?

No. Each category uses different capability dimensions and evidence. A Category Score is comparable only inside the same leaderboard. Review the matching category for each task.

Are Estimated and Provisional models still useful?

They can help you find candidates, but their evidence is not complete enough for a formal rank. Review coverage and uncertainty, then test the model on a real task.

How often does the leaderboard update?

The leaderboard updates after a new completed score run is published. The current run date and methodology version appear above. LMSpeed does not promise a fixed daily or weekly schedule.

Is the number one model always best for me?

No. Your result also depends on speed, price, context length, tool support, region, and provider limits. Use the leaderboard to narrow the field, then run your own test.

Is a reasoning score the same as a math score?

No. Math is a separate category. The reasoning leaderboard also covers abstract logic, scientific causality, multi-step constraints, and evidence verification. A strong math score does not prove better results on every reasoning task.