Category Score V3 leaderboard

LMSpeed Best Models for Knowledge

Compare AI models for broad and professional knowledge, factuality, retrieval, and open-book tasks using all eligible benchmark evidence in the active LMSpeed score run.

Methodology 3.0Methodology

Current answer

No model currently meets the formal ranking rules. The table has 7 Estimated models and 93 Provisional models. They are useful signals, but they are not formal ranks.

Rankings can change when data or methods change. The run date appears above.

Available leaderboard data

Models shown
100
Formally ranked models
0
Benchmark columns
10
Dimensions with evidence
3/4

How to read the benchmark bars

Each bar compares models only within the same benchmark column. Bar lengths are relative to the models shown here; they are not Category Scores and cannot be compared across benchmark columns.

RankModelLMSpeed scoreBroad knowledgeProfessional knowledgeFactualityStatusEvidenceUpdated
AA-Omniscience Indexundefined modelsBenchLM Knowledge scoreundefined modelsArtificial Analysis Intelligence Indexundefined modelsMMLU-Reduxundefined modelsC-Evalundefined modelsMMLUundefined modelsSuperGPQAundefined modelsHealthBench Hardundefined modelsMedXpertQA (Text)undefined modelsSimpleQAundefined models
Estimated models — unranked7
Claude Opus 4.5Anthropic
57.6±11.6
96.692.270.6Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.7 MaxQwen
55.8±12.2
95.073.6Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.5
53.1±11.6
94.993.070.4Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.6 PlusQwen
52±11.6
94.593.371.6Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.7 PlusQwen
48.6±12.2
94.571.4Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.6 35B A3BQwen
39.1±12.2
90.064.7Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.6 27BQwen
37.3±11.6
93.591.466.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Provisional models — unranked93
Claude Sonnet 4.6Anthropic
70.6±16.3
95.0Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Opus 5Anthropic
68.5±14.0
37.197.0Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Muse Spark 1.1Meta
65.6±14.0
28.192.8Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Opus 4.8Anthropic
63.8±14.0
28.886.8Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
O1OpenAI
62.5±17.4
91.8Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.4 ProOpenAI
62.2±16.1
88.0Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Opus 4.7 MaxAnthropic
61.8±14.0
27.381.8Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Kimi K3MoonshotAI
61.2±14.0
19.783.8Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.5 ProOpenAI
61±16.1
85.5Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Sonnet 5Anthropic
60.9±14.0
16.584.6Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Fable 5Anthropic
60.5±14.0
43.369.4Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
O3 ProOpenAI
60.1±16.0
33.3Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.4OpenAI
59.9±15.1
40.159.6Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.5OpenAI
59.3±14.0
20.577.7Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Opus 4.1Anthropic
59±16.0
28.8Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Grok 4.6SpaceXAI
58.6±14.0
30.570.5Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
DeepSeek V4 Pro 0813DeepSeek
58.4±18.0
57.9Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Grok 4.5SpaceXAI
58±14.0
25.371.1Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3.1 ProGoogle
57.8±15.1
20.671.5Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GLM-5.2Z.ai
57.8±14.0
4.481.2Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.2OpenAI
57.7±14.0
-0.983.7Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3.7 FlashGoogle
57.5±14.0
26.569.0Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3.6 FlashGoogle
57.5±14.0
22.171.2Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.6 SolOpenAI
57.2±16.7
33.1Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.6 TerraOpenAI
57±16.7
32.7Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-4.1OpenAI
57±17.4
90.2Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
O1 ProOpenAI
56.5±16.0
19.1Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.6 LunaOpenAI
56.5±16.7
32.0Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Trinity Large ThinkingArcee AI
56.4±16.0
18.7Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3 ProGoogle
56.1±14.0
15.370.7Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Muse Spark 1.2Meta
55.7±14.0
27.263.2Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
gpt-oss-120bOpenAI
55.4±14.0
64.024.1Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GLM-5.1Z.ai
55.4±14.0
0.975.7Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.6 Max PreviewQwen
55.1±16.3
73.9Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Claude 3 OpusAnthropic
54.7±16.0
11.8Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
DeepSeek R1 Distill QwenDeepSeek
54.4±16.0
11.0Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.3 CodexOpenAI
54.4±16.0
10.9Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Sonnet 4.5Anthropic
54.4±16.1
72.2Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Opus 4.7Anthropic
54.3±14.0
14.865.5Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 1.5 ProGoogle
54.2±16.0
9.8Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
MiMo-V2.5-ProXiaomi
54.1±14.0
3.370.7Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Opus 4.6Anthropic
53.7±13.7
95.014.852.1Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3.5 FlashGoogle
53.7±14.0
21.260.4Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-4 TurboOpenAI
53.6±16.0
7.7Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-4o MiniOpenAI
53.4±16.0
6.7Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.1OpenAI
53±16.0
5.4Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
MiMo-V2-Pro
52.8±16.0
4.6Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Phi 4 Multimodal Instruct
52.7±16.0
4.2Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
DeepSeek V4 ProDeepSeek
52.6±18.0
45.0Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
InklingThinking Machines
52.6±14.0
2.066.8Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.8 MaxQwen
52.3±14.0
3.465.1Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
MiniMax M3MiniMax
52.1±14.0
1.465.7Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
MiniMax M2.7MiniMax
51.9±16.0
0.8Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Inkling SmallThinking Machines
51.8±14.0
-8.969.9Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3.5 Flash-LiteGoogle
51.7±14.0
5.262.3Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Grok 4.3SpaceXAI
51.5±14.0
18.055.4Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.2 CodexOpenAI
51.1±16.0
-2.2Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Command ACohere
50.6±16.0
-4.0Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3 FlashGoogle
50.6±16.0
-4.3Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.1 Codex MaxOpenAI
50±16.0
-6.5Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.1 CodexOpenAI
50±16.0
-6.5Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5OpenAI
49.5±16.0
-8.7Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Sonnet 4Anthropic
49.4±16.0
-9.0Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-4.1 MiniOpenAI
49.3±17.4
87.5Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Kimi K2.7 CodeMoonshotAI
49.1±16.0
-10.2Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-4oOpenAI
49±16.0
-10.5Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Kimi K2.6MoonshotAI
48±14.0
5.351.3Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
O3 MiniOpenAI
47.8±17.4
86.9Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
O3OpenAI
47.7±16.0
-15.5Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
DeepSeek V4 Flash 0731DeepSeek
47.5±18.0
34.1Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GLM-5 TurboZ.ai
47.5±16.0
-16.4Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Llama 3.1Meta
47.3±16.0
-17.1Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Kimi K2.5MoonshotAI
47.1±16.3
69.2Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Hy3Tencent
47±16.0
-18.5Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GLM-5V TurboZ.ai
46.8±16.0
-19.3Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
MiMo-V2-Omni
46.6±16.0
-20.1Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.4 MiniOpenAI
46±14.0
-18.957.6Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
DeepSeek R1DeepSeek
44.7±16.0
-27.4Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Kimi K2MoonshotAI
44.5±16.0
-28.3Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Grok 4.20SpaceXAI
44.1±15.1
20.350.2Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.5-122B-A10BQwen
43.7±16.3
67.1Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Mistral Medium 3Mistral
43.7±16.0
-31.4Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GLM-4.6Z.ai
43.6±16.0
-31.7Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Muse Glimmer 30BMeta
43.3±16.0
-32.8Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.4 NanoOpenAI
43.3±14.0
-29.554.8Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GLM-5Z.ai
43.3±16.3
66.8Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Mistral Medium 3.5Mistral
42.3±16.0
-36.8Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Step 3.7 FlashStepFun
42.2±16.0
-37.3Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.8 27BQwen
41.9±16.1
47.0Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Mistral Large 3
41.6±16.0
-39.6Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
DeepSeek V4 FlashDeepSeek
41.4±18.0
23.1Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.5-27BQwen
41.4±16.3
65.6Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
DeepSeek V3
41.1±16.0
-41.6Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026

What this leaderboard measures

Which AI model is better suited to knowledge questions?

This leaderboard covers broad knowledge, professional knowledge, factuality, and use of open materials. It cannot guarantee that a model knows a recent event.

Available data covers 3/4 dimensions and shows 10 benchmark columns.

Four capability dimensions

The four dimensions come from the category blueprint. Available data may cover only some of them. A dimension without evidence is not presented as a verified capability.

Broad knowledge

6 benchmark columns currently provide evidence for this dimension.

  • AA-Omniscience Index
  • BenchLM Knowledge score
  • Artificial Analysis Intelligence Index
  • MMLU-Redux
  • C-Eval
  • MMLU

Professional knowledge

3 benchmark columns currently provide evidence for this dimension.

  • SuperGPQA
  • HealthBench Hard
  • MedXpertQA (Text)

Factuality

1 benchmark columns currently provide evidence for this dimension.

  • SimpleQA

Retrieval & open-book use

Available data has no eligible evidence for this dimension, so it does not affect this Category Score.

Knowledge tasks this page can help with

  • General questions across common subjects with clear, useful answers.
  • Professional research that requires domain terms and lower factual error rates.
  • Retrieval-augmented questions that use external material instead of memory alone.

How to choose a model with this leaderboard

  1. Step 1

    Check the rating status first

    Only Rated models receive a rank. Estimated and Provisional models do not have a formal position.

  2. Step 2

    Review uncertainty and evidence

    When scores are close, do not rely on rank alone. Check uncertainty, dimension coverage, and benchmark count.

  3. Step 3

    Test the real task last

    A leaderboard cannot replace your own test. Check quality, speed, price, context, and provider limits together.

Use search or reliable sources for time-sensitive questions. Important conclusions still need source checks.

Rating status guide

Rated

Rated means the evidence and overlap rules are met. The model can receive a formal rank.

Estimated

Estimated means there is useful evidence, but it is not enough for a formal rank.

Provisional

Provisional means evidence is limited or dimension and benchmark-family coverage is below the estimated threshold. Use the result only as an early signal.

Benchmarks and evidence sources

Evidence source names and benchmark groups come from the currently available score data. One source may contribute several benchmarks.

  • BenchLM

    AA-Omniscience Index, Artificial Analysis Intelligence Index, BenchLM Knowledge score, C-Eval, HealthBench Hard, MedXpertQA (Text), MMLU, MMLU-Redux, SimpleQA, and SuperGPQA

How the knowledge model ranking is built

LMSpeed combines eligible third-party benchmarks inside four fixed capability dimensions. Rated models meet the evidence and overlap requirements for a formal rank; Estimated and Provisional models remain visible without receiving a rank.

Read the Category Score methodology

Leaderboard limits

Category Scores use the third-party benchmarks currently included by LMSpeed. Tests can use different data, prompts, and scoring rules. The result is not permanent and cannot represent every real task. Test important choices with your own data and workflow.

Frequently asked questions

Which visible model has the highest formal rank now?

There is no formal number one now. The page has 7 Estimated models and 93 Provisional models. They do not have a formal rank and should not be called the winner.

Can I compare scores across different categories?

No. Each category uses different capability dimensions and evidence. A Category Score is comparable only inside the same leaderboard. Review the matching category for each task.

Are Estimated and Provisional models still useful?

They can help you find candidates, but their evidence is not complete enough for a formal rank. Review coverage and uncertainty, then test the model on a real task.

How often does the leaderboard update?

The leaderboard updates after a new completed score run is published. The current run date and methodology version appear above. LMSpeed does not promise a fixed daily or weekly schedule.

Is the number one model always best for me?

No. Your result also depends on speed, price, context length, tool support, region, and provider limits. Use the leaderboard to narrow the field, then run your own test.

Does a high knowledge score prevent factual errors?

No. A high score only shows stronger results on the current knowledge benchmarks. The model can still return old or incorrect information. Check dates and primary sources for important facts.