Category Score V3 leaderboard

LMSpeed Best Models for AI Agents

Compare the best AI models for agents across planning, tool use, environment execution, and recovery benchmarks. Formal ranks use LMSpeed Category Score V3 evidence and uncertainty rules.

Methodology 3.0Methodology

Current answer

Among the currently visible formally ranked models, Kimi K3 has the highest position at global rank 1. Its Category Score is 68.3, with an 80% uncertainty range of ±7.3. 55 visible models have a formal rank. This result applies only to this score run.

View Kimi K3 detailsRankings can change when data or methods change. The run date appears above.

Available leaderboard data

Models shown
100
Formally ranked models
55
Benchmark columns
26
Dimensions with evidence
4/4

How to read the benchmark bars

Each bar compares models only within the same benchmark column. Bar lengths are relative to the models shown here; they are not Category Scores and cannot be compared across benchmark columns.

RankModelLMSpeed scorePlanning & decompositionTool useEnvironment & long-horizon executionRecovery & completion reliabilityStatusEvidenceUpdated
Gert Labsundefined modelsDeepPlanningundefined modelsτ²-bench resultsundefined modelsMCP Atlasundefined modelsToolathlonundefined modelsAA Tau3 Bankingundefined modelsτ³-bench resultsundefined modelsMCP-Tasksundefined modelsGDPval-AAundefined modelsTerminal-Bench 2.0undefined modelsBrowseCompundefined modelsOSWorld-Verifiedundefined modelsOSWorld 2.0undefined modelsDeepSearchQAundefined modelsAA EnterpriseOps-Gymundefined modelsVITA-Benchundefined modelsWideResearchundefined modelsAA ITBenchundefined modelsClaw-Evalundefined modelsAPEX-Agents-AAundefined modelsJobBenchundefined modelsResearchClawBenchundefined modelsAA Briefcaseundefined modelsCyberGymundefined modelsAA Harvey LABundefined modelsExploitGymundefined models
Formally ranked models55
1Kimi K3MoonshotAI
68.3±7.3
84.246.01677.088.391.295.045.347.741.352.91542.094.6Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
2GPT-5.6 SolOpenAI
67.1±7.3
85.158.044.31735.091.992.262.642.956.21503.084.587.233.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
3Claude Opus 5Anthropic
66.1±8.2
85.842.11862.090.870.695.047.51720.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
4Claude Fable 5Anthropic
64.6±8.2
98.538.11747.084.385.051.11574.093.6Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
5Muse Spark 1.1Meta
63.1±7.4
88.175.61375.080.080.814.284.947.254.759.093.10.8Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
6GPT-5.6 TerraOpenAI
62.8±7.4
86.353.140.21583.087.487.550.251.038.981.885.223.2Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
7Grok 4.6SpaceXAI
62.8±8.6
50.71753.081.61577.079.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
8Claude Opus 4.8Anthropic
62.7±5.5
73.094.482.259.91593.074.684.383.420.693.121.191.1Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
9GPT-5.5OpenAI
61.9±5.1
72.998.075.355.61490.082.084.478.713.046.645.837.742.717.081.813.4Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
10Gemini 3.5 FlashGoogle
60.6±5.6
61.995.383.656.51345.076.278.450.147.118.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
11GLM-5.2Z.ai
59.8±7.2
99.176.848.234.61505.081.042.742.733.720.71252.091.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
12GPT-5.6 LunaOpenAI
58.3±7.4
53.431.11582.084.783.345.640.335.877.987.912.4Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
13DeepSeek V4 Pro 0813DeepSeek
57.5±7.7
96.273.651.839.61306.067.983.424.383.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
14Claude Opus 4.7 MaxAnthropic
57.3±7.7
88.677.31490.069.479.378.018.246.745.973.1Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
15GPT-5.4OpenAI
57.2±5.1
64.998.970.654.61394.075.182.775.073.660.333.338.915.379.06.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
16Gemini 3.7 FlashGoogle
57.2±8.6
32.81532.047.91131.090.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
17Qwen3.7 MaxQwen
56.9±5.8
64.394.776.41271.069.747.965.218.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
18Qwen3.6 27BQwen
55.5±6.6
54.894.21140.059.372.4Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
19Kimi K2.6MoonshotAI
55±5.3
56.895.955.950.01192.066.783.273.14.692.580.862.328.518.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
20Claude Opus 4.6Anthropic
54.9±5.7
61.984.865.483.772.773.770.433.036.719.966.6Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
21Claude Opus 4.7Anthropic
54.6±6.9
65.674.013.920.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
22MiniMax M3MiniMax
54±7.3
88.974.215.31387.066.083.570.14.632.174.519.81107.088.4Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
23Step 3.7 FlashStepFun
53.7±5.7
51.698.549.51018.059.575.892.867.114.8Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
24Qwen3.7 PlusQwen
53.6±5.7
62.393.073.2945.070.373.32.845.662.722.4Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
25Gemini 3.6 FlashGoogle
53.3±8.6
29.91423.083.0963.085.1Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
26GLM-5.1Z.ai
53.3±5.7
60.197.771.870.61258.063.568.062.318.268.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
27GPT-5.3 CodexOpenAI
52.7±6.6
57.586.077.364.733.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
28Claude Sonnet 4.6Anthropic
52.7±6.1
62.979.559.172.18.367.836.965.2Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
29DeepSeek V4 Flash 0731DeepSeek
52.1±8.4
69.047.81189.056.973.276.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
30MiMo-V2.5-ProXiaomi
51.4±6.3
62.794.272.91265.068.463.82.4Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
31GPT-5.4 MiniOpenAI
51±8.1
93.457.742.91172.060.072.128.2Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
32InklingThinking Machines
50.9±8.3
74.129.11239.063.877.138.0841.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
33MiMo-V2.5Xiaomi
50.6±8.9
46.965.862.316.9Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
34Gemini 3.1 ProGoogle
50.6±6.1
56.995.6965.069.757.832.013.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
35Qwen3.6 PlusQwen
49.3±5.5
50.697.748.239.870.774.11140.061.644.374.358.818.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
36Grok 4.3SpaceXAI
49.1±6.6
43.997.71088.017.012.4Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
37Claude Opus 4.5Anthropic
48.5±5.3
64.286.342.343.570.271.859.366.323.376.459.632.350.6Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
38MiMo-V2-Pro
48.1±8.9
36.795.057.815.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
39GPT-5.2OpenAI
47.6±6.6
46.584.865.847.334.3Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
40Mistral Medium 3.5Mistral
47.1±6.3
39.194.291.4933.033.7517.069.1Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
41GLM-4.7Z.ai
46.7±8.6
40.095.91169.041.052.015.5Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
42Claude Sonnet 4.5Anthropic
46.6±8.7
48.550.061.417.027.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
43DeepSeek V4 FlashDeepSeek
46±6.3
54.464.040.749.153.557.8Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
44Qwen3.6 35B A3BQwen
46±5.9
42.695.362.826.967.21055.051.535.660.168.7Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
45Qwen3.5-27BQwen
45.9±8.7
39.493.941.661.056.2Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
46MiniMax M2.7MiniMax
45±6.0
40.484.846.31160.057.048.710.6Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
47GPT-5.4 NanoOpenAI
44.8±8.1
92.556.135.51105.046.339.024.9Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
48Qwen3.5
44.7±5.2
46.895.646.136.368.474.2964.052.562.043.774.056.815.314.2Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
49Gemini 3.5 Flash-LiteGoogle
43.6±8.8
17.51139.054.074.0635.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
50Gemini 3 FlashGoogle
43±8.9
56.643.349.211.4Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
51Qwen3.5-35B-A3BQwen
42.8±8.7
29.089.240.561.054.5Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
52GLM-5Z.ai
41.1±5.6
51.098.231.138.065.660.856.269.857.714.543.2Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
53Kimi K2.5MoonshotAI
39.1±5.1
45.995.929.527.865.759.11006.050.860.677.172.752.311.58.714.0Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
54DeepSeek V3.2DeepSeek
39.1±6.9
29.678.918.540.2Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
55gpt-oss-120bOpenAI
35.9±6.0
29.665.8800.025.55.63.18.013.9Ratedundefined/4 dimensions · undefined familiesAug 28, 2026
Estimated models — unranked36
Qwen3.8 MaxQwen
66.4±10.9
1739.086.119.481.953.4Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Grok 4.5SpaceXAI
61.8±11.3
1526.083.392.4Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.8 27BQwen
57.2±11.9
84.333.4Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Muse Spark 1.2Meta
56.9±9.3
34.81631.01358.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Inkling SmallThinking Machines
55.7±10.9
79.61268.064.777.4Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Kimi K2.7 CodeMoonshotAI
53.7±11.2
90.176.01191.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.6 Max PreviewQwen
53.7±11.8
95.965.4Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GLM-5 TurboZ.ai
52.1±11.9
98.555.8Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.2 CodexOpenAI
51.2±9.3
51.892.126.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
DeepSeek V4 ProDeepSeek
51±10.5
69.446.359.180.4Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.1 CodexOpenAI
49.7±9.3
49.783.026.2Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 3 ProGoogle
49±9.3
63.287.111.4Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3.5-122B-A10BQwen
48±10.6
93.6988.049.463.858.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Ling-3.0-flashInclusionai
47.8±10.2
65.528.01107.072.273.6Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.1OpenAI
47.7±9.3
41.281.9993.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Muse Glimmer 30BMeta
47.7±10.2
75.523.5953.065.974.6Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Qwen3 MaxQwen
47.5±11.8
43.774.3Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GLM-5V TurboZ.ai
47.3±9.3
30.898.553.8Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
MiMo-V2-Flash
47.1±11.8
83.9839.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Hy3 previewTencent
46.3±11.2
36.91214.054.4Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5OpenAI
45±9.3
84.81083.08.5Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Command ACohere
44.8±9.3
85.0717.0369.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Claude Sonnet 4Anthropic
44.4±9.3
39.752.318.4Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Ling 2.6 FlashinclusionAI
44.3±11.8
86.0550.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Trinity Large ThinkingArcee AI
43.9±9.3
32.590.1563.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Gemini 2.5 ProGoogle
43.6±9.3
42.054.1669.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Grok 4.20SpaceXAI
43.1±11.2
38.447.162.8Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
MiMo-V2-Omni
42±11.9
91.245.2Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-4.1 MiniOpenAI
40.3±11.8
52.9505.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-4.1OpenAI
40±11.8
25.647.1Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Mistral Large 3
39.3±11.8
24.6639.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
gpt-oss-20bOpenAI
37.6±9.3
60.2565.00.7Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
DeepSeek V3
34.6±11.8
22.8231.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Llama 4 MaverickMeta
33±11.8
17.83.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-4.1 NanoOpenAI
33±11.8
17.361.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Llama 4 ScoutMeta
32.7±11.8
15.5109.0Estimatedundefined/4 dimensions · undefined familiesAug 28, 2026
Provisional models — unranked9
Claude Sonnet 5Anthropic
64.2±12.2
1603.080.484.781.2Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.5 ProOpenAI
61.3±16.1
90.1Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.4 ProOpenAI
60.4±16.1
89.3Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Laguna S 2.1Poolside
53.5±16.0
70.2Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Hy3Tencent
52.3±16.0
1214.0Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
Grok Build 0 1SpaceXAI
50.1±16.1
49.1Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GPT-5.1 Codex MaxOpenAI
49.9±16.0
83.0Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
O3OpenAI
49.3±16.0
80.7Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026
GLM-4.6Z.ai
48.4±16.0
76.9Provisionalundefined/4 dimensions · undefined familiesAug 28, 2026

What this leaderboard measures

Which AI model is better suited to agent tasks?

This leaderboard looks at whether a model can plan, use tools, act in an environment, and recover from failure. It measures more than the ability to answer a question.

Available data covers 4/4 dimensions and shows 26 benchmark columns.

Four capability dimensions

The four dimensions come from the category blueprint. Available data may cover only some of them. A dimension without evidence is not presented as a verified capability.

Planning & decomposition

2 benchmark columns currently provide evidence for this dimension.

  • Gert Labs
  • DeepPlanning

Tool use

6 benchmark columns currently provide evidence for this dimension.

  • τ²-bench results
  • MCP Atlas
  • Toolathlon
  • AA Tau3 Banking
  • τ³-bench results
  • MCP-Tasks

Environment & long-horizon execution

10 benchmark columns currently provide evidence for this dimension.

  • GDPval-AA
  • Terminal-Bench 2.0
  • BrowseComp
  • OSWorld-Verified
  • OSWorld 2.0
  • DeepSearchQA
  • AA EnterpriseOps-Gym
  • VITA-Bench
  • WideResearch
  • AA ITBench

Recovery & completion reliability

8 benchmark columns currently provide evidence for this dimension.

  • Claw-Eval
  • APEX-Agents-AA
  • JobBench
  • ResearchClawBench
  • AA Briefcase
  • CyberGym
  • AA Harvey LAB
  • ExploitGym

Agent tasks this page can help with

  • Research assistants that search, organize evidence, and adjust a plan when new facts appear.
  • Browser and computer tasks that require several tool calls and interface actions.
  • Multi-step business automation that must follow rules, handle failure, and leave reviewable output.

How to choose a model with this leaderboard

  1. Step 1

    Check the rating status first

    Only Rated models receive a rank. Estimated and Provisional models do not have a formal position.

  2. Step 2

    Review uncertainty and evidence

    When scores are close, do not rely on rank alone. Check uncertainty, dimension coverage, and benchmark count.

  3. Step 3

    Test the real task last

    A leaderboard cannot replace your own test. Check quality, speed, price, context, and provider limits together.

Start with your tools and execution environment. Then compare recovery, speed, cost, and permission controls. The top-ranked model is not best for every agent.

Rating status guide

Rated

Rated means the evidence and overlap rules are met. The model can receive a formal rank.

Estimated

Estimated means there is useful evidence, but it is not enough for a formal rank.

Provisional

Provisional means evidence is limited or dimension and benchmark-family coverage is below the estimated threshold. Use the result only as an early signal.

Benchmarks and evidence sources

Evidence source names and benchmark groups come from the currently available score data. One source may contribute several benchmarks.

  • BenchLM

    AA Briefcase, AA EnterpriseOps-Gym, AA Harvey LAB, AA ITBench, AA Tau3 Banking, APEX-Agents-AA, BrowseComp, Claw-Eval, CyberGym, DeepPlanning, DeepSearchQA, ExploitGym, GDPval-AA, Gert Labs, JobBench, MCP Atlas, MCP-Tasks, OSWorld 2.0, OSWorld-Verified, ResearchClawBench, Terminal-Bench 2.0, Toolathlon, VITA-Bench, WideResearch, τ²-bench results, and τ³-bench results

How the AI agent model ranking is built

LMSpeed combines eligible third-party benchmarks inside four fixed capability dimensions. Rated models meet the evidence and overlap requirements for a formal rank; Estimated and Provisional models remain visible without receiving a rank.

Read the Category Score methodology

Leaderboard limits

Category Scores use the third-party benchmarks currently included by LMSpeed. Tests can use different data, prompts, and scoring rules. The result is not permanent and cannot represent every real task. Test important choices with your own data and workflow.

Frequently asked questions

Which visible model has the highest formal rank now?

Among the currently visible models, Kimi K3 has the highest formal position at global rank 1. Its Category Score is 68.3. 55 visible models meet the formal ranking rules. This result applies only to the run date and methodology version shown on the page.

Can I compare scores across different categories?

No. Each category uses different capability dimensions and evidence. A Category Score is comparable only inside the same leaderboard. Review the matching category for each task.

Are Estimated and Provisional models still useful?

They can help you find candidates, but their evidence is not complete enough for a formal rank. Review coverage and uncertainty, then test the model on a real task.

How often does the leaderboard update?

The leaderboard updates after a new completed score run is published. The current run date and methodology version appear above. LMSpeed does not promise a fixed daily or weekly schedule.

Is the number one model always best for me?

No. Your result also depends on speed, price, context length, tool support, region, and provider limits. Use the leaderboard to narrow the field, then run your own test.

How is the agent ranking different from the reasoning ranking?

The reasoning ranking focuses on logic, causality, and evidence checks. The agent ranking also covers planning, tool use, environment execution, and recovery. Strong reasoning alone does not prove that a model can finish an agent workflow.