分类分数 V3 排行榜

LMSpeed 最适合 AI Agent 的模型

从规划拆解、工具调用、环境执行和失败恢复等全部有效 Benchmark 对比最适合 AI Agent 的模型;正式排名遵循 LMSpeed 分类分数 V3 的证据与不确定性规则。

方法论 3.0查看方法论

当前结论

当前可见的正式排名中,Kimi K3 的名次最高。它的全局名次是第 1 位,分类分为 68.3,80% 不确定性范围为 ±7.3。共有 55 个可见模型获得正式名次。这只代表本次评分运行。

查看 Kimi K3 的详情排名会随新数据和方法更新。页面顶部显示本次运行日期。

当前可用榜单数据

收录模型
100
正式排名模型
55
Benchmark 列
26
已有证据的维度
4/4

如何阅读 Benchmark 进度条

每个进度条只用于比较同一 Benchmark 列中的模型,长度相对于当前榜单展示的模型计算;它不是分类分数,也不能跨 Benchmark 列比较。

排名模型LMSpeed 分类分规划拆解工具调用环境与长程执行恢复与完成可靠性评级证据覆盖更新时间
Gert Labsundefined 个模型DeepPlanningundefined 个模型τ²-bench resultsundefined 个模型MCP Atlasundefined 个模型Toolathlonundefined 个模型AA Tau3 Bankingundefined 个模型τ³-bench resultsundefined 个模型MCP-Tasksundefined 个模型GDPval-AAundefined 个模型Terminal-Bench 2.0undefined 个模型BrowseCompundefined 个模型OSWorld-Verifiedundefined 个模型OSWorld 2.0undefined 个模型DeepSearchQAundefined 个模型AA EnterpriseOps-Gymundefined 个模型VITA-Benchundefined 个模型WideResearchundefined 个模型AA ITBenchundefined 个模型Claw-Evalundefined 个模型APEX-Agents-AAundefined 个模型JobBenchundefined 个模型ResearchClawBenchundefined 个模型AA Briefcaseundefined 个模型CyberGymundefined 个模型AA Harvey LABundefined 个模型ExploitGymundefined 个模型
正式排名模型55
1Kimi K3MoonshotAI
68.3±7.3
84.246.01677.088.391.295.045.347.741.352.91542.094.6正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
2GPT-5.6 SolOpenAI
67.1±7.3
85.158.044.31735.091.992.262.642.956.21503.084.587.233.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
3Claude Opus 5Anthropic
66.1±8.2
85.842.11862.090.870.695.047.51720.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
4Claude Fable 5Anthropic
64.6±8.2
98.538.11747.084.385.051.11574.093.6正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
5Muse Spark 1.1Meta
63.1±7.4
88.175.61375.080.080.814.284.947.254.759.093.10.8正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
6GPT-5.6 TerraOpenAI
62.8±7.4
86.353.140.21583.087.487.550.251.038.981.885.223.2正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
7Grok 4.6SpaceXAI
62.8±8.6
50.71753.081.61577.079.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
8Claude Opus 4.8Anthropic
62.7±5.5
73.094.482.259.91593.074.684.383.420.693.121.191.1正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
9GPT-5.5OpenAI
61.9±5.1
72.998.075.355.61490.082.084.478.713.046.645.837.742.717.081.813.4正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
10Gemini 3.5 FlashGoogle
60.6±5.6
61.995.383.656.51345.076.278.450.147.118.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
11GLM-5.2Z.ai
59.8±7.2
99.176.848.234.61505.081.042.742.733.720.71252.091.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
12GPT-5.6 LunaOpenAI
58.3±7.4
53.431.11582.084.783.345.640.335.877.987.912.4正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
13DeepSeek V4 Pro 0813DeepSeek
57.5±7.7
96.273.651.839.61306.067.983.424.383.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
14Claude Opus 4.7 MaxAnthropic
57.3±7.7
88.677.31490.069.479.378.018.246.745.973.1正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
15GPT-5.4OpenAI
57.2±5.1
64.998.970.654.61394.075.182.775.073.660.333.338.915.379.06.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
16Gemini 3.7 FlashGoogle
57.2±8.6
32.81532.047.91131.090.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
17Qwen3.7 MaxQwen
56.9±5.8
64.394.776.41271.069.747.965.218.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
18Qwen3.6 27BQwen
55.5±6.6
54.894.21140.059.372.4正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
19Kimi K2.6MoonshotAI
55±5.3
56.895.955.950.01192.066.783.273.14.692.580.862.328.518.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
20Claude Opus 4.6Anthropic
54.9±5.7
61.984.865.483.772.773.770.433.036.719.966.6正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
21Claude Opus 4.7Anthropic
54.6±6.9
65.674.013.920.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
22MiniMax M3MiniMax
54±7.3
88.974.215.31387.066.083.570.14.632.174.519.81107.088.4正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
23Step 3.7 FlashStepFun
53.7±5.7
51.698.549.51018.059.575.892.867.114.8正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
24Qwen3.7 PlusQwen
53.6±5.7
62.393.073.2945.070.373.32.845.662.722.4正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
25Gemini 3.6 FlashGoogle
53.3±8.6
29.91423.083.0963.085.1正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
26GLM-5.1Z.ai
53.3±5.7
60.197.771.870.61258.063.568.062.318.268.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
27GPT-5.3 CodexOpenAI
52.7±6.6
57.586.077.364.733.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
28Claude Sonnet 4.6Anthropic
52.7±6.1
62.979.559.172.18.367.836.965.2正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
29DeepSeek V4 Flash 0731DeepSeek
52.1±8.4
69.047.81189.056.973.276.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
30MiMo-V2.5-ProXiaomi
51.4±6.3
62.794.272.91265.068.463.82.4正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
31GPT-5.4 MiniOpenAI
51±8.1
93.457.742.91172.060.072.128.2正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
32InklingThinking Machines
50.9±8.3
74.129.11239.063.877.138.0841.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
33MiMo-V2.5Xiaomi
50.6±8.9
46.965.862.316.9正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
34Gemini 3.1 ProGoogle
50.6±6.1
56.995.6965.069.757.832.013.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
35Qwen3.6 PlusQwen
49.3±5.5
50.697.748.239.870.774.11140.061.644.374.358.818.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
36Grok 4.3SpaceXAI
49.1±6.6
43.997.71088.017.012.4正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
37Claude Opus 4.5Anthropic
48.5±5.3
64.286.342.343.570.271.859.366.323.376.459.632.350.6正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
38MiMo-V2-Pro
48.1±8.9
36.795.057.815.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
39GPT-5.2OpenAI
47.6±6.6
46.584.865.847.334.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
40Mistral Medium 3.5Mistral
47.1±6.3
39.194.291.4933.033.7517.069.1正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
41GLM-4.7Z.ai
46.7±8.6
40.095.91169.041.052.015.5正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
42Claude Sonnet 4.5Anthropic
46.6±8.7
48.550.061.417.027.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
43DeepSeek V4 FlashDeepSeek
46±6.3
54.464.040.749.153.557.8正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
44Qwen3.6 35B A3BQwen
46±5.9
42.695.362.826.967.21055.051.535.660.168.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
45Qwen3.5-27BQwen
45.9±8.7
39.493.941.661.056.2正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
46MiniMax M2.7MiniMax
45±6.0
40.484.846.31160.057.048.710.6正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
47GPT-5.4 NanoOpenAI
44.8±8.1
92.556.135.51105.046.339.024.9正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
48Qwen3.5
44.7±5.2
46.895.646.136.368.474.2964.052.562.043.774.056.815.314.2正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
49Gemini 3.5 Flash-LiteGoogle
43.6±8.8
17.51139.054.074.0635.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
50Gemini 3 FlashGoogle
43±8.9
56.643.349.211.4正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
51Qwen3.5-35B-A3BQwen
42.8±8.7
29.089.240.561.054.5正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
52GLM-5Z.ai
41.1±5.6
51.098.231.138.065.660.856.269.857.714.543.2正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
53Kimi K2.5MoonshotAI
39.1±5.1
45.995.929.527.865.759.11006.050.860.677.172.752.311.58.714.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
54DeepSeek V3.2DeepSeek
39.1±6.9
29.678.918.540.2正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
55gpt-oss-120bOpenAI
35.9±6.0
29.665.8800.025.55.63.18.013.9正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
估算模型(不排名)36
Qwen3.8 MaxQwen
66.4±10.9
1739.086.119.481.953.4估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Grok 4.5SpaceXAI
61.8±11.3
1526.083.392.4估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.8 27BQwen
57.2±11.9
84.333.4估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Muse Spark 1.2Meta
56.9±9.3
34.81631.01358.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Inkling SmallThinking Machines
55.7±10.9
79.61268.064.777.4估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Kimi K2.7 CodeMoonshotAI
53.7±11.2
90.176.01191.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.6 Max PreviewQwen
53.7±11.8
95.965.4估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-5 TurboZ.ai
52.1±11.9
98.555.8估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.2 CodexOpenAI
51.2±9.3
51.892.126.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek V4 ProDeepSeek
51±10.5
69.446.359.180.4估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.1 CodexOpenAI
49.7±9.3
49.783.026.2估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3 ProGoogle
49±9.3
63.287.111.4估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.5-122B-A10BQwen
48±10.6
93.6988.049.463.858.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Ling-3.0-flashInclusionai
47.8±10.2
65.528.01107.072.273.6估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.1OpenAI
47.7±9.3
41.281.9993.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Muse Glimmer 30BMeta
47.7±10.2
75.523.5953.065.974.6估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3 MaxQwen
47.5±11.8
43.774.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-5V TurboZ.ai
47.3±9.3
30.898.553.8估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiMo-V2-Flash
47.1±11.8
83.9839.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Hy3 previewTencent
46.3±11.2
36.91214.054.4估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5OpenAI
45±9.3
84.81083.08.5估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Command ACohere
44.8±9.3
85.0717.0369.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Sonnet 4Anthropic
44.4±9.3
39.752.318.4估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Ling 2.6 FlashinclusionAI
44.3±11.8
86.0550.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Trinity Large ThinkingArcee AI
43.9±9.3
32.590.1563.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 2.5 ProGoogle
43.6±9.3
42.054.1669.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Grok 4.20SpaceXAI
43.1±11.2
38.447.162.8估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiMo-V2-Omni
42±11.9
91.245.2估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4.1 MiniOpenAI
40.3±11.8
52.9505.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4.1OpenAI
40±11.8
25.647.1估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Mistral Large 3
39.3±11.8
24.6639.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
gpt-oss-20bOpenAI
37.6±9.3
60.2565.00.7估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek V3
34.6±11.8
22.8231.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Llama 4 MaverickMeta
33±11.8
17.83.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4.1 NanoOpenAI
33±11.8
17.361.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Llama 4 ScoutMeta
32.7±11.8
15.5109.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
暂定模型(不排名)9
Claude Sonnet 5Anthropic
64.2±12.2
1603.080.484.781.2暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.5 ProOpenAI
61.3±16.1
90.1暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.4 ProOpenAI
60.4±16.1
89.3暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Laguna S 2.1Poolside
53.5±16.0
70.2暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Hy3Tencent
52.3±16.0
1214.0暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Grok Build 0 1SpaceXAI
50.1±16.1
49.1暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.1 Codex MaxOpenAI
49.9±16.0
83.0暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
O3OpenAI
49.3±16.0
80.7暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-4.6Z.ai
48.4±16.0
76.9暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日

这个榜单衡量什么

哪个 AI 模型更适合 Agent 任务

这类榜单关注模型能否规划任务、调用工具、操作环境,并在失败后继续完成任务。它不只看模型会不会回答问题。

当前可用数据覆盖 4/4 个维度,并展示 26 个 Benchmark 列。

四个能力维度

四个维度来自分类蓝图。当前可用数据可能只覆盖其中一部分。没有证据的维度不会被写成已验证能力。

规划拆解

当前有 2 个 Benchmark 列提供这个维度的证据。

  • Gert Labs
  • DeepPlanning

工具调用

当前有 6 个 Benchmark 列提供这个维度的证据。

  • τ²-bench results
  • MCP Atlas
  • Toolathlon
  • AA Tau3 Banking
  • τ³-bench results
  • MCP-Tasks

环境与长程执行

当前有 10 个 Benchmark 列提供这个维度的证据。

  • GDPval-AA
  • Terminal-Bench 2.0
  • BrowseComp
  • OSWorld-Verified
  • OSWorld 2.0
  • DeepSearchQA
  • AA EnterpriseOps-Gym
  • VITA-Bench
  • WideResearch
  • AA ITBench

恢复与完成可靠性

当前有 8 个 Benchmark 列提供这个维度的证据。

  • Claw-Eval
  • APEX-Agents-AA
  • JobBench
  • ResearchClawBench
  • AA Briefcase
  • CyberGym
  • AA Harvey LAB
  • ExploitGym

适合参考的 Agent 任务

  • 调研助手。它需要搜索资料,整理证据,并根据新信息调整计划。
  • 网页和电脑操作。它需要读懂界面,调用工具,并连续完成多个步骤。
  • 多步业务自动化。它需要遵守规则,处理失败,并留下可检查的结果。

如何用这张榜单选择模型

  1. 第 1 步

    先确认评级状态

    只有正式评级模型才有名次。估算和暂定模型没有正式名次。

  2. 第 2 步

    再看评分区间和证据

    分数接近时,不要只看名次。还要查看不确定性、维度覆盖和 Benchmark 数量。

  3. 第 3 步

    最后用真实任务测试

    榜单不能替代你的测试。请同时检查质量、速度、价格、上下文和供应商限制。

先看你的工具和运行环境。再看恢复能力、速度、成本和权限控制。榜单第一不一定适合每个 Agent。

评级状态说明

正式评级

正式评级表示证据和重叠条件已满足。模型可以进入排名。

估算

估算表示已有部分证据,但还不满足正式排名条件。

暂定

暂定表示证据较少,或维度与 Benchmark family 覆盖还不满足估算条件。结果只适合早期观察。

Benchmark 与证据来源

证据来源名称和 Benchmark 分组来自当前可用评分数据。一个来源可以提供多个 Benchmark。

  • BenchLM

    AA Briefcase、AA EnterpriseOps-Gym、AA Harvey LAB、AA ITBench、AA Tau3 Banking、APEX-Agents-AA、BrowseComp、Claw-Eval、CyberGym、DeepPlanning、DeepSearchQA、ExploitGym、GDPval-AA、Gert Labs、JobBench、MCP Atlas、MCP-Tasks、OSWorld 2.0、OSWorld-Verified、ResearchClawBench、Terminal-Bench 2.0、Toolathlon、VITA-Bench、WideResearch、τ²-bench results和τ³-bench results

AI Agent 模型排行榜如何生成

LMSpeed 将合格的第三方 Benchmark 先归入四个固定能力维度。Rated 模型满足正式排名所需的证据覆盖与重叠校准要求;Estimated 与 Provisional 模型继续展示,但不授予名次。

阅读分类分数方法论

榜单限制

分类分来自当前收录的第三方 Benchmark。不同测试可能使用不同数据、提示和评分规则。榜单不代表永久结论,也不能代表每个真实任务。重要选择仍要用自己的数据和流程测试。

常见问题

当前可见模型中谁的正式名次最高

当前可见模型中,Kimi K3 的正式名次最高。它的全局名次是第 1 位,分类分为 68.3。共有 55 个可见模型满足正式排名条件。这个结果只适用于页面所示的评分日期和方法版本。

不同分类的分数可以直接比较吗

不可以。每个分类使用不同的能力维度和证据。分类分只适合在同一张榜单内比较。需要比较不同任务时,请分别查看对应分类。

估算和暂定模型值得看吗

可以把它们当成候选模型。它们的证据还不够完整,所以没有正式名次。先看证据覆盖和不确定性,再用真实任务测试。

榜单多久更新一次

新的完整评分运行发布后,榜单会更新。页面顶部会显示当前运行日期和方法版本。LMSpeed 不保证固定的日更或周更时间。

排名第一就是最适合我的模型吗

不一定。你的任务还会受到速度、价格、上下文长度、工具支持、地区和供应商限制影响。榜单用于缩小范围,不能替代真实测试。

Agent 排名和推理排名有什么不同

推理榜关注逻辑、因果和证据验证。Agent 榜还关注规划、工具调用、环境执行和失败恢复。推理能力强,不等于能稳定完成真实 Agent 流程。