分类分数 V3 排行榜

LMSpeed 推理能力最强的 AI 模型

从抽象逻辑、科学因果、多步约束和证据验证 Benchmark 对比推理能力最强的 AI 模型,并同时查看分类分与不确定性。

方法论 3.0查看方法论

当前结论

当前可见的正式排名中,GPT-5.6 Sol 的名次最高。它的全局名次是第 1 位,分类分为 61.2,80% 不确定性范围为 ±8.7。共有 64 个可见模型获得正式名次。这只代表本次评分运行。

查看 GPT-5.6 Sol 的详情排名会随新数据和方法更新。页面顶部显示本次运行日期。

当前可用榜单数据

收录模型
100
正式排名模型
64
Benchmark 列
12
已有证据的维度
4/4

如何阅读 Benchmark 进度条

每个进度条只用于比较同一 Benchmark 列中的模型,长度相对于当前榜单展示的模型计算;它不是分类分数,也不能跨 Benchmark 列比较。

排名模型LMSpeed 分类分抽象逻辑科学与因果推理多步约束证据整合与验证评级证据覆盖更新时间
ARC-AGI-2undefined 个模型GPQAundefined 个模型HLEundefined 个模型CritPtundefined 个模型HLE w/o toolsundefined 个模型AA-GPQA Diamondundefined 个模型AA-HLEundefined 个模型MMLU-Proundefined 个模型AA-LCRundefined 个模型LongBench v2undefined 个模型MRCR 1Mundefined 个模型AI-Needleundefined 个模型
正式排名模型64
1GPT-5.6 SolOpenAI
61.2±8.7
92.593.1%47.3%32.377.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
2DeepSeek V4 Pro 0813DeepSeek
61±8.3
18.092.841.087.5%75.383.5正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
3Claude Opus 4.5Anthropic
60.7±8.1
86.6%30.1%0.389.5%67.364.474.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
4Claude Opus 5Anthropic
60.3±8.7
90.491.9%51.3%29.156.375.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
5Qwen3.7 MaxQwen
59.6±8.7
92.3%40.5%13.489.6%74.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
6DeepSeek V4 Flash 0731DeepSeek
59.4±8.3
16.690.838.686.2%74.378.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
7GPT-5.5OpenAI
59.2±8.7
85.092.6%42.4%27.141.479.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
8GPT-5.6 TerraOpenAI
58.7±8.7
83.989.6%38.5%30.079.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
9Gemini 3.1 ProGoogle
58.2±8.7
77.117.745.494.147.079.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
10Qwen3.7 PlusQwen
57.4±8.7
90.0%35.6%9.188.5%69.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
11Claude Opus 4.7 MaxAnthropic
56.7±8.7
75.812.046.991.442.375.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
12Qwen3.6 PlusQwen
56.6±8.1
88.2%27.8%2.988.5%72.362.068.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
13Claude Opus 4.8Anthropic
56.4±8.7
72.192.0%48.7%20.949.873.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
14GPT-5.4OpenAI
56.2±8.7
74.087.1%30.8%23.439.877.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
15Kimi K2.5MoonshotAI
55.5±8.3
87.9%30.7%3.187.1%73.061.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
16GPT-5.1 CodexOpenAI
55.3±8.7
86.0%25.7%5.786.0%69.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
17DeepSeek V4 ProDeepSeek
54.8±9.0
92.8%41.0%82.9%44.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
18GPT-5.6 LunaOpenAI
54.4±8.7
59.585.9%25.8%20.678.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
19GLM-4.7Z.ai
54.4±8.7
85.9%27.4%1.785.6%68.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
20Qwen3.6 27BQwen
54.4±8.7
82.9%15.1%1.186.2%73.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
21Grok 4.5SpaceXAI
54.4±8.7
52.693.1%42.7%15.474.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
22O3OpenAI
54.3±8.7
82.7%20.1%1.185.3%73.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
23Gemini 2.5 ProGoogle
54.2±8.7
84.4%22.5%2.686.2%66.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
24Gemini 3 ProGoogle
54.1±6.4
31.190.8%39.7%9.189.8%73.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
25GPT-5.1OpenAI
54±8.7
64.3%5.3%4.987.0%76.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
26DeepSeek V4 FlashDeepSeek
53.7±9.0
90.8%38.6%83.0%37.5正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
27Qwen3.5-27BQwen
53.6±8.3
85.8%23.9%0.986.1%72.360.6正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
28GPT-5.2OpenAI
53.5±6.4
52.986.4%26.7%11.681.4%79.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
29Claude Opus 4.6Anthropic
53.4±8.7
89.6%39.9%2.840.082.0%62.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
30Gemini 3.5 FlashGoogle
53.4±8.4
72.192.1%41.3%13.169.326.6正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
31Qwen3.5-122B-A10BQwen
53.1±8.3
85.7%25.2%0.686.7%70.360.2正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
32GPT-5OpenAI
52.7±8.7
68.6%6.6%5.782.0%76.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
33Qwen3.6 35B A3BQwen
52.4±8.7
81.7%13.9%0.385.2%66.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
34Qwen3.5
52.3±8.1
45.6%2.6%1.787.8%72.763.268.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
35Gemini 3 FlashGoogle
52.2±8.7
81.2%15.0%1.488.2%53.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
36Qwen3.5-35B-A3BQwen
51.2±8.3
84.5%21.0%0.985.3%68.359.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
37DeepSeek V3.2DeepSeek
51±8.7
87.1%28.7%0.986.3%42.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
38Inkling SmallThinking Machines
50.9±8.7
40.189.5%33.3%8.331.669.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
39O1OpenAI
50.7±8.7
76.5%7.0%0.384.8%63.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
40DeepSeek R1DeepSeek
50.2±8.7
70.8%8.5%1.484.9%56.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
41Claude Sonnet 4.6Anthropic
49.8±8.7
79.7%11.2%0.979.2%62.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
42gpt-oss-120bOpenAI
49.2±8.7
78.2%19.6%1.180.8%51.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
43Gemini 2.5 FlashGoogle
48.9±8.7
76.6%8.7%1.483.6%48.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
44GLM-5Z.ai
48.9±8.1
66.6%7.6%2.085.7%70.760.863.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
45Qwen3 MaxQwen
48.9±8.7
76.4%11.9%0.084.1%48.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
46DeepSeek V3.1DeepSeek
48.7±8.7
77.9%14.3%0.083.3%46.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
47Kimi K2MoonshotAI
48.6±8.7
76.6%7.4%0.082.4%53.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
48GPT-4.1OpenAI
48.5±8.7
66.6%4.2%0.080.6%64.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
49MiMo-V2-Flash
48.4±8.7
84.6%22.8%0.084.3%35.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
50Claude Sonnet 4Anthropic
47.4±8.7
68.3%4.3%1.183.7%45.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
51GLM-4.5 AirZ.ai
47±8.7
73.3%7.0%0.081.5%45.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
52Llama 4 MaverickMeta
46.8±8.7
67.1%4.9%0.080.9%50.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
53Command ACohere
45.5±8.7
76.1%12.0%0.371.2%48.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
54GPT-4.1 MiniOpenAI
45.4±8.7
66.4%5.0%0.078.1%45.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
55Mistral Large 3
44.5±8.7
68.0%4.2%0.080.7%34.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
56DeepSeek V3
44.4±8.7
65.5%4.7%0.081.9%31.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
57gpt-oss-20bOpenAI
44.2±8.7
68.8%11.0%1.474.8%33.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
58GLM-4.6Z.ai
42.8±8.7
63.2%5.5%0.078.4%28.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
59Mistral Medium 3Mistral
42.3±8.7
57.8%4.1%0.076.0%31.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
60Llama 4 ScoutMeta
41.8±8.7
58.7%3.8%0.075.2%30.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
61GPT-4oOpenAI
39.9±8.7
51.1%2.7%0.077.3%0.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
62DeepSeek R1 Distill QwenDeepSeek
39.1±8.9
48.4%4.1%74.0%8.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
63Phi 4Microsoft
39.1±8.7
57.5%3.8%0.071.4%0.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
64GPT-4.1 NanoOpenAI
37.6±8.7
51.2%3.8%0.065.7%19.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
估算模型(不排名)36
Qwen3.8 MaxQwen
64.5±10.1
92.7%43.0%20.043.674.366.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Muse Spark 1.2Meta
61.3±10.8
90.4%45.5%17.783.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Fable 5Anthropic
60.6±10.8
92.6%55.5%28.676.7估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3 Flash PreviewGoogle
60.2±11.1
89.8%36.6%89.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3.6 FlashGoogle
59.7±10.8
92.8%40.8%10.679.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.3 CodexOpenAI
59.7±10.8
91.5%42.5%16.978.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Muse Spark 1.1Meta
59.5±10.2
89.8%46.2%15.152.281.354.1估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3.7 FlashGoogle
59.3±10.8
90.1%35.1%14.380.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Grok 4.6SpaceXAI
59.3±10.8
93.5%44.1%17.175.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Kimi K3MoonshotAI
59.3±10.8
84.2%25.0%23.443.582.7估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiniMax M3MiniMax
59.2±10.8
92.9%39.0%3.780.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.4 ProOpenAI
59.1±11.3
83.358.7%30.042.7估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.2 CodexOpenAI
58.7±10.8
89.9%35.7%8.779.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Kimi K2.7 CodeMoonshotAI
57.5±10.8
89.6%35.0%10.075.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiniMax M2.1MiniMax
56.8±11.1
83.0%23.2%87.5%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Hy3Tencent
56.7±10.8
89.7%33.5%4.974.7估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5 CodexOpenAI
56.7±11.1
83.7%27.8%86.5%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Sonnet 5Anthropic
56.3±10.8
80.0%19.0%16.943.277.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Muse Glimmer 30BMeta
56.1±10.8
2.683.522.080.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Opus 4.7Anthropic
55.9±10.8
88.5%33.3%5.172.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.4 MiniOpenAI
55.6±10.8
87.5%28.1%10.028.273.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.6 Max PreviewQwen
55.5±10.8
88.8%30.8%3.772.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Kimi K2 ThinkingMoonshotAI
55.5±11.1
83.8%23.8%84.8%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
InklingThinking Machines
55.4±10.8
87.2%31.9%5.430.073.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 2.5 Pro Preview 06-05Google
55.4±11.1
83.6%18.0%85.8%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Kimi K2.6MoonshotAI
55.3±10.8
78.8%19.6%8.076.7估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3 Max ThinkingQwen
55.1±11.1
86.1%28.0%82.4%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiniMax M2.7MiniMax
54.6±10.8
87.4%29.6%0.675.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-5.2Z.ai
54.5±10.8
68.6%9.8%20.940.576.7估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.1 Codex MaxOpenAI
54.3±10.8
5.786.025.769.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Grok 4.3SpaceXAI
54.3±10.8
89.0%30.0%8.064.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiMo-V2.5-ProXiaomi
54.2±10.8
76.2%14.8%4.034.077.7估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek V3.1 TerminusDeepSeek
54.1±11.1
79.2%16.4%85.1%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek V3.2 ExpDeepSeek
54±11.1
79.7%14.9%85.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-5.1Z.ai
53.8±10.8
83.9%27.9%4.668.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3 235B A22B Instruct 2507Qwen
53.6±11.1
79.0%15.9%84.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日

这个榜单衡量什么

哪个 AI 模型更适合复杂推理

这类榜单关注逻辑、因果、多步约束和证据验证。它衡量的是推理表现,不是所有任务的总能力。

当前可用数据覆盖 4/4 个维度,并展示 12 个 Benchmark 列。

四个能力维度

四个维度来自分类蓝图。当前可用数据可能只覆盖其中一部分。没有证据的维度不会被写成已验证能力。

抽象逻辑

当前有 1 个 Benchmark 列提供这个维度的证据。

  • ARC-AGI-2

科学与因果推理

当前有 6 个 Benchmark 列提供这个维度的证据。

  • GPQA
  • HLE
  • CritPt
  • HLE w/o tools
  • AA-GPQA Diamond
  • AA-HLE

多步约束

当前有 1 个 Benchmark 列提供这个维度的证据。

  • MMLU-Pro

证据整合与验证

当前有 4 个 Benchmark 列提供这个维度的证据。

  • AA-LCR
  • LongBench v2
  • MRCR 1M
  • AI-Needle

适合参考的推理任务

  • 复杂分析。模型需要拆开条件,并保持多步结论一致。
  • 科学问题。模型需要处理因果关系、假设和证据。
  • 结论检查。模型需要找出漏洞,并判断证据是否支持结论。

如何用这张榜单选择模型

  1. 第 1 步

    先确认评级状态

    只有正式评级模型才有名次。估算和暂定模型没有正式名次。

  2. 第 2 步

    再看评分区间和证据

    分数接近时,不要只看名次。还要查看不确定性、维度覆盖和 Benchmark 数量。

  3. 第 3 步

    最后用真实任务测试

    榜单不能替代你的测试。请同时检查质量、速度、价格、上下文和供应商限制。

不要只看一个高分。还要看评分区间、任务类型、回答稳定性和验证成本。

评级状态说明

正式评级

正式评级表示证据和重叠条件已满足。模型可以进入排名。

估算

估算表示已有部分证据,但还不满足正式排名条件。

暂定

暂定表示证据较少,或维度与 Benchmark family 覆盖还不满足估算条件。结果只适合早期观察。

Benchmark 与证据来源

证据来源名称和 Benchmark 分组来自当前可用评分数据。一个来源可以提供多个 Benchmark。

  • Artificial Analysis

    GPQA、HLE和MMLU-Pro

  • BenchLM

    AA-GPQA Diamond、AA-HLE、AA-LCR、AI-Needle、ARC-AGI-2、CritPt、GPQA、HLE、HLE w/o tools、LongBench v2、MMLU-Pro和MRCR 1M

Reasoning 模型排行榜如何生成

LMSpeed 将合格的第三方 Benchmark 先归入四个固定能力维度。Rated 模型满足正式排名所需的证据覆盖与重叠校准要求;Estimated 与 Provisional 模型继续展示,但不授予名次。

阅读分类分数方法论

榜单限制

分类分来自当前收录的第三方 Benchmark。不同测试可能使用不同数据、提示和评分规则。榜单不代表永久结论,也不能代表每个真实任务。重要选择仍要用自己的数据和流程测试。

常见问题

当前可见模型中谁的正式名次最高

当前可见模型中,GPT-5.6 Sol 的正式名次最高。它的全局名次是第 1 位,分类分为 61.2。共有 64 个可见模型满足正式排名条件。这个结果只适用于页面所示的评分日期和方法版本。

不同分类的分数可以直接比较吗

不可以。每个分类使用不同的能力维度和证据。分类分只适合在同一张榜单内比较。需要比较不同任务时,请分别查看对应分类。

估算和暂定模型值得看吗

可以把它们当成候选模型。它们的证据还不够完整,所以没有正式名次。先看证据覆盖和不确定性,再用真实任务测试。

榜单多久更新一次

新的完整评分运行发布后,榜单会更新。页面顶部会显示当前运行日期和方法版本。LMSpeed 不保证固定的日更或周更时间。

排名第一就是最适合我的模型吗

不一定。你的任务还会受到速度、价格、上下文长度、工具支持、地区和供应商限制影响。榜单用于缩小范围,不能替代真实测试。

推理分和数学分一样吗

不一样。数学是独立分类。推理榜还包含抽象逻辑、科学因果、多步约束和证据验证。数学分高不代表所有推理任务都更好。