分类分数 V3 排行榜

LMSpeed 数学能力最强的 AI 模型

对比基础数学、竞赛数学、高阶证明及工具辅助数学 Benchmark,并在 LMSpeed 分类能力估计旁展示每项原始跑分。

方法论 3.0查看方法论

当前结论

当前还没有模型满足正式排名规则。下表有 89 个估算模型和 11 个暂定模型。它们可用于观察,但不能当成正式名次。

排名会随新数据和方法更新。页面顶部显示本次运行日期。

当前可用榜单数据

收录模型
100
正式排名模型
0
Benchmark 列
13
已有证据的维度
4/4

如何阅读 Benchmark 进度条

每个进度条只用于比较同一 Benchmark 列中的模型,长度相对于当前榜单展示的模型计算;它不是分类分数,也不能跨 Benchmark 列比较。

排名模型LMSpeed 分类分基础数学竞赛数学高阶证明应用与工具辅助数学评级证据覆盖更新时间
MATH-500undefined 个模型AA Math Indexundefined 个模型AIMEundefined 个模型HMMT Feb 2026undefined 个模型AIME26undefined 个模型HMMT Nov 2025undefined 个模型HMMT Feb 2025undefined 个模型AIME 2025undefined 个模型FrontierMath v2 (Tiers 1-3)undefined 个模型FrontierMath v2 (Tier 4)undefined 个模型FrontierMath (legacy)undefined 个模型IMOAnswerBenchundefined 个模型MMAnswerBenchundefined 个模型
估算模型(不排名)89
GLM-5.2Z.ai
70.1±11.5
92.599.294.491.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
O4 MiniOpenAI
63.9±11.8
98.9%94.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3 235B A22B Instruct 2507Qwen
62.9±11.8
98.4%94.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.7 MaxQwen
62.2±12.2
97.190.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5OpenAI
61.4±11.8
98.7%83.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
o3 Mini HighOpenAI
61.3±11.8
98.5%86.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 2.5 Pro Preview 06-05Google
60.7±11.8
98.0%87.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-4.5Z.ai
60.5±11.8
97.9%87.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek V4 Pro 0813DeepSeek
58.9±12.2
95.289.8估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiniMax M1MiniMax
58.9±11.8
97.2%81.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
O3OpenAI
58.8±9.3
99.2%90.3%18.72.1估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Kimi K2.6MoonshotAI
58.6±9.0
92.796.439.014.686.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
O3 MiniOpenAI
58.5±11.8
97.3%77.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3
58.3±11.8
97.5%72.7%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek V4 Flash 0731DeepSeek
57.9±12.2
94.888.4估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Sonar Reasoning ProPerplexity
57.4±11.8
95.7%79.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek R1DeepSeek
57±11.8
96.6%68.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-4.5 AirZ.ai
56.9±11.8
96.5%67.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 2.5 ProGoogle
56.1±9.3
96.7%88.7%14.14.2估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek R1 Distill QwenDeepSeek
55.7±11.8
94.9%66.7%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.7 PlusQwen
55.2±12.2
92.986.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
R1 Distill Llama 70BDeepSeek
55±11.8
93.5%67.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
O1 MiniOpenAI
54.9±11.8
94.4%60.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Opus 4Anthropic
54.4±11.8
94.1%56.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Kimi K2MoonshotAI
53.7±9.3
97.1%69.3%21.40.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 2.5 Flash LiteGoogle
53.3±11.8
92.6%50.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Sonnet 4Anthropic
52.9±11.8
93.4%40.7%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
O1OpenAI
52.6±9.3
92.4%72.3%9.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Reka Flash 3Rekaai
52.2±11.8
89.3%51.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.6 PlusQwen
52.2±9.1
87.895.394.696.726.28.383.8估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Mistral Medium 3Mistral
52.1±11.8
90.7%44.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 2.0 FlashGoogle
52.1±11.8
93.0%33.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 2.0 ProGoogle
52.1±11.8
92.3%36.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-5.1Z.ai
51.7±9.1
82.695.394.033.412.583.8估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-5Z.ai
51.1±9.1
86.495.896.997.516.42.182.5估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3 235B A22BQwen
51.1±11.8
90.2%32.7%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 2.5 FlashGoogle
50.8±9.3
92.6%43.3%4.84.2估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3 Coder 30B A3B InstructQwen
50.5±11.8
89.3%29.7%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
SonarPerplexity
50.3±11.8
81.7%48.7%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 2.0 Flash LiteGoogle
50.1±11.8
87.3%30.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3 32BQwen
49.9±11.8
86.9%30.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4.1 MiniOpenAI
49.9±9.3
92.5%43.0%4.5估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Opus 4.5Anthropic
49.9±9.1
85.395.193.392.920.74.284.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 2.0 Flash Lite 001Google
49.8±11.8
87.3%27.7%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3 14BQwen
49.8±11.8
87.1%28.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek V3
49.5±9.3
94.2%52.0%1.7估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3 30B A3BQwen
49.4±11.8
86.3%26.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Kimi K2.5MoonshotAI
49.2±9.0
87.195.891.195.496.127.94.281.8估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4.1OpenAI
49±9.3
91.3%43.7%5.50.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-4.7Z.ai
48.8±12.3
95.72.40.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude 3.7 SonnetAnthropic
48.7±11.8
85.0%22.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3 8BQwen
48.5±11.8
82.8%24.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Sonar ProPerplexity
47.5±11.8
74.5%29.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Grok 3
47.3±9.3
87.0%33.0%3.80.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Phi 4Microsoft
46.9±11.8
81.0%14.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Ling-3.0-flashInclusionai
46.7±11.5
87.093.283.7估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Command ACohere
46.2±11.8
81.9%9.7%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Grok-2
46.2±11.8
77.8%13.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4o (2024-08-06)OpenAI
46.2±11.8
79.5%11.7%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Llama 4 MaverickMeta
46.2±9.3
88.9%39.0%0.7估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4o MiniOpenAI
46.1±11.8
78.9%11.7%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4o (2024-05-13)OpenAI
46±11.8
79.1%11.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4 TurboOpenAI
45.8±11.8
73.7%15.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek R1 Distill Qwen 1.5BDeepSeek
45.5±11.8
68.7%17.7%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4.1 NanoOpenAI
45.2±9.3
84.8%23.7%1.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Mistral SabaMistral
44.7±11.8
67.7%13.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Mistral Large 2407Mistralai
44.5±11.8
71.4%9.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Llama 4 ScoutMeta
44.4±9.3
84.4%28.3%0.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Phi 4 Multimodal Instruct
44.2±11.8
69.3%9.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 1.5 ProGoogle
43.7±11.8
67.3%8.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Devstral SmallMistral AI
43.4±11.8
68.4%6.7%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude 3.5 SonnetAnthropic
43±9.3
69.5%9.7%2.10.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 1.5 FlashGoogle
42.6±11.8
55.4%9.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude 3.5 HaikuAnthropic
42.5±11.8
72.1%3.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Sonnet 4.5Anthropic
42.5±12.3
87.013.54.2估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4oOpenAI
42.2±9.3
79.7%10.3%0.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Phi 4 Mini Instruct
42±11.8
69.6%3.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude 3 OpusAnthropic
41.5±11.8
64.1%3.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.5
41.4±11.5
87.993.392.794.880.9估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.6 27BQwen
41.3±11.5
84.394.190.793.880.8估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Hermes 3 70B InstructNous
39.6±11.8
53.8%2.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude 3 SonnetAnthropic
39.6±11.8
41.4%4.7%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude 2.1Anthropic
38.5±11.8
37.4%3.3%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Mixtral 8x22B InstructMistral
36.8±11.8
54.5%0.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Mistral LargeMistralai
36.6±11.8
52.7%0.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude 3 HaikuAnthropic
36.4±11.8
39.4%1.0%估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.6 35B A3BQwen
34.6±11.5
83.692.789.190.778.9估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek V4 FlashDeepSeek
32.6±12.2
40.841.9估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek V4 ProDeepSeek
31.6±12.2
31.735.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
暂定模型(不排名)11
GPT-5.6 SolOpenAI
67±16.1
89.083.089.0暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
InklingThinking Machines
65.4±16.3
97.1暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.6 TerraOpenAI
64.5±16.1
84.968.384.9暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.6 LunaOpenAI
62.4±16.1
78.658.578.6暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Opus 4.8Anthropic
58±16.1
47.231.3暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.4OpenAI
57.6±16.1
47.627.1暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.5 ProOpenAI
57.2±16.1
51.039.652.4暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.5OpenAI
56.9±16.1
51.735.451.7暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.4 ProOpenAI
56.8±16.1
50.037.550.0暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Opus 4.7Anthropic
56.8±16.1
43.822.9暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Opus 4.6Anthropic
56.5±16.1
40.722.9暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日

这个榜单衡量什么

哪个 AI 模型更适合数学任务

这类榜单关注基础数学、竞赛数学、高阶证明和工具辅助数学。不同数学任务需要不同能力。

当前可用数据覆盖 4/4 个维度,并展示 13 个 Benchmark 列。

四个能力维度

四个维度来自分类蓝图。当前可用数据可能只覆盖其中一部分。没有证据的维度不会被写成已验证能力。

基础数学

当前有 2 个 Benchmark 列提供这个维度的证据。

  • MATH-500
  • AA Math Index

竞赛数学

当前有 6 个 Benchmark 列提供这个维度的证据。

  • AIME
  • HMMT Feb 2026
  • AIME26
  • HMMT Nov 2025
  • HMMT Feb 2025
  • AIME 2025

高阶证明

当前有 4 个 Benchmark 列提供这个维度的证据。

  • FrontierMath v2 (Tiers 1-3)
  • FrontierMath v2 (Tier 4)
  • FrontierMath (legacy)
  • IMOAnswerBench

应用与工具辅助数学

当前有 1 个 Benchmark 列提供这个维度的证据。

  • MMAnswerBench

适合参考的数学任务

  • 基础解题。它包括算术、代数和常见数学问题。
  • 竞赛和证明。模型需要给出多步过程,并保证每一步成立。
  • 数据计算和工具任务。模型需要正确设置公式,并检查工具结果。

如何用这张榜单选择模型

  1. 第 1 步

    先确认评级状态

    只有正式评级模型才有名次。估算和暂定模型没有正式名次。

  2. 第 2 步

    再看评分区间和证据

    分数接近时,不要只看名次。还要查看不确定性、维度覆盖和 Benchmark 数量。

  3. 第 3 步

    最后用真实任务测试

    榜单不能替代你的测试。请同时检查质量、速度、价格、上下文和供应商限制。

先按题型选择模型。重要计算要复算。证明题要检查每一步是否成立。

评级状态说明

正式评级

正式评级表示证据和重叠条件已满足。模型可以进入排名。

估算

估算表示已有部分证据,但还不满足正式排名条件。

暂定

暂定表示证据较少,或维度与 Benchmark family 覆盖还不满足估算条件。结果只适合早期观察。

Benchmark 与证据来源

证据来源名称和 Benchmark 分组来自当前可用评分数据。一个来源可以提供多个 Benchmark。

  • Artificial Analysis

    AA Math Index、AIME和MATH-500

  • BenchLM

    AIME 2025、AIME26、FrontierMath (legacy)、FrontierMath v2 (Tier 4)、FrontierMath v2 (Tiers 1-3)、HMMT Feb 2025、HMMT Feb 2026、HMMT Nov 2025、IMOAnswerBench和MMAnswerBench

Math 模型排行榜如何生成

LMSpeed 将合格的第三方 Benchmark 先归入四个固定能力维度。Rated 模型满足正式排名所需的证据覆盖与重叠校准要求;Estimated 与 Provisional 模型继续展示,但不授予名次。

阅读分类分数方法论

榜单限制

分类分来自当前收录的第三方 Benchmark。不同测试可能使用不同数据、提示和评分规则。榜单不代表永久结论,也不能代表每个真实任务。重要选择仍要用自己的数据和流程测试。

常见问题

当前可见模型中谁的正式名次最高

当前没有正式第一名。页面有 89 个估算模型和 11 个暂定模型。它们没有正式名次,不能当成冠军。

不同分类的分数可以直接比较吗

不可以。每个分类使用不同的能力维度和证据。分类分只适合在同一张榜单内比较。需要比较不同任务时,请分别查看对应分类。

估算和暂定模型值得看吗

可以把它们当成候选模型。它们的证据还不够完整,所以没有正式名次。先看证据覆盖和不确定性,再用真实任务测试。

榜单多久更新一次

新的完整评分运行发布后,榜单会更新。页面顶部会显示当前运行日期和方法版本。LMSpeed 不保证固定的日更或周更时间。

排名第一就是最适合我的模型吗

不一定。你的任务还会受到速度、价格、上下文长度、工具支持、地区和供应商限制影响。榜单用于缩小范围,不能替代真实测试。

数学排名能代表通用推理吗

不能。数学榜只说明数学任务表现。逻辑、因果和证据验证等任务需要查看推理榜。真实业务还要检查工具使用和回答稳定性。