分类分数 V3 排行榜

LMSpeed 知识能力最强的 AI 模型

使用当前评分运行中的全部有效证据,对比模型的广泛知识、专业知识、事实性、检索与开放资料运用能力。

方法论 3.0查看方法论

当前结论

当前还没有模型满足正式排名规则。下表有 7 个估算模型和 93 个暂定模型。它们可用于观察,但不能当成正式名次。

排名会随新数据和方法更新。页面顶部显示本次运行日期。

当前可用榜单数据

收录模型
100
正式排名模型
0
Benchmark 列
10
已有证据的维度
3/4

如何阅读 Benchmark 进度条

每个进度条只用于比较同一 Benchmark 列中的模型,长度相对于当前榜单展示的模型计算;它不是分类分数,也不能跨 Benchmark 列比较。

排名模型LMSpeed 分类分广泛知识专业知识事实性评级证据覆盖更新时间
AA-Omniscience Indexundefined 个模型BenchLM Knowledge scoreundefined 个模型Artificial Analysis Intelligence Indexundefined 个模型MMLU-Reduxundefined 个模型C-Evalundefined 个模型MMLUundefined 个模型SuperGPQAundefined 个模型HealthBench Hardundefined 个模型MedXpertQA (Text)undefined 个模型SimpleQAundefined 个模型
估算模型(不排名)7
Claude Opus 4.5Anthropic
57.6±11.6
96.692.270.6估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.7 MaxQwen
55.8±12.2
95.073.6估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.5
53.1±11.6
94.993.070.4估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.6 PlusQwen
52±11.6
94.593.371.6估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.7 PlusQwen
48.6±12.2
94.571.4估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.6 35B A3BQwen
39.1±12.2
90.064.7估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.6 27BQwen
37.3±11.6
93.591.466.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
暂定模型(不排名)93
Claude Sonnet 4.6Anthropic
70.6±16.3
95.0暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Opus 5Anthropic
68.5±14.0
37.197.0暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Muse Spark 1.1Meta
65.6±14.0
28.192.8暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Opus 4.8Anthropic
63.8±14.0
28.886.8暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
O1OpenAI
62.5±17.4
91.8暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.4 ProOpenAI
62.2±16.1
88.0暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Opus 4.7 MaxAnthropic
61.8±14.0
27.381.8暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Kimi K3MoonshotAI
61.2±14.0
19.783.8暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.5 ProOpenAI
61±16.1
85.5暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Sonnet 5Anthropic
60.9±14.0
16.584.6暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Fable 5Anthropic
60.5±14.0
43.369.4暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
O3 ProOpenAI
60.1±16.0
33.3暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.4OpenAI
59.9±15.1
40.159.6暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.5OpenAI
59.3±14.0
20.577.7暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Opus 4.1Anthropic
59±16.0
28.8暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Grok 4.6SpaceXAI
58.6±14.0
30.570.5暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek V4 Pro 0813DeepSeek
58.4±18.0
57.9暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Grok 4.5SpaceXAI
58±14.0
25.371.1暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3.1 ProGoogle
57.8±15.1
20.671.5暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-5.2Z.ai
57.8±14.0
4.481.2暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.2OpenAI
57.7±14.0
-0.983.7暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3.7 FlashGoogle
57.5±14.0
26.569.0暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3.6 FlashGoogle
57.5±14.0
22.171.2暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.6 SolOpenAI
57.2±16.7
33.1暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.6 TerraOpenAI
57±16.7
32.7暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4.1OpenAI
57±17.4
90.2暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
O1 ProOpenAI
56.5±16.0
19.1暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.6 LunaOpenAI
56.5±16.7
32.0暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Trinity Large ThinkingArcee AI
56.4±16.0
18.7暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3 ProGoogle
56.1±14.0
15.370.7暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Muse Spark 1.2Meta
55.7±14.0
27.263.2暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
gpt-oss-120bOpenAI
55.4±14.0
64.024.1暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-5.1Z.ai
55.4±14.0
0.975.7暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.6 Max PreviewQwen
55.1±16.3
73.9暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude 3 OpusAnthropic
54.7±16.0
11.8暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek R1 Distill QwenDeepSeek
54.4±16.0
11.0暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.3 CodexOpenAI
54.4±16.0
10.9暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Sonnet 4.5Anthropic
54.4±16.1
72.2暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Opus 4.7Anthropic
54.3±14.0
14.865.5暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 1.5 ProGoogle
54.2±16.0
9.8暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiMo-V2.5-ProXiaomi
54.1±14.0
3.370.7暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Opus 4.6Anthropic
53.7±13.7
95.014.852.1暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3.5 FlashGoogle
53.7±14.0
21.260.4暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4 TurboOpenAI
53.6±16.0
7.7暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4o MiniOpenAI
53.4±16.0
6.7暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.1OpenAI
53±16.0
5.4暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiMo-V2-Pro
52.8±16.0
4.6暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Phi 4 Multimodal Instruct
52.7±16.0
4.2暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek V4 ProDeepSeek
52.6±18.0
45.0暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
InklingThinking Machines
52.6±14.0
2.066.8暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.8 MaxQwen
52.3±14.0
3.465.1暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiniMax M3MiniMax
52.1±14.0
1.465.7暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiniMax M2.7MiniMax
51.9±16.0
0.8暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Inkling SmallThinking Machines
51.8±14.0
-8.969.9暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3.5 Flash-LiteGoogle
51.7±14.0
5.262.3暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Grok 4.3SpaceXAI
51.5±14.0
18.055.4暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.2 CodexOpenAI
51.1±16.0
-2.2暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Command ACohere
50.6±16.0
-4.0暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3 FlashGoogle
50.6±16.0
-4.3暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.1 Codex MaxOpenAI
50±16.0
-6.5暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.1 CodexOpenAI
50±16.0
-6.5暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5OpenAI
49.5±16.0
-8.7暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Sonnet 4Anthropic
49.4±16.0
-9.0暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4.1 MiniOpenAI
49.3±17.4
87.5暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Kimi K2.7 CodeMoonshotAI
49.1±16.0
-10.2暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4oOpenAI
49±16.0
-10.5暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Kimi K2.6MoonshotAI
48±14.0
5.351.3暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
O3 MiniOpenAI
47.8±17.4
86.9暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
O3OpenAI
47.7±16.0
-15.5暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek V4 Flash 0731DeepSeek
47.5±18.0
34.1暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-5 TurboZ.ai
47.5±16.0
-16.4暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Llama 3.1Meta
47.3±16.0
-17.1暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Kimi K2.5MoonshotAI
47.1±16.3
69.2暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Hy3Tencent
47±16.0
-18.5暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-5V TurboZ.ai
46.8±16.0
-19.3暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiMo-V2-Omni
46.6±16.0
-20.1暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.4 MiniOpenAI
46±14.0
-18.957.6暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek R1DeepSeek
44.7±16.0
-27.4暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Kimi K2MoonshotAI
44.5±16.0
-28.3暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Grok 4.20SpaceXAI
44.1±15.1
20.350.2暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.5-122B-A10BQwen
43.7±16.3
67.1暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Mistral Medium 3Mistral
43.7±16.0
-31.4暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-4.6Z.ai
43.6±16.0
-31.7暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Muse Glimmer 30BMeta
43.3±16.0
-32.8暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.4 NanoOpenAI
43.3±14.0
-29.554.8暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-5Z.ai
43.3±16.3
66.8暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Mistral Medium 3.5Mistral
42.3±16.0
-36.8暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Step 3.7 FlashStepFun
42.2±16.0
-37.3暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.8 27BQwen
41.9±16.1
47.0暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Mistral Large 3
41.6±16.0
-39.6暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek V4 FlashDeepSeek
41.4±18.0
23.1暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.5-27BQwen
41.4±16.3
65.6暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek V3
41.1±16.0
-41.6暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日

这个榜单衡量什么

哪个 AI 模型更适合知识问答

这类榜单关注广泛知识、专业知识、事实性和开放资料运用。它不能保证模型知道刚发生的事情。

当前可用数据覆盖 3/4 个维度,并展示 10 个 Benchmark 列。

四个能力维度

四个维度来自分类蓝图。当前可用数据可能只覆盖其中一部分。没有证据的维度不会被写成已验证能力。

广泛知识

当前有 6 个 Benchmark 列提供这个维度的证据。

  • AA-Omniscience Index
  • BenchLM Knowledge score
  • Artificial Analysis Intelligence Index
  • MMLU-Redux
  • C-Eval
  • MMLU

专业知识

当前有 3 个 Benchmark 列提供这个维度的证据。

  • SuperGPQA
  • HealthBench Hard
  • MedXpertQA (Text)

事实性

当前有 1 个 Benchmark 列提供这个维度的证据。

  • SimpleQA

检索与开放资料运用

当前可用数据还没有这个维度的合格证据。它不会进入分类分计算。

适合参考的知识任务

  • 通用问答。模型需要覆盖多个常见领域,并给出清楚回答。
  • 专业资料整理。模型需要理解领域术语,并减少事实错误。
  • 检索增强问答。模型需要利用外部资料,而不是只靠训练记忆。

如何用这张榜单选择模型

  1. 第 1 步

    先确认评级状态

    只有正式评级模型才有名次。估算和暂定模型没有正式名次。

  2. 第 2 步

    再看评分区间和证据

    分数接近时,不要只看名次。还要查看不确定性、维度覆盖和 Benchmark 数量。

  3. 第 3 步

    最后用真实任务测试

    榜单不能替代你的测试。请同时检查质量、速度、价格、上下文和供应商限制。

对时效性强的问题,应使用搜索或可靠资料。重要结论仍要检查来源。

评级状态说明

正式评级

正式评级表示证据和重叠条件已满足。模型可以进入排名。

估算

估算表示已有部分证据,但还不满足正式排名条件。

暂定

暂定表示证据较少,或维度与 Benchmark family 覆盖还不满足估算条件。结果只适合早期观察。

Benchmark 与证据来源

证据来源名称和 Benchmark 分组来自当前可用评分数据。一个来源可以提供多个 Benchmark。

  • BenchLM

    AA-Omniscience Index、Artificial Analysis Intelligence Index、BenchLM Knowledge score、C-Eval、HealthBench Hard、MedXpertQA (Text)、MMLU、MMLU-Redux、SimpleQA和SuperGPQA

Knowledge 模型排行榜如何生成

LMSpeed 将合格的第三方 Benchmark 先归入四个固定能力维度。Rated 模型满足正式排名所需的证据覆盖与重叠校准要求;Estimated 与 Provisional 模型继续展示,但不授予名次。

阅读分类分数方法论

榜单限制

分类分来自当前收录的第三方 Benchmark。不同测试可能使用不同数据、提示和评分规则。榜单不代表永久结论,也不能代表每个真实任务。重要选择仍要用自己的数据和流程测试。

常见问题

当前可见模型中谁的正式名次最高

当前没有正式第一名。页面有 7 个估算模型和 93 个暂定模型。它们没有正式名次,不能当成冠军。

不同分类的分数可以直接比较吗

不可以。每个分类使用不同的能力维度和证据。分类分只适合在同一张榜单内比较。需要比较不同任务时,请分别查看对应分类。

估算和暂定模型值得看吗

可以把它们当成候选模型。它们的证据还不够完整,所以没有正式名次。先看证据覆盖和不确定性,再用真实任务测试。

榜单多久更新一次

新的完整评分运行发布后,榜单会更新。页面顶部会显示当前运行日期和方法版本。LMSpeed 不保证固定的日更或周更时间。

排名第一就是最适合我的模型吗

不一定。你的任务还会受到速度、价格、上下文长度、工具支持、地区和供应商限制影响。榜单用于缩小范围,不能替代真实测试。

知识分高就不会出现错误吗

不会。高分只表示模型在当前知识 Benchmark 中表现较好。它仍可能给出过时或错误信息。重要事实需要查看日期和原始来源。