分类分数 V3 排行榜
LMSpeed 推理能力最强的 AI 模型
从抽象逻辑、科学因果、多步约束和证据验证 Benchmark 对比推理能力最强的 AI 模型,并同时查看分类分与不确定性。
方法论 3.0查看方法论
当前结论
当前可见的正式排名中,GPT-5.6 Sol 的名次最高。它的全局名次是第 1 位,分类分为 61.2,80% 不确定性范围为 ±8.7。共有 64 个可见模型获得正式名次。这只代表本次评分运行。
当前可用榜单数据
- 收录模型
- 100
- 正式排名模型
- 64
- Benchmark 列
- 12
- 已有证据的维度
- 4/4
如何阅读 Benchmark 进度条
每个进度条只用于比较同一 Benchmark 列中的模型,长度相对于当前榜单展示的模型计算;它不是分类分数,也不能跨 Benchmark 列比较。
| 排名 | 模型 | LMSpeed 分类分 | 抽象逻辑 | 科学与因果推理 | 多步约束 | 证据整合与验证 | 评级 | 证据覆盖 | 更新时间 | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ARC-AGI-2undefined 个模型 | GPQAundefined 个模型 | HLEundefined 个模型 | CritPtundefined 个模型 | HLE w/o toolsundefined 个模型 | AA-GPQA Diamondundefined 个模型 | AA-HLEundefined 个模型 | MMLU-Proundefined 个模型 | AA-LCRundefined 个模型 | LongBench v2undefined 个模型 | MRCR 1Mundefined 个模型 | AI-Needleundefined 个模型 | ||||||
| 正式排名模型64 | |||||||||||||||||
| 1 | GPT-5.6 SolOpenAI | 61.2±8.7 | 92.5 | 93.1% | 47.3% | 32.3 | — | — | — | — | 77.7 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 2 | DeepSeek V4 Pro 0813DeepSeek | 61±8.3 | — | — | — | 18.0 | — | 92.8 | 41.0 | 87.5% | 75.3 | — | 83.5 | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 3 | Claude Opus 4.5Anthropic | 60.7±8.1 | — | 86.6% | 30.1% | 0.3 | — | — | — | 89.5% | 67.3 | 64.4 | — | 74.0 | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 4 | Claude Opus 5Anthropic | 60.3±8.7 | 90.4 | 91.9% | 51.3% | 29.1 | 56.3 | — | — | — | 75.7 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 5 | Qwen3.7 MaxQwen | 59.6±8.7 | — | 92.3% | 40.5% | 13.4 | — | — | — | 89.6% | 74.7 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 6 | DeepSeek V4 Flash 0731DeepSeek | 59.4±8.3 | — | — | — | 16.6 | — | 90.8 | 38.6 | 86.2% | 74.3 | — | 78.7 | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 7 | GPT-5.5OpenAI | 59.2±8.7 | 85.0 | 92.6% | 42.4% | 27.1 | 41.4 | — | — | — | 79.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 8 | GPT-5.6 TerraOpenAI | 58.7±8.7 | 83.9 | 89.6% | 38.5% | 30.0 | — | — | — | — | 79.7 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 9 | Gemini 3.1 ProGoogle | 58.2±8.7 | 77.1 | — | — | 17.7 | 45.4 | 94.1 | 47.0 | — | 79.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 10 | Qwen3.7 PlusQwen | 57.4±8.7 | — | 90.0% | 35.6% | 9.1 | — | — | — | 88.5% | 69.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 11 | Claude Opus 4.7 MaxAnthropic | 56.7±8.7 | 75.8 | — | — | 12.0 | 46.9 | 91.4 | 42.3 | — | 75.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 12 | Qwen3.6 PlusQwen | 56.6±8.1 | — | 88.2% | 27.8% | 2.9 | — | — | — | 88.5% | 72.3 | 62.0 | — | 68.3 | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 13 | Claude Opus 4.8Anthropic | 56.4±8.7 | 72.1 | 92.0% | 48.7% | 20.9 | 49.8 | — | — | — | 73.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 14 | GPT-5.4OpenAI | 56.2±8.7 | 74.0 | 87.1% | 30.8% | 23.4 | 39.8 | — | — | — | 77.7 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 15 | Kimi K2.5MoonshotAI | 55.5±8.3 | — | 87.9% | 30.7% | 3.1 | — | — | — | 87.1% | 73.0 | 61.0 | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 16 | GPT-5.1 CodexOpenAI | 55.3±8.7 | — | 86.0% | 25.7% | 5.7 | — | — | — | 86.0% | 69.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 17 | DeepSeek V4 ProDeepSeek | 54.8±9.0 | — | 92.8% | 41.0% | — | — | — | — | 82.9% | — | — | 44.7 | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 18 | GPT-5.6 LunaOpenAI | 54.4±8.7 | 59.5 | 85.9% | 25.8% | 20.6 | — | — | — | — | 78.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 19 | GLM-4.7Z.ai | 54.4±8.7 | — | 85.9% | 27.4% | 1.7 | — | — | — | 85.6% | 68.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 20 | Qwen3.6 27BQwen | 54.4±8.7 | — | 82.9% | 15.1% | 1.1 | — | — | — | 86.2% | 73.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 21 | Grok 4.5SpaceXAI | 54.4±8.7 | 52.6 | 93.1% | 42.7% | 15.4 | — | — | — | — | 74.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 22 | O3OpenAI | 54.3±8.7 | — | 82.7% | 20.1% | 1.1 | — | — | — | 85.3% | 73.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 23 | Gemini 2.5 ProGoogle | 54.2±8.7 | — | 84.4% | 22.5% | 2.6 | — | — | — | 86.2% | 66.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 24 | Gemini 3 ProGoogle | 54.1±6.4 | 31.1 | 90.8% | 39.7% | 9.1 | — | — | — | 89.8% | 73.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 25 | GPT-5.1OpenAI | 54±8.7 | — | 64.3% | 5.3% | 4.9 | — | — | — | 87.0% | 76.7 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 26 | DeepSeek V4 FlashDeepSeek | 53.7±9.0 | — | 90.8% | 38.6% | — | — | — | — | 83.0% | — | — | 37.5 | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 27 | Qwen3.5-27BQwen | 53.6±8.3 | — | 85.8% | 23.9% | 0.9 | — | — | — | 86.1% | 72.3 | 60.6 | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 28 | GPT-5.2OpenAI | 53.5±6.4 | 52.9 | 86.4% | 26.7% | 11.6 | — | — | — | 81.4% | 79.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 29 | Claude Opus 4.6Anthropic | 53.4±8.7 | — | 89.6% | 39.9% | 2.8 | 40.0 | — | — | 82.0% | 62.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 30 | Gemini 3.5 FlashGoogle | 53.4±8.4 | 72.1 | 92.1% | 41.3% | 13.1 | — | — | — | — | 69.3 | — | 26.6 | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 31 | Qwen3.5-122B-A10BQwen | 53.1±8.3 | — | 85.7% | 25.2% | 0.6 | — | — | — | 86.7% | 70.3 | 60.2 | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 32 | GPT-5OpenAI | 52.7±8.7 | — | 68.6% | 6.6% | 5.7 | — | — | — | 82.0% | 76.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 33 | Qwen3.6 35B A3BQwen | 52.4±8.7 | — | 81.7% | 13.9% | 0.3 | — | — | — | 85.2% | 66.7 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 34 | Qwen3.5 | 52.3±8.1 | — | 45.6% | 2.6% | 1.7 | — | — | — | 87.8% | 72.7 | 63.2 | — | 68.7 | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 35 | Gemini 3 FlashGoogle | 52.2±8.7 | — | 81.2% | 15.0% | 1.4 | — | — | — | 88.2% | 53.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 36 | Qwen3.5-35B-A3BQwen | 51.2±8.3 | — | 84.5% | 21.0% | 0.9 | — | — | — | 85.3% | 68.3 | 59.0 | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 37 | DeepSeek V3.2DeepSeek | 51±8.7 | — | 87.1% | 28.7% | 0.9 | — | — | — | 86.3% | 42.7 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 38 | Inkling SmallThinking Machines | 50.9±8.7 | 40.1 | 89.5% | 33.3% | 8.3 | 31.6 | — | — | — | 69.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 39 | O1OpenAI | 50.7±8.7 | — | 76.5% | 7.0% | 0.3 | — | — | — | 84.8% | 63.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 40 | DeepSeek R1DeepSeek | 50.2±8.7 | — | 70.8% | 8.5% | 1.4 | — | — | — | 84.9% | 56.7 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 41 | Claude Sonnet 4.6Anthropic | 49.8±8.7 | — | 79.7% | 11.2% | 0.9 | — | — | — | 79.2% | 62.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 42 | gpt-oss-120bOpenAI | 49.2±8.7 | — | 78.2% | 19.6% | 1.1 | — | — | — | 80.8% | 51.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 43 | Gemini 2.5 FlashGoogle | 48.9±8.7 | — | 76.6% | 8.7% | 1.4 | — | — | — | 83.6% | 48.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 44 | GLM-5Z.ai | 48.9±8.1 | — | 66.6% | 7.6% | 2.0 | — | — | — | 85.7% | 70.7 | 60.8 | — | 63.3 | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 45 | Qwen3 MaxQwen | 48.9±8.7 | — | 76.4% | 11.9% | 0.0 | — | — | — | 84.1% | 48.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 46 | DeepSeek V3.1DeepSeek | 48.7±8.7 | — | 77.9% | 14.3% | 0.0 | — | — | — | 83.3% | 46.7 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 47 | Kimi K2MoonshotAI | 48.6±8.7 | — | 76.6% | 7.4% | 0.0 | — | — | — | 82.4% | 53.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 48 | GPT-4.1OpenAI | 48.5±8.7 | — | 66.6% | 4.2% | 0.0 | — | — | — | 80.6% | 64.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 49 | MiMo-V2-Flash | 48.4±8.7 | — | 84.6% | 22.8% | 0.0 | — | — | — | 84.3% | 35.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 50 | Claude Sonnet 4Anthropic | 47.4±8.7 | — | 68.3% | 4.3% | 1.1 | — | — | — | 83.7% | 45.7 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 51 | GLM-4.5 AirZ.ai | 47±8.7 | — | 73.3% | 7.0% | 0.0 | — | — | — | 81.5% | 45.7 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 52 | Llama 4 MaverickMeta | 46.8±8.7 | — | 67.1% | 4.9% | 0.0 | — | — | — | 80.9% | 50.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 53 | Command ACohere | 45.5±8.7 | — | 76.1% | 12.0% | 0.3 | — | — | — | 71.2% | 48.7 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 54 | GPT-4.1 MiniOpenAI | 45.4±8.7 | — | 66.4% | 5.0% | 0.0 | — | — | — | 78.1% | 45.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 55 | Mistral Large 3 | 44.5±8.7 | — | 68.0% | 4.2% | 0.0 | — | — | — | 80.7% | 34.7 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 56 | DeepSeek V3 | 44.4±8.7 | — | 65.5% | 4.7% | 0.0 | — | — | — | 81.9% | 31.7 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 57 | gpt-oss-20bOpenAI | 44.2±8.7 | — | 68.8% | 11.0% | 1.4 | — | — | — | 74.8% | 33.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 58 | GLM-4.6Z.ai | 42.8±8.7 | — | 63.2% | 5.5% | 0.0 | — | — | — | 78.4% | 28.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 59 | Mistral Medium 3Mistral | 42.3±8.7 | — | 57.8% | 4.1% | 0.0 | — | — | — | 76.0% | 31.7 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 60 | Llama 4 ScoutMeta | 41.8±8.7 | — | 58.7% | 3.8% | 0.0 | — | — | — | 75.2% | 30.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 61 | GPT-4oOpenAI | 39.9±8.7 | — | 51.1% | 2.7% | 0.0 | — | — | — | 77.3% | 0.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 62 | DeepSeek R1 Distill QwenDeepSeek | 39.1±8.9 | — | 48.4% | 4.1% | — | — | — | — | 74.0% | 8.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 63 | Phi 4Microsoft | 39.1±8.7 | — | 57.5% | 3.8% | 0.0 | — | — | — | 71.4% | 0.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 64 | GPT-4.1 NanoOpenAI | 37.6±8.7 | — | 51.2% | 3.8% | 0.0 | — | — | — | 65.7% | 19.3 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 估算模型(不排名)36 | |||||||||||||||||
| — | Qwen3.8 MaxQwen | 64.5±10.1 | — | 92.7% | 43.0% | 20.0 | 43.6 | — | — | — | 74.3 | 66.3 | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Muse Spark 1.2Meta | 61.3±10.8 | — | 90.4% | 45.5% | 17.7 | — | — | — | — | 83.3 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Claude Fable 5Anthropic | 60.6±10.8 | — | 92.6% | 55.5% | 28.6 | — | — | — | — | 76.7 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Gemini 3 Flash PreviewGoogle | 60.2±11.1 | — | 89.8% | 36.6% | — | — | — | — | 89.0% | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Gemini 3.6 FlashGoogle | 59.7±10.8 | — | 92.8% | 40.8% | 10.6 | — | — | — | — | 79.0 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.3 CodexOpenAI | 59.7±10.8 | — | 91.5% | 42.5% | 16.9 | — | — | — | — | 78.3 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Muse Spark 1.1Meta | 59.5±10.2 | — | 89.8% | 46.2% | 15.1 | 52.2 | — | — | — | 81.3 | — | 54.1 | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Gemini 3.7 FlashGoogle | 59.3±10.8 | — | 90.1% | 35.1% | 14.3 | — | — | — | — | 80.0 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Grok 4.6SpaceXAI | 59.3±10.8 | — | 93.5% | 44.1% | 17.1 | — | — | — | — | 75.0 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Kimi K3MoonshotAI | 59.3±10.8 | — | 84.2% | 25.0% | 23.4 | 43.5 | — | — | — | 82.7 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | MiniMax M3MiniMax | 59.2±10.8 | — | 92.9% | 39.0% | 3.7 | — | — | — | — | 80.3 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.4 ProOpenAI | 59.1±11.3 | 83.3 | — | 58.7% | 30.0 | 42.7 | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.2 CodexOpenAI | 58.7±10.8 | — | 89.9% | 35.7% | 8.7 | — | — | — | — | 79.3 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Kimi K2.7 CodeMoonshotAI | 57.5±10.8 | — | 89.6% | 35.0% | 10.0 | — | — | — | — | 75.0 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | MiniMax M2.1MiniMax | 56.8±11.1 | — | 83.0% | 23.2% | — | — | — | — | 87.5% | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Hy3Tencent | 56.7±10.8 | — | 89.7% | 33.5% | 4.9 | — | — | — | — | 74.7 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5 CodexOpenAI | 56.7±11.1 | — | 83.7% | 27.8% | — | — | — | — | 86.5% | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Claude Sonnet 5Anthropic | 56.3±10.8 | — | 80.0% | 19.0% | 16.9 | 43.2 | — | — | — | 77.0 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Muse Glimmer 30BMeta | 56.1±10.8 | — | — | — | 2.6 | — | 83.5 | 22.0 | — | 80.0 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Claude Opus 4.7Anthropic | 55.9±10.8 | — | 88.5% | 33.3% | 5.1 | — | — | — | — | 72.3 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.4 MiniOpenAI | 55.6±10.8 | — | 87.5% | 28.1% | 10.0 | 28.2 | — | — | — | 73.0 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3.6 Max PreviewQwen | 55.5±10.8 | — | 88.8% | 30.8% | 3.7 | — | — | — | — | 72.0 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Kimi K2 ThinkingMoonshotAI | 55.5±11.1 | — | 83.8% | 23.8% | — | — | — | — | 84.8% | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | InklingThinking Machines | 55.4±10.8 | — | 87.2% | 31.9% | 5.4 | 30.0 | — | — | — | 73.3 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Gemini 2.5 Pro Preview 06-05Google | 55.4±11.1 | — | 83.6% | 18.0% | — | — | — | — | 85.8% | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Kimi K2.6MoonshotAI | 55.3±10.8 | — | 78.8% | 19.6% | 8.0 | — | — | — | — | 76.7 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3 Max ThinkingQwen | 55.1±11.1 | — | 86.1% | 28.0% | — | — | — | — | 82.4% | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | MiniMax M2.7MiniMax | 54.6±10.8 | — | 87.4% | 29.6% | 0.6 | — | — | — | — | 75.3 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GLM-5.2Z.ai | 54.5±10.8 | — | 68.6% | 9.8% | 20.9 | 40.5 | — | — | — | 76.7 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.1 Codex MaxOpenAI | 54.3±10.8 | — | — | — | 5.7 | — | 86.0 | 25.7 | — | 69.0 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Grok 4.3SpaceXAI | 54.3±10.8 | — | 89.0% | 30.0% | 8.0 | — | — | — | — | 64.3 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | MiMo-V2.5-ProXiaomi | 54.2±10.8 | — | 76.2% | 14.8% | 4.0 | 34.0 | — | — | — | 77.7 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | DeepSeek V3.1 TerminusDeepSeek | 54.1±11.1 | — | 79.2% | 16.4% | — | — | — | — | 85.1% | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | DeepSeek V3.2 ExpDeepSeek | 54±11.1 | — | 79.7% | 14.9% | — | — | — | — | 85.0% | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GLM-5.1Z.ai | 53.8±10.8 | — | 83.9% | 27.9% | 4.6 | — | — | — | — | 68.0 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3 235B A22B Instruct 2507Qwen | 53.6±11.1 | — | 79.0% | 15.9% | — | — | — | — | 84.3% | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
这个榜单衡量什么
哪个 AI 模型更适合复杂推理
这类榜单关注逻辑、因果、多步约束和证据验证。它衡量的是推理表现,不是所有任务的总能力。
四个能力维度
四个维度来自分类蓝图。当前可用数据可能只覆盖其中一部分。没有证据的维度不会被写成已验证能力。
抽象逻辑
当前有 1 个 Benchmark 列提供这个维度的证据。
- ARC-AGI-2
科学与因果推理
当前有 6 个 Benchmark 列提供这个维度的证据。
- GPQA
- HLE
- CritPt
- HLE w/o tools
- AA-GPQA Diamond
- AA-HLE
多步约束
当前有 1 个 Benchmark 列提供这个维度的证据。
- MMLU-Pro
证据整合与验证
当前有 4 个 Benchmark 列提供这个维度的证据。
- AA-LCR
- LongBench v2
- MRCR 1M
- AI-Needle
适合参考的推理任务
- 复杂分析。模型需要拆开条件,并保持多步结论一致。
- 科学问题。模型需要处理因果关系、假设和证据。
- 结论检查。模型需要找出漏洞,并判断证据是否支持结论。
如何用这张榜单选择模型
- 第 1 步
先确认评级状态
只有正式评级模型才有名次。估算和暂定模型没有正式名次。
- 第 2 步
再看评分区间和证据
分数接近时,不要只看名次。还要查看不确定性、维度覆盖和 Benchmark 数量。
- 第 3 步
最后用真实任务测试
榜单不能替代你的测试。请同时检查质量、速度、价格、上下文和供应商限制。
不要只看一个高分。还要看评分区间、任务类型、回答稳定性和验证成本。
评级状态说明
正式评级
正式评级表示证据和重叠条件已满足。模型可以进入排名。
估算
估算表示已有部分证据,但还不满足正式排名条件。
暂定
暂定表示证据较少,或维度与 Benchmark family 覆盖还不满足估算条件。结果只适合早期观察。
Benchmark 与证据来源
证据来源名称和 Benchmark 分组来自当前可用评分数据。一个来源可以提供多个 Benchmark。
Artificial Analysis
GPQA、HLE和MMLU-Pro
BenchLM
AA-GPQA Diamond、AA-HLE、AA-LCR、AI-Needle、ARC-AGI-2、CritPt、GPQA、HLE、HLE w/o tools、LongBench v2、MMLU-Pro和MRCR 1M
Reasoning 模型排行榜如何生成
LMSpeed 将合格的第三方 Benchmark 先归入四个固定能力维度。Rated 模型满足正式排名所需的证据覆盖与重叠校准要求;Estimated 与 Provisional 模型继续展示,但不授予名次。
阅读分类分数方法论榜单限制
分类分来自当前收录的第三方 Benchmark。不同测试可能使用不同数据、提示和评分规则。榜单不代表永久结论,也不能代表每个真实任务。重要选择仍要用自己的数据和流程测试。
常见问题
当前可见模型中谁的正式名次最高
当前可见模型中,GPT-5.6 Sol 的正式名次最高。它的全局名次是第 1 位,分类分为 61.2。共有 64 个可见模型满足正式排名条件。这个结果只适用于页面所示的评分日期和方法版本。
不同分类的分数可以直接比较吗
不可以。每个分类使用不同的能力维度和证据。分类分只适合在同一张榜单内比较。需要比较不同任务时,请分别查看对应分类。
估算和暂定模型值得看吗
可以把它们当成候选模型。它们的证据还不够完整,所以没有正式名次。先看证据覆盖和不确定性,再用真实任务测试。
榜单多久更新一次
新的完整评分运行发布后,榜单会更新。页面顶部会显示当前运行日期和方法版本。LMSpeed 不保证固定的日更或周更时间。
排名第一就是最适合我的模型吗
不一定。你的任务还会受到速度、价格、上下文长度、工具支持、地区和供应商限制影响。榜单用于缩小范围,不能替代真实测试。
推理分和数学分一样吗
不一样。数学是独立分类。推理榜还包含抽象逻辑、科学因果、多步约束和证据验证。数学分高不代表所有推理任务都更好。
