分类分数 V3 排行榜
LMSpeed 知识能力最强的 AI 模型
使用当前评分运行中的全部有效证据,对比模型的广泛知识、专业知识、事实性、检索与开放资料运用能力。
方法论 3.0查看方法论
当前结论
当前还没有模型满足正式排名规则。下表有 7 个估算模型和 93 个暂定模型。它们可用于观察,但不能当成正式名次。
当前可用榜单数据
- 收录模型
- 100
- 正式排名模型
- 0
- Benchmark 列
- 10
- 已有证据的维度
- 3/4
如何阅读 Benchmark 进度条
每个进度条只用于比较同一 Benchmark 列中的模型,长度相对于当前榜单展示的模型计算;它不是分类分数,也不能跨 Benchmark 列比较。
| 排名 | 模型 | LMSpeed 分类分 | 广泛知识 | 专业知识 | 事实性 | 评级 | 证据覆盖 | 更新时间 | |||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| AA-Omniscience Indexundefined 个模型 | BenchLM Knowledge scoreundefined 个模型 | Artificial Analysis Intelligence Indexundefined 个模型 | MMLU-Reduxundefined 个模型 | C-Evalundefined 个模型 | MMLUundefined 个模型 | SuperGPQAundefined 个模型 | HealthBench Hardundefined 个模型 | MedXpertQA (Text)undefined 个模型 | SimpleQAundefined 个模型 | ||||||
| 估算模型(不排名)7 | |||||||||||||||
| — | Claude Opus 4.5Anthropic | 57.6±11.6 | — | — | — | 96.6 | 92.2 | — | 70.6 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3.7 MaxQwen | 55.8±12.2 | — | — | — | 95.0 | — | — | 73.6 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3.5 | 53.1±11.6 | — | — | — | 94.9 | 93.0 | — | 70.4 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3.6 PlusQwen | 52±11.6 | — | — | — | 94.5 | 93.3 | — | 71.6 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3.7 PlusQwen | 48.6±12.2 | — | — | — | 94.5 | — | — | 71.4 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3.6 35B A3BQwen | 39.1±12.2 | — | — | — | — | 90.0 | — | 64.7 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3.6 27BQwen | 37.3±11.6 | — | — | — | 93.5 | 91.4 | — | 66.0 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 暂定模型(不排名)93 | |||||||||||||||
| — | Claude Sonnet 4.6Anthropic | 70.6±16.3 | — | — | — | — | — | — | 95.0 | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Claude Opus 5Anthropic | 68.5±14.0 | 37.1 | 97.0 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Muse Spark 1.1Meta | 65.6±14.0 | 28.1 | 92.8 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Claude Opus 4.8Anthropic | 63.8±14.0 | 28.8 | 86.8 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | O1OpenAI | 62.5±17.4 | — | — | — | — | — | 91.8 | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.4 ProOpenAI | 62.2±16.1 | — | 88.0 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Claude Opus 4.7 MaxAnthropic | 61.8±14.0 | 27.3 | 81.8 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Kimi K3MoonshotAI | 61.2±14.0 | 19.7 | 83.8 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.5 ProOpenAI | 61±16.1 | — | 85.5 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Claude Sonnet 5Anthropic | 60.9±14.0 | 16.5 | 84.6 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Claude Fable 5Anthropic | 60.5±14.0 | 43.3 | 69.4 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | O3 ProOpenAI | 60.1±16.0 | — | — | 33.3 | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.4OpenAI | 59.9±15.1 | — | — | — | — | — | — | — | 40.1 | 59.6 | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.5OpenAI | 59.3±14.0 | 20.5 | 77.7 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Claude Opus 4.1Anthropic | 59±16.0 | — | — | 28.8 | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Grok 4.6SpaceXAI | 58.6±14.0 | 30.5 | 70.5 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | DeepSeek V4 Pro 0813DeepSeek | 58.4±18.0 | — | — | — | — | — | — | — | — | — | 57.9 | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Grok 4.5SpaceXAI | 58±14.0 | 25.3 | 71.1 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Gemini 3.1 ProGoogle | 57.8±15.1 | — | — | — | — | — | — | — | 20.6 | 71.5 | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GLM-5.2Z.ai | 57.8±14.0 | 4.4 | 81.2 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.2OpenAI | 57.7±14.0 | -0.9 | 83.7 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Gemini 3.7 FlashGoogle | 57.5±14.0 | 26.5 | 69.0 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Gemini 3.6 FlashGoogle | 57.5±14.0 | 22.1 | 71.2 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.6 SolOpenAI | 57.2±16.7 | — | — | — | — | — | — | — | 33.1 | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.6 TerraOpenAI | 57±16.7 | — | — | — | — | — | — | — | 32.7 | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-4.1OpenAI | 57±17.4 | — | — | — | — | — | 90.2 | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | O1 ProOpenAI | 56.5±16.0 | — | — | 19.1 | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.6 LunaOpenAI | 56.5±16.7 | — | — | — | — | — | — | — | 32.0 | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Trinity Large ThinkingArcee AI | 56.4±16.0 | — | — | 18.7 | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Gemini 3 ProGoogle | 56.1±14.0 | 15.3 | 70.7 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Muse Spark 1.2Meta | 55.7±14.0 | 27.2 | 63.2 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | gpt-oss-120bOpenAI | 55.4±14.0 | — | 64.0 | 24.1 | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GLM-5.1Z.ai | 55.4±14.0 | 0.9 | 75.7 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3.6 Max PreviewQwen | 55.1±16.3 | — | — | — | — | — | — | 73.9 | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Claude 3 OpusAnthropic | 54.7±16.0 | — | — | 11.8 | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | DeepSeek R1 Distill QwenDeepSeek | 54.4±16.0 | — | — | 11.0 | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.3 CodexOpenAI | 54.4±16.0 | 10.9 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Claude Sonnet 4.5Anthropic | 54.4±16.1 | — | 72.2 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Claude Opus 4.7Anthropic | 54.3±14.0 | 14.8 | 65.5 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Gemini 1.5 ProGoogle | 54.2±16.0 | — | — | 9.8 | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | MiMo-V2.5-ProXiaomi | 54.1±14.0 | 3.3 | 70.7 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Claude Opus 4.6Anthropic | 53.7±13.7 | — | — | — | — | — | — | 95.0 | 14.8 | 52.1 | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Gemini 3.5 FlashGoogle | 53.7±14.0 | 21.2 | 60.4 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-4 TurboOpenAI | 53.6±16.0 | — | — | 7.7 | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-4o MiniOpenAI | 53.4±16.0 | — | — | 6.7 | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.1OpenAI | 53±16.0 | 5.4 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | MiMo-V2-Pro | 52.8±16.0 | 4.6 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Phi 4 Multimodal Instruct | 52.7±16.0 | — | — | 4.2 | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | DeepSeek V4 ProDeepSeek | 52.6±18.0 | — | — | — | — | — | — | — | — | — | 45.0 | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | InklingThinking Machines | 52.6±14.0 | 2.0 | 66.8 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3.8 MaxQwen | 52.3±14.0 | 3.4 | 65.1 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | MiniMax M3MiniMax | 52.1±14.0 | 1.4 | 65.7 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | MiniMax M2.7MiniMax | 51.9±16.0 | 0.8 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Inkling SmallThinking Machines | 51.8±14.0 | -8.9 | 69.9 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Gemini 3.5 Flash-LiteGoogle | 51.7±14.0 | 5.2 | 62.3 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Grok 4.3SpaceXAI | 51.5±14.0 | 18.0 | 55.4 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.2 CodexOpenAI | 51.1±16.0 | -2.2 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Command ACohere | 50.6±16.0 | -4.0 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Gemini 3 FlashGoogle | 50.6±16.0 | -4.3 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.1 Codex MaxOpenAI | 50±16.0 | -6.5 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.1 CodexOpenAI | 50±16.0 | -6.5 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5OpenAI | 49.5±16.0 | -8.7 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Claude Sonnet 4Anthropic | 49.4±16.0 | -9.0 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-4.1 MiniOpenAI | 49.3±17.4 | — | — | — | — | — | 87.5 | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Kimi K2.7 CodeMoonshotAI | 49.1±16.0 | -10.2 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-4oOpenAI | 49±16.0 | -10.5 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Kimi K2.6MoonshotAI | 48±14.0 | 5.3 | 51.3 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | O3 MiniOpenAI | 47.8±17.4 | — | — | — | — | — | 86.9 | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | O3OpenAI | 47.7±16.0 | -15.5 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | DeepSeek V4 Flash 0731DeepSeek | 47.5±18.0 | — | — | — | — | — | — | — | — | — | 34.1 | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GLM-5 TurboZ.ai | 47.5±16.0 | -16.4 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Llama 3.1Meta | 47.3±16.0 | -17.1 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Kimi K2.5MoonshotAI | 47.1±16.3 | — | — | — | — | — | — | 69.2 | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Hy3Tencent | 47±16.0 | -18.5 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GLM-5V TurboZ.ai | 46.8±16.0 | -19.3 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | MiMo-V2-Omni | 46.6±16.0 | -20.1 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.4 MiniOpenAI | 46±14.0 | -18.9 | 57.6 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | DeepSeek R1DeepSeek | 44.7±16.0 | -27.4 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Kimi K2MoonshotAI | 44.5±16.0 | -28.3 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Grok 4.20SpaceXAI | 44.1±15.1 | — | — | — | — | — | — | — | 20.3 | 50.2 | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3.5-122B-A10BQwen | 43.7±16.3 | — | — | — | — | — | — | 67.1 | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Mistral Medium 3Mistral | 43.7±16.0 | -31.4 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GLM-4.6Z.ai | 43.6±16.0 | -31.7 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Muse Glimmer 30BMeta | 43.3±16.0 | -32.8 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.4 NanoOpenAI | 43.3±14.0 | -29.5 | 54.8 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GLM-5Z.ai | 43.3±16.3 | — | — | — | — | — | — | 66.8 | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Mistral Medium 3.5Mistral | 42.3±16.0 | -36.8 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Step 3.7 FlashStepFun | 42.2±16.0 | -37.3 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3.8 27BQwen | 41.9±16.1 | — | 47.0 | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Mistral Large 3 | 41.6±16.0 | -39.6 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | DeepSeek V4 FlashDeepSeek | 41.4±18.0 | — | — | — | — | — | — | — | — | — | 23.1 | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3.5-27BQwen | 41.4±16.3 | — | — | — | — | — | — | 65.6 | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | DeepSeek V3 | 41.1±16.0 | -41.6 | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
这个榜单衡量什么
哪个 AI 模型更适合知识问答
这类榜单关注广泛知识、专业知识、事实性和开放资料运用。它不能保证模型知道刚发生的事情。
四个能力维度
四个维度来自分类蓝图。当前可用数据可能只覆盖其中一部分。没有证据的维度不会被写成已验证能力。
广泛知识
当前有 6 个 Benchmark 列提供这个维度的证据。
- AA-Omniscience Index
- BenchLM Knowledge score
- Artificial Analysis Intelligence Index
- MMLU-Redux
- C-Eval
- MMLU
专业知识
当前有 3 个 Benchmark 列提供这个维度的证据。
- SuperGPQA
- HealthBench Hard
- MedXpertQA (Text)
事实性
当前有 1 个 Benchmark 列提供这个维度的证据。
- SimpleQA
检索与开放资料运用
当前可用数据还没有这个维度的合格证据。它不会进入分类分计算。
适合参考的知识任务
- 通用问答。模型需要覆盖多个常见领域,并给出清楚回答。
- 专业资料整理。模型需要理解领域术语,并减少事实错误。
- 检索增强问答。模型需要利用外部资料,而不是只靠训练记忆。
如何用这张榜单选择模型
- 第 1 步
先确认评级状态
只有正式评级模型才有名次。估算和暂定模型没有正式名次。
- 第 2 步
再看评分区间和证据
分数接近时,不要只看名次。还要查看不确定性、维度覆盖和 Benchmark 数量。
- 第 3 步
最后用真实任务测试
榜单不能替代你的测试。请同时检查质量、速度、价格、上下文和供应商限制。
对时效性强的问题,应使用搜索或可靠资料。重要结论仍要检查来源。
评级状态说明
正式评级
正式评级表示证据和重叠条件已满足。模型可以进入排名。
估算
估算表示已有部分证据,但还不满足正式排名条件。
暂定
暂定表示证据较少,或维度与 Benchmark family 覆盖还不满足估算条件。结果只适合早期观察。
Benchmark 与证据来源
证据来源名称和 Benchmark 分组来自当前可用评分数据。一个来源可以提供多个 Benchmark。
BenchLM
AA-Omniscience Index、Artificial Analysis Intelligence Index、BenchLM Knowledge score、C-Eval、HealthBench Hard、MedXpertQA (Text)、MMLU、MMLU-Redux、SimpleQA和SuperGPQA
Knowledge 模型排行榜如何生成
LMSpeed 将合格的第三方 Benchmark 先归入四个固定能力维度。Rated 模型满足正式排名所需的证据覆盖与重叠校准要求;Estimated 与 Provisional 模型继续展示,但不授予名次。
阅读分类分数方法论榜单限制
分类分来自当前收录的第三方 Benchmark。不同测试可能使用不同数据、提示和评分规则。榜单不代表永久结论,也不能代表每个真实任务。重要选择仍要用自己的数据和流程测试。
常见问题
当前可见模型中谁的正式名次最高
当前没有正式第一名。页面有 7 个估算模型和 93 个暂定模型。它们没有正式名次,不能当成冠军。
不同分类的分数可以直接比较吗
不可以。每个分类使用不同的能力维度和证据。分类分只适合在同一张榜单内比较。需要比较不同任务时,请分别查看对应分类。
估算和暂定模型值得看吗
可以把它们当成候选模型。它们的证据还不够完整,所以没有正式名次。先看证据覆盖和不确定性,再用真实任务测试。
榜单多久更新一次
新的完整评分运行发布后,榜单会更新。页面顶部会显示当前运行日期和方法版本。LMSpeed 不保证固定的日更或周更时间。
排名第一就是最适合我的模型吗
不一定。你的任务还会受到速度、价格、上下文长度、工具支持、地区和供应商限制影响。榜单用于缩小范围,不能替代真实测试。
知识分高就不会出现错误吗
不会。高分只表示模型在当前知识 Benchmark 中表现较好。它仍可能给出过时或错误信息。重要事实需要查看日期和原始来源。
