分类分数 V3 排行榜
LMSpeed 知识能力最强的 AI 模型
使用当前评分运行中的全部有效证据,对比模型的广泛知识、专业知识、事实性、检索与开放资料运用能力。
方法论 3.0
当前结论
当前还没有模型满足正式排名规则。下表有 7 个估算模型和 93 个暂定模型。它们可用于观察,但不能当成正式名次。
当前可用榜单数据
- 收录模型
- 100
- 正式排名模型
- 0
- Benchmark 列
- 9
- 已有证据的维度
- 2/4
如何阅读 Benchmark 进度条
每个进度条只用于比较同一 Benchmark 列中的模型,长度相对于当前榜单展示的模型计算;它不是分类分数,也不能跨 Benchmark 列比较。
| 排名 | 模型 | LMSpeed 分类分 | 广泛知识 | 专业知识 | 评级 | 证据覆盖 | 更新时间 | |||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| AA-Omniscience Index72 个模型 | BenchLM Knowledge score38 个模型 | Artificial Analysis Intelligence Index8 个模型 | MMLU-Redux6 个模型 | C-Eval5 个模型 | ||||||||||
这个榜单衡量什么
哪个 AI 模型更适合知识问答
这类榜单关注广泛知识、专业知识、事实性和开放资料运用。它不能保证模型知道刚发生的事情。
四个能力维度
四个维度来自分类蓝图。当前可用数据可能只覆盖其中一部分。没有证据的维度不会被写成已验证能力。
广泛知识
当前有 6 个 Benchmark 列提供这个维度的证据。
- AA-Omniscience Index
- BenchLM Knowledge score
- Artificial Analysis Intelligence Index
- MMLU-Redux
- C-Eval
- MMLU
专业知识
当前有 3 个 Benchmark 列提供这个维度的证据。
- SuperGPQA
- HealthBench Hard
- MedXpertQA (Text)
事实性
当前可用数据还没有这个维度的合格证据。它不会进入分类分计算。
检索与开放资料运用
当前可用数据还没有这个维度的合格证据。它不会进入分类分计算。
适合参考的知识任务
- 通用问答。模型需要覆盖多个常见领域,并给出清楚回答。
- 专业资料整理。模型需要理解领域术语,并减少事实错误。
- 检索增强问答。模型需要利用外部资料,而不是只靠训练记忆。
如何用这张榜单选择模型
- 第 1 步
先确认评级状态
只有正式评级模型才有名次。估算和暂定模型没有正式名次。
- 第 2 步
再看评分区间和证据
分数接近时,不要只看名次。还要查看不确定性、维度覆盖和 Benchmark 数量。
- 第 3 步
最后用真实任务测试
榜单不能替代你的测试。请同时检查质量、速度、价格、上下文和供应商限制。
对时效性强的问题,应使用搜索或可靠资料。重要结论仍要检查来源。
评级状态说明
正式评级
正式评级表示证据和重叠条件已满足。模型可以进入排名。
估算
估算表示已有部分证据,但还不满足正式排名条件。
暂定
暂定表示证据较少,或维度与 Benchmark family 覆盖还不满足估算条件。结果只适合早期观察。
Benchmark 与证据来源
证据来源名称和 Benchmark 分组来自当前可用评分数据。一个来源可以提供多个 Benchmark。
BenchLM
AA-Omniscience Index、Artificial Analysis Intelligence Index、BenchLM Knowledge score、C-Eval、HealthBench Hard、MedXpertQA (Text)、MMLU、MMLU-Redux和SuperGPQA
Knowledge 模型排行榜如何生成
LMSpeed 将合格的第三方 Benchmark 先归入四个固定能力维度。Rated 模型满足正式排名所需的证据覆盖与重叠校准要求;Estimated 与 Provisional 模型继续展示,但不授予名次。
榜单限制
分类分来自当前收录的第三方 Benchmark。不同测试可能使用不同数据、提示和评分规则。榜单不代表永久结论,也不能代表每个真实任务。重要选择仍要用自己的数据和流程测试。
常见问题
当前可见模型中谁的正式名次最高
当前没有正式第一名。页面有 7 个估算模型和 93 个暂定模型。它们没有正式名次,不能当成冠军。
不同分类的分数可以直接比较吗
不可以。每个分类使用不同的能力维度和证据。分类分只适合在同一张榜单内比较。需要比较不同任务时,请分别查看对应分类。
估算和暂定模型值得看吗
可以把它们当成候选模型。它们的证据还不够完整,所以没有正式名次。先看证据覆盖和不确定性,再用真实任务测试。
榜单多久更新一次
新的完整评分运行发布后,榜单会更新。页面顶部会显示当前运行日期和方法版本。LMSpeed 不保证固定的日更或周更时间。
