分类分数 V3 排行榜

LMSpeed 最适合编程的 AI 模型

在同一张榜单中对比代码生成、仓库工程、调试测试和工具辅助开发等全部有效 Benchmark,查找最适合编程与软件工程的 AI 模型。

方法论 3.0查看方法论

当前结论

当前可见的正式排名中,Claude Opus 5 的名次最高。它的全局名次是第 1 位,分类分为 67.7,80% 不确定性范围为 ±6.6。共有 40 个可见模型获得正式名次。这只代表本次评分运行。

查看 Claude Opus 5 的详情排名会随新数据和方法更新。页面顶部显示本次运行日期。

当前可用榜单数据

收录模型
100
正式排名模型
40
Benchmark 列
16
已有证据的维度
4/4

如何阅读 Benchmark 进度条

每个进度条只用于比较同一 Benchmark 列中的模型,长度相对于当前榜单展示的模型计算;它不是分类分数,也不能跨 Benchmark 列比较。

排名模型LMSpeed 分类分代码生成仓库工程调试与测试工具化开发与质量评级证据覆盖更新时间
SciCodeundefined 个模型LiveCodeBenchundefined 个模型AA-SciCodeundefined 个模型LiveCodeBench v6undefined 个模型LiveCodeBench Proundefined 个模型AA Coding Indexundefined 个模型SWE-bench Proundefined 个模型Vibe Code Benchundefined 个模型NL2Repoundefined 个模型React Native Evalsundefined 个模型SWE-bench Verifiedundefined 个模型SWE Multilingualundefined 个模型SWE-Rebenchundefined 个模型Terminal-Bench 2.0undefined 个模型AA Terminal-Bench 2.1undefined 个模型Terminal-Bench Hardundefined 个模型
正式排名模型40
1Claude Opus 5Anthropic
67.7±6.6
50.7%79.296.089.589.1正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
2Claude Fable 5Anthropic
67.1±6.9
60.2%80.095.084.384.662.9正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
3Claude Opus 4.8Anthropic
65.2±6.6
53.5%69.288.684.474.6正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
4Claude Opus 4.7 MaxAnthropic
60.8±6.9
54.564.387.669.4正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
5GPT-5.5OpenAI
59.7±8.7
53.5%58.669.884.782.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
6Claude Sonnet 5Anthropic
59.6±6.6
48.6%63.285.278.380.4正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
7Grok 4.5SpaceXAI
59.5±6.9
54.1%64.778.083.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
8Claude Opus 4.6Anthropic
58.9±8.0
51.9%70.753.457.684.180.865.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
9GPT-5.3 CodexOpenAI
58.3±8.5
53.2%56.861.885.058.2正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
10DeepSeek V4 Pro 0813DeepSeek
57.1±6.1
49.255.449.961.580.676.267.978.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
11Qwen3.7 MaxQwen
57±6.0
48.8%91.6%60.647.280.478.369.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
12GPT-5.2OpenAI
56.2±8.5
46.2%89.4%55.653.580.0正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
13Claude Sonnet 4.6Anthropic
55.9±8.5
44.1%51.580.679.660.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
14Gemini 3.5 FlashGoogle
55.8±8.9
53.0%55.148.776.2正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
15Claude Opus 4.5Anthropic
55.7±8.1
49.5%87.1%84.857.143.280.977.5正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
16Kimi K2.6MoonshotAI
55.5±6.0
53.5%89.658.637.980.276.766.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
17GLM-5.2Z.ai
54.3±8.9
36.1%62.148.981.077.950.8正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
18GLM-5.1Z.ai
53.7±8.8
36.1%58.431.542.762.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
19DeepSeek V4 Flash 0731DeepSeek
52.9±6.3
49.952.654.279.073.356.9正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
20Qwen3.7 PlusQwen
52.9±6.0
45.5%89.6%57.641.177.775.870.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
21Inkling SmallThinking Machines
52.7±6.9
48.7%55.980.264.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
22MiniMax M3MiniMax
52.7±6.6
45.4%59.042.180.566.065.242.4正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
23Qwen3.6 Max PreviewQwen
51.6±8.9
46.9%57.342.965.4正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
24GLM-5Z.ai
51.5±8.1
38.3%55.123.474.877.873.362.8正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
25Qwen3.6 PlusQwen
51.3±8.2
40.7%87.156.625.678.873.8正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
26DeepSeek V3.2DeepSeek
51.2±8.6
44.0%89.6%5.171.560.9正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
27InklingThinking Machines
49.8±6.9
46.1%54.377.663.855.1正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
28Kimi K2.5MoonshotAI
48.4±7.8
49.0%85.050.717.577.276.873.058.5正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
29gpt-oss-120bOpenAI
47.8±9.1
38.9%87.8%71.623.5正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
30DeepSeek V4 ProDeepSeek
47.8±6.6
49.2%52.173.669.859.1正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
31MiniMax M2.7MiniMax
47.2±8.2
47.0%56.227.039.871.476.551.9正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
32Grok 4.20SpaceXAI
47.2±8.6
45.6%74.251.84.176.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
33Qwen3.6 27BQwen
46.9±6.0
37.3%83.9%53.536.277.271.359.3正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
34Muse Glimmer 30BMeta
46.6±6.9
43.651.276.051.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
35DeepSeek V4 FlashDeepSeek
45.9±6.6
49.9%49.173.769.749.1正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
36Qwen3.5
40.5±8.9
2.8%83.650.976.2正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
37Laguna M 1Poolside
39.4±8.9
49.274.663.145.8正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
38Gemini 2.5 ProGoogle
39.1±8.9
42.8%80.1%0.463.8正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
39Qwen3.6 35B A3BQwen
37.7±6.0
1.3%80.4%49.529.473.467.251.5正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
40Laguna Xs 2Poolside
34±8.9
46.369.957.735.7正式评级undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
估算模型(不排名)52
Qwen3.8 MaxQwen
66.1±11.2
52.9%67.755.9估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.4OpenAI
62.4±10.3
50.3%87.557.767.485.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.6 SolOpenAI
61.7±9.3
56.0%64.691.988.065.9估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Opus 4.7Anthropic
60±11.2
50.1%71.082.8估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Muse Spark 1.1Meta
59±9.3
58.2%61.580.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.6 TerraOpenAI
58.9±9.3
50.1%63.487.488.057.6估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Grok 4.6SpaceXAI
58.7±11.9
51.6%88.4估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3.1 ProGoogle
58.7±10.7
58.982.932.078.9估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3.7 FlashGoogle
58.3±11.9
53.6%85.8估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.2 CodexOpenAI
57.8±11.8
54.6%37.9估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Muse Spark 1.2Meta
57.5±11.9
56.4%80.1估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.4 MiniOpenAI
57.5±11.8
49.9%48.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Kimi K3MoonshotAI
57.3±11.9
51.2%85.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.6 LunaOpenAI
56.7±9.3
45.8%62.784.780.9估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3.6 FlashGoogle
55.6±11.9
52.7%77.5估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3 ProGoogle
55.5±11.2
56.1%91.7%14.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Laguna S 2.1Poolside
54.1±9.3
59.478.570.2估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.8 27BQwen
54±10.6
35.6%90.361.742.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3 FlashGoogle
53.7±11.2
49.9%79.7%20.2估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiMo-V2-Pro
53.1±11.8
42.5%78.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-4.7Z.ai
53±10.5
45.1%89.4%73.858.7估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Sonnet 4.5Anthropic
51.8±11.2
42.8%59.0%77.2估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiMo-V2.5-ProXiaomi
50.9±9.3
39.1%57.268.443.2估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.1 Codex MaxOpenAI
50.8±11.8
40.222.2估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiMo-V2-Flash
50.8±11.2
39.4%86.8%73.4估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiMo-V2.5Xiaomi
50.7±9.3
43.1%56.165.8估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.1 CodexOpenAI
50.6±11.2
40.2%84.9%13.1估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiniMax M2.5MiniMax
50.2±11.8
42.6%14.9估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Ling-3.0-flashInclusionai
50.1±9.3
41.1%56.672.4估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.4 NanoOpenAI
49.7±11.8
35.2%26.1估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5 MiniOpenAI
49.5±11.2
41.0%69.2%14.2估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Step 3.7 FlashStepFun
49.2±9.3
40.0%56.359.5估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5.1OpenAI
49.1±11.2
36.5%49.4%24.6估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Mistral Medium 3.5Mistral
49.1±9.3
39.6%77.650.633.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-5OpenAI
49±11.2
37.8%54.3%20.1估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.5-27BQwen
48.9±11.2
39.5%72.458.9估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
MiMo-V2-Omni
48.8±11.8
36.7%74.8估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.5-122B-A10BQwen
48.7±11.8
42.0%72.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
gpt-oss-20bOpenAI
48±11.2
34.4%77.7%71.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Hy3 previewTencent
47.7±9.3
39.4%74.454.4估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3.5 Flash-LiteGoogle
47.2±9.3
40.9%54.254.053.6估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Haiku 4.5Anthropic
46.5±11.2
34.4%51.1%73.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude Sonnet 4Anthropic
46.4±11.2
37.3%44.9%72.7估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3 MaxQwen
45.1±11.2
38.3%76.7%3.5估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Command ACohere
44.7±11.4
37.8%28.7%25.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.5-35B-A3BQwen
42±11.2
37.7%69.253.7估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM-4.6Z.ai
41.9±11.2
33.1%56.1%3.1估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
O3 MiniOpenAI
40.5±11.2
39.9%71.7%49.3估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4.1 MiniOpenAI
39±11.2
40.4%48.3%23.6估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GPT-4.1OpenAI
38.3±11.2
38.1%45.7%54.6估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
DeepSeek V3
37.4±11.2
35.8%40.5%42.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Claude 3.5 SonnetAnthropic
36.2±11.2
31.6%38.1%49.0估算undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
暂定模型(不排名)8
Gemini 3.1 Pro PreviewGoogle
64.9±16.0
58.9%暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
GLM 5.3Z.ai
63.3±16.0
56.5%暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Gemini 3 Flash PreviewGoogle
62.2±13.9
50.6%90.8%暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Qwen3.8 2.4T A95BQwen
60.1±16.0
51.6%暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Grok Build 0 1SpaceXAI
59.1±16.0
50.2%暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
O4 MiniOpenAI
58.9±13.9
46.5%85.9%暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Hy3Tencent
57.4±16.0
47.6%暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日
Kimi K2.7 CodeMoonshotAI
57.4±16.0
47.5%暂定undefined/4 个维度 · undefined 个 Benchmark family2026年8月28日

这个榜单衡量什么

哪个 AI 模型更适合编程

这类榜单关注代码生成、仓库理解、调试测试和工具化开发。单个代码题不能代表完整的软件工程能力。

当前可用数据覆盖 4/4 个维度,并展示 16 个 Benchmark 列。

四个能力维度

四个维度来自分类蓝图。当前可用数据可能只覆盖其中一部分。没有证据的维度不会被写成已验证能力。

代码生成

当前有 6 个 Benchmark 列提供这个维度的证据。

  • SciCode
  • LiveCodeBench
  • AA-SciCode
  • LiveCodeBench v6
  • LiveCodeBench Pro
  • AA Coding Index

仓库工程

当前有 4 个 Benchmark 列提供这个维度的证据。

  • SWE-bench Pro
  • Vibe Code Bench
  • NL2Repo
  • React Native Evals

调试与测试

当前有 3 个 Benchmark 列提供这个维度的证据。

  • SWE-bench Verified
  • SWE Multilingual
  • SWE-Rebench

工具化开发与质量

当前有 3 个 Benchmark 列提供这个维度的证据。

  • Terminal-Bench 2.0
  • AA Terminal-Bench 2.1
  • Terminal-Bench Hard

适合参考的编程任务

  • 日常写代码。它包括补全函数、解释代码和生成小型功能。
  • 跨文件仓库改动。模型需要理解已有结构,并控制修改范围。
  • 自动化编程 Agent。模型需要使用终端、测试和代码工具完成任务。

如何用这张榜单选择模型

  1. 第 1 步

    先确认评级状态

    只有正式评级模型才有名次。估算和暂定模型没有正式名次。

  2. 第 2 步

    再看评分区间和证据

    分数接近时,不要只看名次。还要查看不确定性、维度覆盖和 Benchmark 数量。

  3. 第 3 步

    最后用真实任务测试

    榜单不能替代你的测试。请同时检查质量、速度、价格、上下文和供应商限制。

先按语言、仓库规模和工具链筛选。还要检查测试通过率、修改范围、速度和成本。

评级状态说明

正式评级

正式评级表示证据和重叠条件已满足。模型可以进入排名。

估算

估算表示已有部分证据,但还不满足正式排名条件。

暂定

暂定表示证据较少,或维度与 Benchmark family 覆盖还不满足估算条件。结果只适合早期观察。

Benchmark 与证据来源

证据来源名称和 Benchmark 分组来自当前可用评分数据。一个来源可以提供多个 Benchmark。

  • Artificial Analysis

    AA Coding Index、LiveCodeBench和SciCode

  • BenchLM

    AA Terminal-Bench 2.1、AA-SciCode、LiveCodeBench、LiveCodeBench Pro、LiveCodeBench v6、NL2Repo、React Native Evals、SWE Multilingual、SWE-bench Pro、SWE-bench Verified、SWE-Rebench、Terminal-Bench 2.0、Terminal-Bench Hard和Vibe Code Bench

Coding 模型排行榜如何生成

LMSpeed 将合格的第三方 Benchmark 先归入四个固定能力维度。Rated 模型满足正式排名所需的证据覆盖与重叠校准要求;Estimated 与 Provisional 模型继续展示,但不授予名次。

阅读分类分数方法论

榜单限制

分类分来自当前收录的第三方 Benchmark。不同测试可能使用不同数据、提示和评分规则。榜单不代表永久结论,也不能代表每个真实任务。重要选择仍要用自己的数据和流程测试。

常见问题

当前可见模型中谁的正式名次最高

当前可见模型中,Claude Opus 5 的正式名次最高。它的全局名次是第 1 位,分类分为 67.7。共有 40 个可见模型满足正式排名条件。这个结果只适用于页面所示的评分日期和方法版本。

不同分类的分数可以直接比较吗

不可以。每个分类使用不同的能力维度和证据。分类分只适合在同一张榜单内比较。需要比较不同任务时,请分别查看对应分类。

估算和暂定模型值得看吗

可以把它们当成候选模型。它们的证据还不够完整,所以没有正式名次。先看证据覆盖和不确定性,再用真实任务测试。

榜单多久更新一次

新的完整评分运行发布后,榜单会更新。页面顶部会显示当前运行日期和方法版本。LMSpeed 不保证固定的日更或周更时间。

排名第一就是最适合我的模型吗

不一定。你的任务还会受到速度、价格、上下文长度、工具支持、地区和供应商限制影响。榜单用于缩小范围,不能替代真实测试。

编程排名和通用推理排名有什么不同

编程榜更重视代码生成、仓库理解、调试和测试。推理榜能说明部分思考能力,但不能替代真实代码执行和测试结果。