赞助推荐Fusecode面向 Claude Code、Codex 与模型工作流的企业级编程 API 服务。
LogoLM Speed
  • 免费 API
  • 模型
  • 提供商
  • 排行榜
LogoLM Speed
  1. 首页
  2. 排行榜
  3. Best Model For Coding
LogoLMSpeed

专业的 LLM API 速度测试工具

GitHubGitHubTwitterX (Twitter)Email
产品
  • 功能
  • 价格
  • 常见问题
排行榜
  • 总览
  • 速度排行
  • 延迟排行
  • 健康度排行
  • 模型价格
  • 模型速度
  • 推理能力
  • 代码能力
模型
  • 全部模型
  • GPT
  • Claude
  • Gemini
  • DeepSeek
  • Llama
  • Qwen
免费模型
  • 全部免费模型
  • 免费 GPT
  • 免费 Claude
  • 免费 Gemini
  • 免费 DeepSeek
  • 免费 Llama
  • 免费 Qwen
工具
  • 速度测试
  • 服务商审计
公司
  • 关于我们
资源
  • 服务商目录
  • 文档
  • 公共 API
  • Botab
  • VidBee
法律
  • Cookie政策
  • 隐私政策
  • 服务条款
© 2026 LM Speed All Rights Reserved.Made by Nexmoe with ❤️
AgentCodingReasoningKnowledgeMathMultilingualMultimodal指令遵循

分类分数 V3 排行榜

LMSpeed 最适合编程的 AI 模型

在同一张榜单中对比代码生成、仓库工程、调试测试和工具辅助开发等全部有效 Benchmark,查找最适合编程与软件工程的 AI 模型。

更新于 2026年8月9日·方法论 3.0·查看方法论

当前结论

当前可见的正式排名中,Claude Opus 5 的名次最高。它的全局名次是第 1 位,分类分为 70.1,80% 不确定性范围为 ±6.6。共有 37 个可见模型获得正式名次。这只代表本次评分运行。

查看 Claude Opus 5 的详情排名会随新数据和方法更新。页面顶部显示本次运行日期。

当前可用榜单数据

收录模型
100
正式排名模型
37
Benchmark 列
16
已有证据的维度
4/4

如何阅读 Benchmark 进度条

每个进度条只用于比较同一 Benchmark 列中的模型,长度相对于当前榜单展示的模型计算;它不是分类分数,也不能跨 Benchmark 列比较。

排名模型LMSpeed 分类分代码生成仓库工程调试与测试工具化开发与质量评级证据覆盖更新时间
SciCode197 个模型LiveCodeBench115 个模型AA-SciCode5 个模型LiveCodeBench v65 个模型LiveCodeBench Pro4 个模型AA Coding Index2 个模型SWE-bench Pro45 个模型Vibe Code Bench34 个模型NL2Repo12 个模型React Native Evals12 个模型SWE-bench Verified46 个模型SWE Multilingual20 个模型SWE-Rebench11 个模型Terminal-Bench 2.031 个模型AA Terminal-Bench 2.117 个模型Terminal-Bench Hard12 个模型
正式排名模型37
1ClaudeClaude Opus 5Anthropic
70.1±6.6
50.7%—————79.2———96.089.5——89.1—正式评级4/4 个维度 · 5 个 Benchmark family2026年8月9日
2ClaudeClaude Fable 5Anthropic
68.1±6.9
60.2%—————80.0———95.0——84.384.662.9正式评级4/4 个维度 · 4 个 Benchmark family2026年8月9日
3ClaudeClaude Opus 4.8Anthropic
66±6.6
53.5%—————69.2———88.684.4—74.684.658.3正式评级4/4 个维度 · 5 个 Benchmark family2026年8月9日
4ClaudeClaude Opus 4.7 MaxAnthropic
61.2±6.9
——54.5———64.3———87.6——69.4——正式评级4/4 个维度 · 4 个 Benchmark family2026年8月9日
5OpenAIGPT-5.5OpenAI
60±8.7
53.5%—————58.669.8—84.7———82.0——正式评级3/4 个维度 · 5 个 Benchmark family2026年8月9日
6ClaudeClaude Opus 4.6Anthropic
59.2±8.0
51.9%———70.7—53.457.6—84.180.8—65.3———正式评级3/4 个维度 · 7 个 Benchmark family2026年8月9日
7ClaudeClaude Sonnet 5Anthropic
59.1±6.6
48.6%—————63.2———85.278.3—80.480.5—正式评级4/4 个维度 · 5 个 Benchmark family2026年8月9日
8GrokGrok 4.5SpaceXAI
59±6.9
54.1%—————64.7————78.0—83.381.6—正式评级4/4 个维度 · 4 个 Benchmark family2026年8月9日
9OpenAIGPT-5.3 CodexOpenAI
58.7±8.5
53.2%—————56.861.8——85.0—58.2———正式评级3/4 个维度 · 5 个 Benchmark family2026年8月9日
10MoonshotAIKimi K2.6MoonshotAI
57.4±6.1
53.5%——89.6——58.637.9——80.276.7—66.7——正式评级4/4 个维度 · 7 个 Benchmark family2026年8月9日
11QwenQwen3.7 MaxQwen
57±6.0
48.8%91.6%————60.6—47.2—80.478.3—69.774.550.8正式评级4/4 个维度 · 7 个 Benchmark family2026年8月9日
12OpenAIGPT-5.2OpenAI
56.4±8.5
46.2%89.4%————55.653.5——80.0—————正式评级3/4 个维度 · 5 个 Benchmark family2026年8月9日
13GeminiGemini 3.5 FlashGoogle
56.1±8.9
53.0%—————55.148.7—————76.2——正式评级3/4 个维度 · 4 个 Benchmark family2026年8月9日
14ClaudeClaude Sonnet 4.6Anthropic
56.1±8.6
44.1%——————51.5—80.679.6—60.7———正式评级3/4 个维度 · 5 个 Benchmark family2026年8月9日
15ClaudeClaude Opus 4.5Anthropic
56.1±8.1
49.5%87.1%—84.8——57.1—43.2—80.977.5————正式评级3/4 个维度 · 6 个 Benchmark family2026年8月9日
16ChatGLMGLM-5.2Z.ai
54.4±8.9
36.1%—————62.1—48.9————81.077.950.8正式评级3/4 个维度 · 4 个 Benchmark family2026年8月9日
17ChatGLMGLM-5.1Z.ai
54±8.8
36.1%—————58.431.542.7———62.7———正式评级3/4 个维度 · 5 个 Benchmark family2026年8月9日
18QwenQwen3.7 PlusQwen
53.2±6.0
45.5%89.6%————57.6—41.1—77.775.8—70.3——正式评级4/4 个维度 · 7 个 Benchmark family2026年8月9日
19Inkling SmallThinking Machines
53±6.9
48.7%—————55.9———80.2——64.7——正式评级4/4 个维度 · 4 个 Benchmark family2026年8月9日
20QwenQwen3.6 PlusQwen
52.3±8.2
40.7%——87.1——56.625.6——78.873.8————正式评级3/4 个维度 · 6 个 Benchmark family2026年8月9日
21QwenQwen3.6 Max PreviewQwen
52.2±8.9
46.9%—————57.3—42.9————65.4——正式评级3/4 个维度 · 4 个 Benchmark family2026年8月9日
22MinimaxMiniMax M3MiniMax
52.1±6.6
45.4%—————59.0—42.1—80.5——66.065.242.4正式评级4/4 个维度 · 5 个 Benchmark family2026年8月9日
23ChatGLMGLM-5Z.ai
51.6±8.1
38.3%—————55.123.4—74.877.873.362.8———正式评级3/4 个维度 · 7 个 Benchmark family2026年8月9日
24DeepSeekDeepSeek V3.2DeepSeek
51.3±8.6
44.0%89.6%—————5.1—71.5——60.9———正式评级3/4 个维度 · 5 个 Benchmark family2026年8月9日
25InklingThinking Machines
50.8±6.9
46.1%—————54.3———77.6——63.8——正式评级4/4 个维度 · 4 个 Benchmark family2026年8月9日
26DeepSeekDeepSeek V4 FlashDeepSeek
50.7±6.3
49.9%—————49.1—54.2—73.769.7—49.178.7—正式评级4/4 个维度 · 6 个 Benchmark family2026年8月9日
27MoonshotAIKimi K2.5MoonshotAI
48.5±7.8
49.0%——85.0——50.717.5—77.276.873.058.5———正式评级3/4 个维度 · 8 个 Benchmark family2026年8月9日
28DeepSeekDeepSeek V4 ProDeepSeek
48±6.3
42.4%—————52.149.9——73.669.8—59.164.046.2正式评级4/4 个维度 · 6 个 Benchmark family2026年8月9日
29MinimaxMiniMax M2.7MiniMax
47.5±8.2
47.0%—————56.227.039.871.4—76.551.9———正式评级3/4 个维度 · 7 个 Benchmark family2026年8月9日
30GrokGrok 4.20SpaceXAI
47.4±8.6
45.6%———74.2—51.84.1——76.7—————正式评级3/4 个维度 · 5 个 Benchmark family2026年8月9日
31QwenQwen3.6 27BQwen
47.2±6.0
37.3%83.9%————53.5—36.2—77.271.3—59.3——正式评级4/4 个维度 · 7 个 Benchmark family2026年8月9日
32OpenAIgpt-oss-120bOpenAI
46.3±9.0
38.9%87.8%———————71.6—————23.5正式评级3/4 个维度 · 4 个 Benchmark family2026年8月9日
33QwenQwen3.5
39.9±9.0
2.8%——83.6——50.9———76.2—————正式评级3/4 个维度 · 4 个 Benchmark family2026年8月9日
34Laguna M 1Poolside
39.8±8.9
——————49.2———74.663.1—45.8——正式评级3/4 个维度 · 4 个 Benchmark family2026年8月9日
35GeminiGemini 2.5 ProGoogle
39.2±8.9
42.8%80.1%—————0.4——63.8—————正式评级3/4 个维度 · 4 个 Benchmark family2026年8月9日
36QwenQwen3.6 35B A3BQwen
38±6.0
1.3%80.4%————49.5—29.4—73.467.2—51.5——正式评级4/4 个维度 · 7 个 Benchmark family2026年8月9日
37Laguna Xs 2Poolside
34.4±8.9
——————46.3———69.957.7—35.7——正式评级3/4 个维度 · 4 个 Benchmark family2026年8月9日
估算模型(不排名)49
—QwenQwen3.8 MaxQwen
67.3±11.2
52.9%—————67.7—55.9———————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—OpenAIGPT-5.6 SolOpenAI
63.2±9.3
56.0%—————64.6——————91.988.065.9估算3/4 个维度 · 3 个 Benchmark family2026年8月9日
—OpenAIGPT-5.4OpenAI
62.8±10.3
50.3%———87.5—57.767.4—85.3——————估算2/4 个维度 · 5 个 Benchmark family2026年8月9日
—ClaudeClaude Opus 4.7Anthropic
60.4±11.2
50.1%——————71.0—82.8——————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—OpenAIGPT-5.6 TerraOpenAI
60.2±9.3
50.1%—————63.4——————87.488.057.6估算3/4 个维度 · 3 个 Benchmark family2026年8月9日
—MoonshotAIKimi K3MoonshotAI
59.6±11.9
51.2%—————————————85.0—估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—GeminiGemini 3.1 ProGoogle
59.2±10.7
——58.9—82.9——32.0—78.9——————估算2/4 个维度 · 4 个 Benchmark family2026年8月9日
—OpenAIGPT-5.2 CodexOpenAI
58.3±11.8
54.6%——————37.9————————估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—SparkMuse Spark 1.1Meta
58.1±9.3
58.2%—————61.5——————80.077.9—估算3/4 个维度 · 3 个 Benchmark family2026年8月9日
—OpenAIGPT-5.4 MiniOpenAI
57.8±11.8
49.9%——————48.0————————估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—OpenAIGPT-5.6 LunaOpenAI
56.9±9.3
45.8%—————62.7——————84.780.9—估算3/4 个维度 · 3 个 Benchmark family2026年8月9日
—GeminiGemini 3 ProGoogle
55.8±11.2
56.1%91.7%—————14.3————————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—GeminiGemini 3.6 FlashGoogle
54.7±11.9
52.7%—————————————77.5—估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—GeminiGemini 3 FlashGoogle
53.9±11.2
49.9%79.7%—————20.2————————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—Laguna S 2.1Poolside
53.8±9.3
——————59.4————78.5—70.2——估算3/4 个维度 · 3 个 Benchmark family2026年8月9日
—MiMo-V2-Pro
53.6±11.8
42.5%—————————78.0—————估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—ChatGLMGLM-4.7Z.ai
53.4±10.5
45.1%89.4%————————73.8—58.7———估算2/4 个维度 · 4 个 Benchmark family2026年8月9日
—ClaudeClaude Sonnet 4.5Anthropic
52.1±11.2
42.8%59.0%————————77.2—————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—MiMo-V2-Flash
51.1±11.2
39.4%86.8%————————73.4—————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—MiMo-V2.5Xiaomi
50.9±9.3
43.1%—————56.1——————65.8——估算3/4 个维度 · 3 个 Benchmark family2026年8月9日
—OpenAIGPT-5.1 Codex MaxOpenAI
50.9±11.8
——40.2————22.2————————估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—OpenAIGPT-5.1 CodexOpenAI
50.6±11.2
40.2%84.9%—————13.1————————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—Ling-3.0-flashInclusionai
50.4±9.3
41.1%—————56.6————72.4————估算3/4 个维度 · 3 个 Benchmark family2026年8月9日
—MinimaxMiniMax M2.5MiniMax
50.3±11.8
42.6%——————14.9————————估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—MistralMistral Medium 3.5Mistral
49.7±9.4
39.6%—————————77.6————33.3估算3/4 个维度 · 3 个 Benchmark family2026年8月9日
—OpenAIGPT-5.4 NanoOpenAI
49.7±11.8
35.2%——————26.1————————估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—OpenAIGPT-5 MiniOpenAI
49.6±11.2
41.0%69.2%—————14.2————————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—StepfunStep 3.7 FlashStepFun
49.4±9.3
40.0%—————56.3——————59.5——估算3/4 个维度 · 3 个 Benchmark family2026年8月9日
—QwenQwen3.5-27BQwen
49.3±11.2
39.5%—————————72.4—58.9———估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—QwenQwen3.5-122B-A10BQwen
49.2±11.8
42.0%—————————72.0—————估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—MiMo-V2-Omni
49.1±11.8
36.7%—————————74.8—————估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—OpenAIGPT-5.1OpenAI
49.1±11.2
36.5%49.4%—————24.6————————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—MiMo-V2.5-ProXiaomi
49.1±9.3
39.1%—————57.2——————68.465.243.2估算3/4 个维度 · 3 个 Benchmark family2026年8月9日
—OpenAIGPT-5OpenAI
49±11.2
37.8%54.3%—————20.1————————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—OpenAIgpt-oss-20bOpenAI
48.1±11.2
34.4%77.7%———————71.0——————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—HunyuanHy3 previewTencent
48±9.3
39.4%—————————74.4——54.4——估算3/4 个维度 · 3 个 Benchmark family2026年8月9日
—GeminiGemini 3.5 Flash-LiteGoogle
47.9±9.3
40.9%—————54.2——————54.0——估算3/4 个维度 · 3 个 Benchmark family2026年8月9日
—ClaudeClaude Haiku 4.5Anthropic
46.8±11.2
34.4%51.1%————————73.3—————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—ClaudeClaude Sonnet 4Anthropic
46.7±11.2
37.3%44.9%————————72.7—————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—QwenQwen3 MaxQwen
45.1±11.2
38.3%76.7%—————3.5————————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—CohereCommand ACohere
42.7±11.4
37.8%28.7%—————————————25.0估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—QwenQwen3.5-35B-A3BQwen
42.3±11.2
37.7%—————————69.2—53.7———估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—ChatGLMGLM-4.6Z.ai
41.8±11.2
33.1%56.1%—————3.1————————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—OpenAIO3 MiniOpenAI
40.8±11.2
39.9%71.7%————————49.3—————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—GeminiGemini 3.1 Flash LiteGoogle
40.8±11.8
——41.9————0.0————————估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—OpenAIGPT-4.1 MiniOpenAI
39.3±11.2
40.4%48.3%————————23.6—————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—OpenAIGPT-4.1OpenAI
38.5±11.2
38.1%45.7%————————54.6—————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—DeepSeekDeepSeek V3
37.6±11.2
35.8%40.5%————————42.0—————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—ClaudeClaude 3.5 SonnetAnthropic
36.3±11.2
31.6%38.1%————————49.0—————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
暂定模型(不排名)14
—GeminiGemini 3.1 Pro PreviewGoogle
66.4±16.0
58.9%———————————————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—SparkMuse Spark 1.2Meta
64.6±16.0
56.4%———————————————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—GeminiGemini 3 Flash PreviewGoogle
63±13.9
50.6%90.8%——————————————暂定1/4 个维度 · 2 个 Benchmark family2026年8月9日
—GrokGrok Build 0 1SpaceXAI
60.2±16.0
50.2%———————————————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—OpenAIO4 MiniOpenAI
59.5±13.9
46.5%85.9%——————————————暂定1/4 个维度 · 2 个 Benchmark family2026年8月9日
—HunyuanHy3Tencent
58.4±16.0
47.6%———————————————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—MoonshotAIKimi K2.7 CodeMoonshotAI
58.3±16.0
47.5%———————————————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—MoonshotAIKimi K2 ThinkingMoonshotAI
57.4±13.9
42.4%85.3%——————————————暂定1/4 个维度 · 2 个 Benchmark family2026年8月9日
—OpenAIGPT-5.1 Codex MiniOpenAI
57.1±13.9
42.6%83.6%——————————————暂定1/4 个维度 · 2 个 Benchmark family2026年8月9日
—OpenAIGPT-5 CodexOpenAI
56.4±13.9
40.9%84.0%——————————————暂定1/4 个维度 · 2 个 Benchmark family2026年8月9日
—GrokGrok 4.3SpaceXAI
56.3±16.0
44.6%———————————————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—QwenQwen3 235B A22B Instruct 2507Qwen
56±13.9
42.4%78.8%——————————————暂定1/4 个维度 · 2 个 Benchmark family2026年8月9日
—OpenAIO3OpenAI
55.7±13.9
41.0%80.8%——————————————暂定1/4 个维度 · 2 个 Benchmark family2026年8月9日
—MinimaxMiniMax M2.1MiniMax
55.6±13.9
40.7%81.0%——————————————暂定1/4 个维度 · 2 个 Benchmark family2026年8月9日

这个榜单衡量什么

哪个 AI 模型更适合编程

这类榜单关注代码生成、仓库理解、调试测试和工具化开发。单个代码题不能代表完整的软件工程能力。

当前可用数据覆盖 4/4 个维度,并展示 16 个 Benchmark 列。

四个能力维度

四个维度来自分类蓝图。当前可用数据可能只覆盖其中一部分。没有证据的维度不会被写成已验证能力。

代码生成

当前有 6 个 Benchmark 列提供这个维度的证据。

  • SciCode
  • LiveCodeBench
  • AA-SciCode
  • LiveCodeBench v6
  • LiveCodeBench Pro
  • AA Coding Index

仓库工程

当前有 4 个 Benchmark 列提供这个维度的证据。

  • SWE-bench Pro
  • Vibe Code Bench
  • NL2Repo
  • React Native Evals

调试与测试

当前有 3 个 Benchmark 列提供这个维度的证据。

  • SWE-bench Verified
  • SWE Multilingual
  • SWE-Rebench

工具化开发与质量

当前有 3 个 Benchmark 列提供这个维度的证据。

  • Terminal-Bench 2.0
  • AA Terminal-Bench 2.1
  • Terminal-Bench Hard

适合参考的编程任务

  • 日常写代码。它包括补全函数、解释代码和生成小型功能。
  • 跨文件仓库改动。模型需要理解已有结构,并控制修改范围。
  • 自动化编程 Agent。模型需要使用终端、测试和代码工具完成任务。

如何用这张榜单选择模型

  1. 第 1 步

    先确认评级状态

    只有正式评级模型才有名次。估算和暂定模型没有正式名次。

  2. 第 2 步

    再看评分区间和证据

    分数接近时,不要只看名次。还要查看不确定性、维度覆盖和 Benchmark 数量。

  3. 第 3 步

    最后用真实任务测试

    榜单不能替代你的测试。请同时检查质量、速度、价格、上下文和供应商限制。

先按语言、仓库规模和工具链筛选。还要检查测试通过率、修改范围、速度和成本。

评级状态说明

正式评级

正式评级表示证据和重叠条件已满足。模型可以进入排名。

估算

估算表示已有部分证据,但还不满足正式排名条件。

暂定

暂定表示证据较少,或维度与 Benchmark family 覆盖还不满足估算条件。结果只适合早期观察。

Benchmark 与证据来源

证据来源名称和 Benchmark 分组来自当前可用评分数据。一个来源可以提供多个 Benchmark。

  • Artificial Analysis

    AA Coding Index、LiveCodeBench和SciCode

  • BenchLM

    AA Terminal-Bench 2.1、AA-SciCode、LiveCodeBench、LiveCodeBench Pro、LiveCodeBench v6、NL2Repo、React Native Evals、SWE Multilingual、SWE-bench Pro、SWE-bench Verified、SWE-Rebench、Terminal-Bench 2.0、Terminal-Bench Hard和Vibe Code Bench

Coding 模型排行榜如何生成

LMSpeed 将合格的第三方 Benchmark 先归入四个固定能力维度。Rated 模型满足正式排名所需的证据覆盖与重叠校准要求;Estimated 与 Provisional 模型继续展示,但不授予名次。

阅读分类分数方法论

榜单限制

分类分来自当前收录的第三方 Benchmark。不同测试可能使用不同数据、提示和评分规则。榜单不代表永久结论,也不能代表每个真实任务。重要选择仍要用自己的数据和流程测试。

常见问题

当前可见模型中谁的正式名次最高

当前可见模型中,Claude Opus 5 的正式名次最高。它的全局名次是第 1 位,分类分为 70.1。共有 37 个可见模型满足正式排名条件。这个结果只适用于页面所示的评分日期和方法版本。

不同分类的分数可以直接比较吗

不可以。每个分类使用不同的能力维度和证据。分类分只适合在同一张榜单内比较。需要比较不同任务时,请分别查看对应分类。

估算和暂定模型值得看吗

可以把它们当成候选模型。它们的证据还不够完整,所以没有正式名次。先看证据覆盖和不确定性,再用真实任务测试。

榜单多久更新一次

新的完整评分运行发布后,榜单会更新。页面顶部会显示当前运行日期和方法版本。LMSpeed 不保证固定的日更或周更时间。

排名第一就是最适合我的模型吗

不一定。你的任务还会受到速度、价格、上下文长度、工具支持、地区和供应商限制影响。榜单用于缩小范围,不能替代真实测试。

编程排名和通用推理排名有什么不同

编程榜更重视代码生成、仓库理解、调试和测试。推理榜能说明部分思考能力,但不能替代真实代码执行和测试结果。