При поддержкеFusecodeКорпоративный API для Claude Code, Codex и модельных рабочих процессов.
LogoLMSpeed
  • Бесплатные
  • Модели
  • Провайдеры
  • Рейтинги
LogoLMSpeed
  1. Главная
  2. Рейтинг
  3. Best Model For Coding
LogoLMSpeed

Лучший инструмент для проверки скорости API

GitHubGitHubTwitterX (Twitter)Email
Продукт
  • Возможности
  • Цены
  • FAQ
Рейтинги
  • Обзор
  • Рейтинг скорости
  • Рейтинг задержки
  • Рейтинг стабильности
  • Цены моделей
  • Скорость моделей
  • Reasoning
  • Coding
Модели
  • Все модели
  • GPT
  • Claude
  • Gemini
  • DeepSeek
  • Llama
  • Qwen
Бесплатные модели
  • Все бесплатные модели
  • Бесплатный GPT
  • Бесплатный Claude
  • Бесплатный Gemini
  • Бесплатный DeepSeek
  • Бесплатный Llama
  • Бесплатный Qwen
Tools
  • Speed Test
  • Provider Audit
Компания
  • О нас
Ресурсы
  • Каталог провайдеров
  • Документация
  • Публичный API
  • Botab
  • VidBee
Правовая информация
  • Политика cookie
  • Политика конфиденциальности
  • Условия использования
© 2026 LMSpeed All Rights Reserved.Made by Nexmoe with ❤️
АгентыКодингРассуждениеЗнанияМатематикаМультиязычностьМультимодальностьСледование инструкциям

Рейтинг Category Score V3

LMSpeed Лучшие модели для программирования

Сравните AI-модели по генерации кода, работе с репозиториями, отладке, тестированию и разработке с инструментами во всех доступных бенчмарках.

Обновлено 9 августа 2026 г.·Методология 3.0·Методология

Текущий вывод

Среди доступных моделей самый высокий формальный ранг у Claude Opus 5. Глобальная позиция 1. Category Score равен 70.1, а 80% интервал неопределённости равен ±6.6. Формальный ранг получили 37 доступных моделей. Вывод относится только к этому запуску.

Открыть данные Claude Opus 5Рейтинг меняется вместе с данными и методикой. Дата запуска указана выше.

Доступные данные рейтинга

Показано моделей
100
Моделей с формальным рангом
37
Столбцов бенчмарков
16
Измерений со свидетельствами
4/4

Как читать полосы бенчмарков

Каждая полоса сравнивает модели только внутри одного столбца бенчмарка. Длина рассчитана относительно показанных моделей, не является Category Score и несопоставима между столбцами.

МестоМодельОценка LMSpeedГенерация кодаРабота с репозиториямиОтладка и тестированиеИнструментальная разработка и качествоСтатусПокрытиеОбновлено
SciCodeМоделей: 197LiveCodeBenchМоделей: 115AA-SciCodeМоделей: 5LiveCodeBench v6Моделей: 5LiveCodeBench ProМоделей: 4AA Coding IndexМоделей: 2SWE-bench ProМоделей: 45Vibe Code BenchМоделей: 34NL2RepoМоделей: 12React Native EvalsМоделей: 12SWE-bench VerifiedМоделей: 46SWE MultilingualМоделей: 20SWE-RebenchМоделей: 11Terminal-Bench 2.0Моделей: 31AA Terminal-Bench 2.1Моделей: 17Terminal-Bench HardМоделей: 12
Модели с формальным рейтингом37
1ClaudeClaude Opus 5Anthropic
70.1±6.6
50.7%—————79.2———96.089.5——89.1—RatedИзмерения: 4/4 · семейств: 59 авг. 2026 г.
2ClaudeClaude Fable 5Anthropic
68.1±6.9
60.2%—————80.0———95.0——84.384.662.9RatedИзмерения: 4/4 · семейств: 49 авг. 2026 г.
3ClaudeClaude Opus 4.8Anthropic
66±6.6
53.5%—————69.2———88.684.4—74.684.658.3RatedИзмерения: 4/4 · семейств: 59 авг. 2026 г.
4ClaudeClaude Opus 4.7 MaxAnthropic
61.2±6.9
——54.5———64.3———87.6——69.4——RatedИзмерения: 4/4 · семейств: 49 авг. 2026 г.
5OpenAIGPT-5.5OpenAI
60±8.7
53.5%—————58.669.8—84.7———82.0——RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
6ClaudeClaude Opus 4.6Anthropic
59.2±8.0
51.9%———70.7—53.457.6—84.180.8—65.3———RatedИзмерения: 3/4 · семейств: 79 авг. 2026 г.
7ClaudeClaude Sonnet 5Anthropic
59.1±6.6
48.6%—————63.2———85.278.3—80.480.5—RatedИзмерения: 4/4 · семейств: 59 авг. 2026 г.
8GrokGrok 4.5SpaceXAI
59±6.9
54.1%—————64.7————78.0—83.381.6—RatedИзмерения: 4/4 · семейств: 49 авг. 2026 г.
9OpenAIGPT-5.3 CodexOpenAI
58.7±8.5
53.2%—————56.861.8——85.0—58.2———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
10MoonshotAIKimi K2.6MoonshotAI
57.4±6.1
53.5%——89.6——58.637.9——80.276.7—66.7——RatedИзмерения: 4/4 · семейств: 79 авг. 2026 г.
11QwenQwen3.7 MaxQwen
57±6.0
48.8%91.6%————60.6—47.2—80.478.3—69.774.550.8RatedИзмерения: 4/4 · семейств: 79 авг. 2026 г.
12OpenAIGPT-5.2OpenAI
56.4±8.5
46.2%89.4%————55.653.5——80.0—————RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
13GeminiGemini 3.5 FlashGoogle
56.1±8.9
53.0%—————55.148.7—————76.2——RatedИзмерения: 3/4 · семейств: 49 авг. 2026 г.
14ClaudeClaude Sonnet 4.6Anthropic
56.1±8.6
44.1%——————51.5—80.679.6—60.7———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
15ClaudeClaude Opus 4.5Anthropic
56.1±8.1
49.5%87.1%—84.8——57.1—43.2—80.977.5————RatedИзмерения: 3/4 · семейств: 69 авг. 2026 г.
16ChatGLMGLM-5.2Z.ai
54.4±8.9
36.1%—————62.1—48.9————81.077.950.8RatedИзмерения: 3/4 · семейств: 49 авг. 2026 г.
17ChatGLMGLM-5.1Z.ai
54±8.8
36.1%—————58.431.542.7———62.7———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
18QwenQwen3.7 PlusQwen
53.2±6.0
45.5%89.6%————57.6—41.1—77.775.8—70.3——RatedИзмерения: 4/4 · семейств: 79 авг. 2026 г.
19Inkling SmallThinking Machines
53±6.9
48.7%—————55.9———80.2——64.7——RatedИзмерения: 4/4 · семейств: 49 авг. 2026 г.
20QwenQwen3.6 PlusQwen
52.3±8.2
40.7%——87.1——56.625.6——78.873.8————RatedИзмерения: 3/4 · семейств: 69 авг. 2026 г.
21QwenQwen3.6 Max PreviewQwen
52.2±8.9
46.9%—————57.3—42.9————65.4——RatedИзмерения: 3/4 · семейств: 49 авг. 2026 г.
22MinimaxMiniMax M3MiniMax
52.1±6.6
45.4%—————59.0—42.1—80.5——66.065.242.4RatedИзмерения: 4/4 · семейств: 59 авг. 2026 г.
23ChatGLMGLM-5Z.ai
51.6±8.1
38.3%—————55.123.4—74.877.873.362.8———RatedИзмерения: 3/4 · семейств: 79 авг. 2026 г.
24DeepSeekDeepSeek V3.2DeepSeek
51.3±8.6
44.0%89.6%—————5.1—71.5——60.9———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
25InklingThinking Machines
50.8±6.9
46.1%—————54.3———77.6——63.8——RatedИзмерения: 4/4 · семейств: 49 авг. 2026 г.
26DeepSeekDeepSeek V4 FlashDeepSeek
50.7±6.3
49.9%—————49.1—54.2—73.769.7—49.178.7—RatedИзмерения: 4/4 · семейств: 69 авг. 2026 г.
27MoonshotAIKimi K2.5MoonshotAI
48.5±7.8
49.0%——85.0——50.717.5—77.276.873.058.5———RatedИзмерения: 3/4 · семейств: 89 авг. 2026 г.
28DeepSeekDeepSeek V4 ProDeepSeek
48±6.3
42.4%—————52.149.9——73.669.8—59.164.046.2RatedИзмерения: 4/4 · семейств: 69 авг. 2026 г.
29MinimaxMiniMax M2.7MiniMax
47.5±8.2
47.0%—————56.227.039.871.4—76.551.9———RatedИзмерения: 3/4 · семейств: 79 авг. 2026 г.
30GrokGrok 4.20SpaceXAI
47.4±8.6
45.6%———74.2—51.84.1——76.7—————RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
31QwenQwen3.6 27BQwen
47.2±6.0
37.3%83.9%————53.5—36.2—77.271.3—59.3——RatedИзмерения: 4/4 · семейств: 79 авг. 2026 г.
32OpenAIgpt-oss-120bOpenAI
46.3±9.0
38.9%87.8%———————71.6—————23.5RatedИзмерения: 3/4 · семейств: 49 авг. 2026 г.
33QwenQwen3.5
39.9±9.0
2.8%——83.6——50.9———76.2—————RatedИзмерения: 3/4 · семейств: 49 авг. 2026 г.
34Laguna M 1Poolside
39.8±8.9
——————49.2———74.663.1—45.8——RatedИзмерения: 3/4 · семейств: 49 авг. 2026 г.
35GeminiGemini 2.5 ProGoogle
39.2±8.9
42.8%80.1%—————0.4——63.8—————RatedИзмерения: 3/4 · семейств: 49 авг. 2026 г.
36QwenQwen3.6 35B A3BQwen
38±6.0
1.3%80.4%————49.5—29.4—73.467.2—51.5——RatedИзмерения: 4/4 · семейств: 79 авг. 2026 г.
37Laguna Xs 2Poolside
34.4±8.9
——————46.3———69.957.7—35.7——RatedИзмерения: 3/4 · семейств: 49 авг. 2026 г.
Estimated-модели — без места49
—QwenQwen3.8 MaxQwen
67.3±11.2
52.9%—————67.7—55.9———————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—OpenAIGPT-5.6 SolOpenAI
63.2±9.3
56.0%—————64.6——————91.988.065.9EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—OpenAIGPT-5.4OpenAI
62.8±10.3
50.3%———87.5—57.767.4—85.3——————EstimatedИзмерения: 2/4 · семейств: 59 авг. 2026 г.
—ClaudeClaude Opus 4.7Anthropic
60.4±11.2
50.1%——————71.0—82.8——————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—OpenAIGPT-5.6 TerraOpenAI
60.2±9.3
50.1%—————63.4——————87.488.057.6EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—MoonshotAIKimi K3MoonshotAI
59.6±11.9
51.2%—————————————85.0—EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—GeminiGemini 3.1 ProGoogle
59.2±10.7
——58.9—82.9——32.0—78.9——————EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—OpenAIGPT-5.2 CodexOpenAI
58.3±11.8
54.6%——————37.9————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—SparkMuse Spark 1.1Meta
58.1±9.3
58.2%—————61.5——————80.077.9—EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—OpenAIGPT-5.4 MiniOpenAI
57.8±11.8
49.9%——————48.0————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—OpenAIGPT-5.6 LunaOpenAI
56.9±9.3
45.8%—————62.7——————84.780.9—EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—GeminiGemini 3 ProGoogle
55.8±11.2
56.1%91.7%—————14.3————————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—GeminiGemini 3.6 FlashGoogle
54.7±11.9
52.7%—————————————77.5—EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—GeminiGemini 3 FlashGoogle
53.9±11.2
49.9%79.7%—————20.2————————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—Laguna S 2.1Poolside
53.8±9.3
——————59.4————78.5—70.2——EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—MiMo-V2-Pro
53.6±11.8
42.5%—————————78.0—————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—ChatGLMGLM-4.7Z.ai
53.4±10.5
45.1%89.4%————————73.8—58.7———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—ClaudeClaude Sonnet 4.5Anthropic
52.1±11.2
42.8%59.0%————————77.2—————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—MiMo-V2-Flash
51.1±11.2
39.4%86.8%————————73.4—————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—MiMo-V2.5Xiaomi
50.9±9.3
43.1%—————56.1——————65.8——EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—OpenAIGPT-5.1 Codex MaxOpenAI
50.9±11.8
——40.2————22.2————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—OpenAIGPT-5.1 CodexOpenAI
50.6±11.2
40.2%84.9%—————13.1————————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—Ling-3.0-flashInclusionai
50.4±9.3
41.1%—————56.6————72.4————EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—MinimaxMiniMax M2.5MiniMax
50.3±11.8
42.6%——————14.9————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—MistralMistral Medium 3.5Mistral
49.7±9.4
39.6%—————————77.6————33.3EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—OpenAIGPT-5.4 NanoOpenAI
49.7±11.8
35.2%——————26.1————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—OpenAIGPT-5 MiniOpenAI
49.6±11.2
41.0%69.2%—————14.2————————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—StepfunStep 3.7 FlashStepFun
49.4±9.3
40.0%—————56.3——————59.5——EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—QwenQwen3.5-27BQwen
49.3±11.2
39.5%—————————72.4—58.9———EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—QwenQwen3.5-122B-A10BQwen
49.2±11.8
42.0%—————————72.0—————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—MiMo-V2-Omni
49.1±11.8
36.7%—————————74.8—————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—OpenAIGPT-5.1OpenAI
49.1±11.2
36.5%49.4%—————24.6————————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—MiMo-V2.5-ProXiaomi
49.1±9.3
39.1%—————57.2——————68.465.243.2EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—OpenAIGPT-5OpenAI
49±11.2
37.8%54.3%—————20.1————————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—OpenAIgpt-oss-20bOpenAI
48.1±11.2
34.4%77.7%———————71.0——————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—HunyuanHy3 previewTencent
48±9.3
39.4%—————————74.4——54.4——EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—GeminiGemini 3.5 Flash-LiteGoogle
47.9±9.3
40.9%—————54.2——————54.0——EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—ClaudeClaude Haiku 4.5Anthropic
46.8±11.2
34.4%51.1%————————73.3—————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—ClaudeClaude Sonnet 4Anthropic
46.7±11.2
37.3%44.9%————————72.7—————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—QwenQwen3 MaxQwen
45.1±11.2
38.3%76.7%—————3.5————————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—CohereCommand ACohere
42.7±11.4
37.8%28.7%—————————————25.0EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—QwenQwen3.5-35B-A3BQwen
42.3±11.2
37.7%—————————69.2—53.7———EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—ChatGLMGLM-4.6Z.ai
41.8±11.2
33.1%56.1%—————3.1————————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—OpenAIO3 MiniOpenAI
40.8±11.2
39.9%71.7%————————49.3—————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—GeminiGemini 3.1 Flash LiteGoogle
40.8±11.8
——41.9————0.0————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—OpenAIGPT-4.1 MiniOpenAI
39.3±11.2
40.4%48.3%————————23.6—————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—OpenAIGPT-4.1OpenAI
38.5±11.2
38.1%45.7%————————54.6—————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—DeepSeekDeepSeek V3
37.6±11.2
35.8%40.5%————————42.0—————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—ClaudeClaude 3.5 SonnetAnthropic
36.3±11.2
31.6%38.1%————————49.0—————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
Provisional-модели — без места14
—GeminiGemini 3.1 Pro PreviewGoogle
66.4±16.0
58.9%———————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—SparkMuse Spark 1.2Meta
64.6±16.0
56.4%———————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—GeminiGemini 3 Flash PreviewGoogle
63±13.9
50.6%90.8%——————————————ProvisionalИзмерения: 1/4 · семейств: 29 авг. 2026 г.
—GrokGrok Build 0 1SpaceXAI
60.2±16.0
50.2%———————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—OpenAIO4 MiniOpenAI
59.5±13.9
46.5%85.9%——————————————ProvisionalИзмерения: 1/4 · семейств: 29 авг. 2026 г.
—HunyuanHy3Tencent
58.4±16.0
47.6%———————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—MoonshotAIKimi K2.7 CodeMoonshotAI
58.3±16.0
47.5%———————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—MoonshotAIKimi K2 ThinkingMoonshotAI
57.4±13.9
42.4%85.3%——————————————ProvisionalИзмерения: 1/4 · семейств: 29 авг. 2026 г.
—OpenAIGPT-5.1 Codex MiniOpenAI
57.1±13.9
42.6%83.6%——————————————ProvisionalИзмерения: 1/4 · семейств: 29 авг. 2026 г.
—OpenAIGPT-5 CodexOpenAI
56.4±13.9
40.9%84.0%——————————————ProvisionalИзмерения: 1/4 · семейств: 29 авг. 2026 г.
—GrokGrok 4.3SpaceXAI
56.3±16.0
44.6%———————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—QwenQwen3 235B A22B Instruct 2507Qwen
56±13.9
42.4%78.8%——————————————ProvisionalИзмерения: 1/4 · семейств: 29 авг. 2026 г.
—OpenAIO3OpenAI
55.7±13.9
41.0%80.8%——————————————ProvisionalИзмерения: 1/4 · семейств: 29 авг. 2026 г.
—MinimaxMiniMax M2.1MiniMax
55.6±13.9
40.7%81.0%——————————————ProvisionalИзмерения: 1/4 · семейств: 29 авг. 2026 г.

Что измеряет этот рейтинг

Какая AI-модель лучше подходит для программирования?

Рейтинг охватывает генерацию кода, понимание репозитория, отладку, тесты и работу с инструментами. Одна задача на код не описывает всю программную разработку.

Доступные данные покрывают 4/4 измерений и показывают 16 столбцов бенчмарков.

Четыре измерения способности

Четыре измерения заданы схемой категории. Доступные данные могут покрывать только часть из них. Измерение без свидетельств не считается подтверждённой способностью.

Генерация кода

Сейчас это измерение поддерживают 6 столбцов бенчмарков.

  • SciCode
  • LiveCodeBench
  • AA-SciCode
  • LiveCodeBench v6
  • LiveCodeBench Pro
  • AA Coding Index

Работа с репозиториями

Сейчас это измерение поддерживают 4 столбцов бенчмарков.

  • SWE-bench Pro
  • Vibe Code Bench
  • NL2Repo
  • React Native Evals

Отладка и тестирование

Сейчас это измерение поддерживают 3 столбцов бенчмарков.

  • SWE-bench Verified
  • SWE Multilingual
  • SWE-Rebench

Инструментальная разработка и качество

Сейчас это измерение поддерживают 3 столбцов бенчмарков.

  • Terminal-Bench 2.0
  • AA Terminal-Bench 2.1
  • Terminal-Bench Hard

Задачи программирования для сравнения

  • Ежедневный код, включая функции, объяснения и небольшие возможности.
  • Изменения в нескольких файлах с пониманием структуры репозитория.
  • Агенты разработки, которые используют терминал, тесты и инструменты для кода.

Как выбрать модель по этому рейтингу

  1. Шаг 1

    Сначала проверьте статус

    Только Rated-модели получают место. Estimated и Provisional не имеют формальной позиции.

  2. Шаг 2

    Затем изучите интервал и свидетельства

    Если оценки близки, не смотрите только на место. Проверьте неопределённость, измерения и число бенчмарков.

  3. Шаг 3

    В конце проверьте реальную задачу

    Рейтинг не заменяет ваш тест. Вместе проверяйте качество, скорость, цену, контекст и ограничения провайдера.

Сначала выберите язык, размер репозитория и инструменты. Затем проверьте тесты, объём изменений, скорость и цену.

Что означают статусы

Rated

Rated означает, что правила по свидетельствам и пересечениям выполнены. Модель может получить формальный ранг.

Estimated

Estimated означает, что полезные свидетельства есть, но их недостаточно для формального ранга.

Provisional

Provisional означает мало свидетельств или недостаточное покрытие аспектов и семейств бенчмарков для статуса Estimated. Это только ранний сигнал.

Бенчмарки и источники свидетельств

Названия источников и группы бенчмарков взяты из доступных данных оценки. Один источник может дать несколько бенчмарков.

  • Artificial Analysis

    AA Coding Index, LiveCodeBench и SciCode

  • BenchLM

    AA Terminal-Bench 2.1, AA-SciCode, LiveCodeBench, LiveCodeBench Pro, LiveCodeBench v6, NL2Repo, React Native Evals, SWE Multilingual, SWE-bench Pro, SWE-bench Verified, SWE-Rebench, Terminal-Bench 2.0, Terminal-Bench Hard и Vibe Code Bench

Как строится рейтинг моделей для кодинга

LMSpeed объединяет подходящие сторонние бенчмарки в четырёх фиксированных измерениях. Rated-модели получают формальный ранг, а Estimated и Provisional остаются видимыми без позиции.

Подробнее о методологии Category Score

Ограничения рейтинга

Category Score использует сторонние бенчмарки, которые сейчас включены в LMSpeed. Тесты могут отличаться данными, запросами и правилами оценки. Результат не вечный и не описывает каждую реальную задачу. Важный выбор проверяйте на своих данных.

Частые вопросы

Какая доступная модель имеет самый высокий формальный ранг?

Среди доступных моделей самый высокий формальный ранг у Claude Opus 5. Глобальная позиция 1, а Category Score равен 70.1. Правила формального рейтинга выполняют 37 доступных моделей. Результат относится только к дате и версии методики на странице.

Можно ли сравнивать оценки разных категорий?

Нет. Каждая категория использует свои измерения и свидетельства. Category Score сравним только внутри одной таблицы. Для другой задачи откройте её категорию.

Полезны ли Estimated и Provisional модели?

Они помогают найти кандидатов, но свидетельств пока недостаточно для формального ранга. Сначала изучите покрытие и неопределённость, затем проверьте модель на реальной задаче.

Как часто обновляется рейтинг?

Рейтинг обновляется после публикации нового завершённого запуска. Дата и версия методики указаны выше. LMSpeed не обещает фиксированное ежедневное или еженедельное обновление.

Модель на первом месте всегда лучше для меня?

Нет. Результат также зависит от скорости, цены, длины контекста, инструментов, региона и ограничений провайдера. Сначала сократите список, затем проведите свой тест.

Чем рейтинг кодинга отличается от общего рассуждения?

Рейтинг кодинга сильнее учитывает код, репозитории, отладку и тесты. Оценка рассуждения полезна, но не заменяет запуск кода и реальные результаты тестов.