Рейтинг Category Score V3

LMSpeed Лучшие модели для программирования

Сравните AI-модели по генерации кода, работе с репозиториями, отладке, тестированию и разработке с инструментами во всех доступных бенчмарках.

Методология 3.0Методология

Текущий вывод

Среди доступных моделей самый высокий формальный ранг у Claude Opus 5. Глобальная позиция 1. Category Score равен 67.7, а 80% интервал неопределённости равен ±6.6. Формальный ранг получили 40 доступных моделей. Вывод относится только к этому запуску.

Открыть данные Claude Opus 5Рейтинг меняется вместе с данными и методикой. Дата запуска указана выше.

Доступные данные рейтинга

Показано моделей
100
Моделей с формальным рангом
40
Столбцов бенчмарков
16
Измерений со свидетельствами
4/4

Как читать полосы бенчмарков

Каждая полоса сравнивает модели только внутри одного столбца бенчмарка. Длина рассчитана относительно показанных моделей, не является Category Score и несопоставима между столбцами.

МестоМодельОценка LMSpeedГенерация кодаРабота с репозиториямиОтладка и тестированиеИнструментальная разработка и качествоСтатусПокрытиеОбновлено
SciCodeМоделей: undefinedLiveCodeBenchМоделей: undefinedAA-SciCodeМоделей: undefinedLiveCodeBench v6Моделей: undefinedLiveCodeBench ProМоделей: undefinedAA Coding IndexМоделей: undefinedSWE-bench ProМоделей: undefinedVibe Code BenchМоделей: undefinedNL2RepoМоделей: undefinedReact Native EvalsМоделей: undefinedSWE-bench VerifiedМоделей: undefinedSWE MultilingualМоделей: undefinedSWE-RebenchМоделей: undefinedTerminal-Bench 2.0Моделей: undefinedAA Terminal-Bench 2.1Моделей: undefinedTerminal-Bench HardМоделей: undefined
Модели с формальным рейтингом40
1Claude Opus 5Anthropic
67.7±6.6
50.7%79.296.089.589.1RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
2Claude Fable 5Anthropic
67.1±6.9
60.2%80.095.084.384.662.9RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
3Claude Opus 4.8Anthropic
65.2±6.6
53.5%69.288.684.474.6RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
4Claude Opus 4.7 MaxAnthropic
60.8±6.9
54.564.387.669.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
5GPT-5.5OpenAI
59.7±8.7
53.5%58.669.884.782.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
6Claude Sonnet 5Anthropic
59.6±6.6
48.6%63.285.278.380.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
7Grok 4.5SpaceXAI
59.5±6.9
54.1%64.778.083.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
8Claude Opus 4.6Anthropic
58.9±8.0
51.9%70.753.457.684.180.865.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
9GPT-5.3 CodexOpenAI
58.3±8.5
53.2%56.861.885.058.2RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
10DeepSeek V4 Pro 0813DeepSeek
57.1±6.1
49.255.449.961.580.676.267.978.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
11Qwen3.7 MaxQwen
57±6.0
48.8%91.6%60.647.280.478.369.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
12GPT-5.2OpenAI
56.2±8.5
46.2%89.4%55.653.580.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
13Claude Sonnet 4.6Anthropic
55.9±8.5
44.1%51.580.679.660.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
14Gemini 3.5 FlashGoogle
55.8±8.9
53.0%55.148.776.2RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
15Claude Opus 4.5Anthropic
55.7±8.1
49.5%87.1%84.857.143.280.977.5RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
16Kimi K2.6MoonshotAI
55.5±6.0
53.5%89.658.637.980.276.766.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
17GLM-5.2Z.ai
54.3±8.9
36.1%62.148.981.077.950.8RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
18GLM-5.1Z.ai
53.7±8.8
36.1%58.431.542.762.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
19DeepSeek V4 Flash 0731DeepSeek
52.9±6.3
49.952.654.279.073.356.9RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
20Qwen3.7 PlusQwen
52.9±6.0
45.5%89.6%57.641.177.775.870.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
21Inkling SmallThinking Machines
52.7±6.9
48.7%55.980.264.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
22MiniMax M3MiniMax
52.7±6.6
45.4%59.042.180.566.065.242.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
23Qwen3.6 Max PreviewQwen
51.6±8.9
46.9%57.342.965.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
24GLM-5Z.ai
51.5±8.1
38.3%55.123.474.877.873.362.8RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
25Qwen3.6 PlusQwen
51.3±8.2
40.7%87.156.625.678.873.8RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
26DeepSeek V3.2DeepSeek
51.2±8.6
44.0%89.6%5.171.560.9RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
27InklingThinking Machines
49.8±6.9
46.1%54.377.663.855.1RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
28Kimi K2.5MoonshotAI
48.4±7.8
49.0%85.050.717.577.276.873.058.5RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
29gpt-oss-120bOpenAI
47.8±9.1
38.9%87.8%71.623.5RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
30DeepSeek V4 ProDeepSeek
47.8±6.6
49.2%52.173.669.859.1RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
31MiniMax M2.7MiniMax
47.2±8.2
47.0%56.227.039.871.476.551.9RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
32Grok 4.20SpaceXAI
47.2±8.6
45.6%74.251.84.176.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
33Qwen3.6 27BQwen
46.9±6.0
37.3%83.9%53.536.277.271.359.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
34Muse Glimmer 30BMeta
46.6±6.9
43.651.276.051.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
35DeepSeek V4 FlashDeepSeek
45.9±6.6
49.9%49.173.769.749.1RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
36Qwen3.5
40.5±8.9
2.8%83.650.976.2RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
37Laguna M 1Poolside
39.4±8.9
49.274.663.145.8RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
38Gemini 2.5 ProGoogle
39.1±8.9
42.8%80.1%0.463.8RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
39Qwen3.6 35B A3BQwen
37.7±6.0
1.3%80.4%49.529.473.467.251.5RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
40Laguna Xs 2Poolside
34±8.9
46.369.957.735.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Estimated-модели — без места52
Qwen3.8 MaxQwen
66.1±11.2
52.9%67.755.9EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.4OpenAI
62.4±10.3
50.3%87.557.767.485.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.6 SolOpenAI
61.7±9.3
56.0%64.691.988.065.9EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.7Anthropic
60±11.2
50.1%71.082.8EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Muse Spark 1.1Meta
59±9.3
58.2%61.580.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.6 TerraOpenAI
58.9±9.3
50.1%63.487.488.057.6EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Grok 4.6SpaceXAI
58.7±11.9
51.6%88.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3.1 ProGoogle
58.7±10.7
58.982.932.078.9EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3.7 FlashGoogle
58.3±11.9
53.6%85.8EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.2 CodexOpenAI
57.8±11.8
54.6%37.9EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Muse Spark 1.2Meta
57.5±11.9
56.4%80.1EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.4 MiniOpenAI
57.5±11.8
49.9%48.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K3MoonshotAI
57.3±11.9
51.2%85.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.6 LunaOpenAI
56.7±9.3
45.8%62.784.780.9EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3.6 FlashGoogle
55.6±11.9
52.7%77.5EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3 ProGoogle
55.5±11.2
56.1%91.7%14.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Laguna S 2.1Poolside
54.1±9.3
59.478.570.2EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.8 27BQwen
54±10.6
35.6%90.361.742.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3 FlashGoogle
53.7±11.2
49.9%79.7%20.2EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiMo-V2-Pro
53.1±11.8
42.5%78.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-4.7Z.ai
53±10.5
45.1%89.4%73.858.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Sonnet 4.5Anthropic
51.8±11.2
42.8%59.0%77.2EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiMo-V2.5-ProXiaomi
50.9±9.3
39.1%57.268.443.2EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.1 Codex MaxOpenAI
50.8±11.8
40.222.2EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiMo-V2-Flash
50.8±11.2
39.4%86.8%73.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiMo-V2.5Xiaomi
50.7±9.3
43.1%56.165.8EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.1 CodexOpenAI
50.6±11.2
40.2%84.9%13.1EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiniMax M2.5MiniMax
50.2±11.8
42.6%14.9EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Ling-3.0-flashInclusionai
50.1±9.3
41.1%56.672.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.4 NanoOpenAI
49.7±11.8
35.2%26.1EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5 MiniOpenAI
49.5±11.2
41.0%69.2%14.2EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Step 3.7 FlashStepFun
49.2±9.3
40.0%56.359.5EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.1OpenAI
49.1±11.2
36.5%49.4%24.6EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Mistral Medium 3.5Mistral
49.1±9.3
39.6%77.650.633.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5OpenAI
49±11.2
37.8%54.3%20.1EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.5-27BQwen
48.9±11.2
39.5%72.458.9EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiMo-V2-Omni
48.8±11.8
36.7%74.8EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.5-122B-A10BQwen
48.7±11.8
42.0%72.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
gpt-oss-20bOpenAI
48±11.2
34.4%77.7%71.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Hy3 previewTencent
47.7±9.3
39.4%74.454.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3.5 Flash-LiteGoogle
47.2±9.3
40.9%54.254.053.6EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Haiku 4.5Anthropic
46.5±11.2
34.4%51.1%73.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Sonnet 4Anthropic
46.4±11.2
37.3%44.9%72.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3 MaxQwen
45.1±11.2
38.3%76.7%3.5EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Command ACohere
44.7±11.4
37.8%28.7%25.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.5-35B-A3BQwen
42±11.2
37.7%69.253.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-4.6Z.ai
41.9±11.2
33.1%56.1%3.1EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
O3 MiniOpenAI
40.5±11.2
39.9%71.7%49.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4.1 MiniOpenAI
39±11.2
40.4%48.3%23.6EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4.1OpenAI
38.3±11.2
38.1%45.7%54.6EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek V3
37.4±11.2
35.8%40.5%42.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude 3.5 SonnetAnthropic
36.2±11.2
31.6%38.1%49.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Provisional-модели — без места8
Gemini 3.1 Pro PreviewGoogle
64.9±16.0
58.9%ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM 5.3Z.ai
63.3±16.0
56.5%ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3 Flash PreviewGoogle
62.2±13.9
50.6%90.8%ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.8 2.4T A95BQwen
60.1±16.0
51.6%ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Grok Build 0 1SpaceXAI
59.1±16.0
50.2%ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
O4 MiniOpenAI
58.9±13.9
46.5%85.9%ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Hy3Tencent
57.4±16.0
47.6%ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K2.7 CodeMoonshotAI
57.4±16.0
47.5%ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.

Что измеряет этот рейтинг

Какая AI-модель лучше подходит для программирования?

Рейтинг охватывает генерацию кода, понимание репозитория, отладку, тесты и работу с инструментами. Одна задача на код не описывает всю программную разработку.

Доступные данные покрывают 4/4 измерений и показывают 16 столбцов бенчмарков.

Четыре измерения способности

Четыре измерения заданы схемой категории. Доступные данные могут покрывать только часть из них. Измерение без свидетельств не считается подтверждённой способностью.

Генерация кода

Сейчас это измерение поддерживают 6 столбцов бенчмарков.

  • SciCode
  • LiveCodeBench
  • AA-SciCode
  • LiveCodeBench v6
  • LiveCodeBench Pro
  • AA Coding Index

Работа с репозиториями

Сейчас это измерение поддерживают 4 столбцов бенчмарков.

  • SWE-bench Pro
  • Vibe Code Bench
  • NL2Repo
  • React Native Evals

Отладка и тестирование

Сейчас это измерение поддерживают 3 столбцов бенчмарков.

  • SWE-bench Verified
  • SWE Multilingual
  • SWE-Rebench

Инструментальная разработка и качество

Сейчас это измерение поддерживают 3 столбцов бенчмарков.

  • Terminal-Bench 2.0
  • AA Terminal-Bench 2.1
  • Terminal-Bench Hard

Задачи программирования для сравнения

  • Ежедневный код, включая функции, объяснения и небольшие возможности.
  • Изменения в нескольких файлах с пониманием структуры репозитория.
  • Агенты разработки, которые используют терминал, тесты и инструменты для кода.

Как выбрать модель по этому рейтингу

  1. Шаг 1

    Сначала проверьте статус

    Только Rated-модели получают место. Estimated и Provisional не имеют формальной позиции.

  2. Шаг 2

    Затем изучите интервал и свидетельства

    Если оценки близки, не смотрите только на место. Проверьте неопределённость, измерения и число бенчмарков.

  3. Шаг 3

    В конце проверьте реальную задачу

    Рейтинг не заменяет ваш тест. Вместе проверяйте качество, скорость, цену, контекст и ограничения провайдера.

Сначала выберите язык, размер репозитория и инструменты. Затем проверьте тесты, объём изменений, скорость и цену.

Что означают статусы

Rated

Rated означает, что правила по свидетельствам и пересечениям выполнены. Модель может получить формальный ранг.

Estimated

Estimated означает, что полезные свидетельства есть, но их недостаточно для формального ранга.

Provisional

Provisional означает мало свидетельств или недостаточное покрытие аспектов и семейств бенчмарков для статуса Estimated. Это только ранний сигнал.

Бенчмарки и источники свидетельств

Названия источников и группы бенчмарков взяты из доступных данных оценки. Один источник может дать несколько бенчмарков.

  • Artificial Analysis

    AA Coding Index, LiveCodeBench и SciCode

  • BenchLM

    AA Terminal-Bench 2.1, AA-SciCode, LiveCodeBench, LiveCodeBench Pro, LiveCodeBench v6, NL2Repo, React Native Evals, SWE Multilingual, SWE-bench Pro, SWE-bench Verified, SWE-Rebench, Terminal-Bench 2.0, Terminal-Bench Hard и Vibe Code Bench

Как строится рейтинг моделей для кодинга

LMSpeed объединяет подходящие сторонние бенчмарки в четырёх фиксированных измерениях. Rated-модели получают формальный ранг, а Estimated и Provisional остаются видимыми без позиции.

Подробнее о методологии Category Score

Ограничения рейтинга

Category Score использует сторонние бенчмарки, которые сейчас включены в LMSpeed. Тесты могут отличаться данными, запросами и правилами оценки. Результат не вечный и не описывает каждую реальную задачу. Важный выбор проверяйте на своих данных.

Частые вопросы

Какая доступная модель имеет самый высокий формальный ранг?

Среди доступных моделей самый высокий формальный ранг у Claude Opus 5. Глобальная позиция 1, а Category Score равен 67.7. Правила формального рейтинга выполняют 40 доступных моделей. Результат относится только к дате и версии методики на странице.

Можно ли сравнивать оценки разных категорий?

Нет. Каждая категория использует свои измерения и свидетельства. Category Score сравним только внутри одной таблицы. Для другой задачи откройте её категорию.

Полезны ли Estimated и Provisional модели?

Они помогают найти кандидатов, но свидетельств пока недостаточно для формального ранга. Сначала изучите покрытие и неопределённость, затем проверьте модель на реальной задаче.

Как часто обновляется рейтинг?

Рейтинг обновляется после публикации нового завершённого запуска. Дата и версия методики указаны выше. LMSpeed не обещает фиксированное ежедневное или еженедельное обновление.

Модель на первом месте всегда лучше для меня?

Нет. Результат также зависит от скорости, цены, длины контекста, инструментов, региона и ограничений провайдера. Сначала сократите список, затем проведите свой тест.

Чем рейтинг кодинга отличается от общего рассуждения?

Рейтинг кодинга сильнее учитывает код, репозитории, отладку и тесты. Оценка рассуждения полезна, но не заменяет запуск кода и реальные результаты тестов.