Рейтинг Category Score V3
LMSpeed Лучшие модели для программирования
Сравните AI-модели по генерации кода, работе с репозиториями, отладке, тестированию и разработке с инструментами во всех доступных бенчмарках.
Методология 3.0Методология
Текущий вывод
Среди доступных моделей самый высокий формальный ранг у Claude Opus 5. Глобальная позиция 1. Category Score равен 70.1, а 80% интервал неопределённости равен ±6.6. Формальный ранг получили 37 доступных моделей. Вывод относится только к этому запуску.
Доступные данные рейтинга
- Показано моделей
- 100
- Моделей с формальным рангом
- 37
- Столбцов бенчмарков
- 16
- Измерений со свидетельствами
- 4/4
Как читать полосы бенчмарков
Каждая полоса сравнивает модели только внутри одного столбца бенчмарка. Длина рассчитана относительно показанных моделей, не является Category Score и несопоставима между столбцами.
| Место | Модель | Оценка LMSpeed | Генерация кода | Работа с репозиториями | Отладка и тестирование | Инструментальная разработка и качество | Статус | Покрытие | Обновлено | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SciCodeМоделей: 197 | LiveCodeBenchМоделей: 115 | AA-SciCodeМоделей: 5 | LiveCodeBench v6Моделей: 5 | LiveCodeBench ProМоделей: 4 | AA Coding IndexМоделей: 2 | SWE-bench ProМоделей: 45 | Vibe Code BenchМоделей: 34 | NL2RepoМоделей: 12 | React Native EvalsМоделей: 12 | SWE-bench VerifiedМоделей: 46 | SWE MultilingualМоделей: 20 | SWE-RebenchМоделей: 11 | Terminal-Bench 2.0Моделей: 31 | AA Terminal-Bench 2.1Моделей: 17 | Terminal-Bench HardМоделей: 12 | ||||||
| Модели с формальным рейтингом37 | |||||||||||||||||||||
| 1 | Claude Opus 5Anthropic | 70.1±6.6 | 50.7% | — | — | — | — | — | 79.2 | — | — | — | 96.0 | 89.5 | — | — | 89.1 | — | Rated | Измерения: 4/4 · семейств: 5 | 9 авг. 2026 г. |
| 2 | Claude Fable 5Anthropic | 68.1±6.9 | 60.2% | — | — | — | — | — | 80.0 | — | — | — | 95.0 | — | — | 84.3 | 84.6 | 62.9 | Rated | Измерения: 4/4 · семейств: 4 | 9 авг. 2026 г. |
| 3 | Claude Opus 4.8Anthropic | 66±6.6 | 53.5% | — | — | — | — | — | 69.2 | — | — | — | 88.6 | 84.4 | — | 74.6 | 84.6 | 58.3 | Rated | Измерения: 4/4 · семейств: 5 | 9 авг. 2026 г. |
| 4 | Claude Opus 4.7 MaxAnthropic | 61.2±6.9 | — | — | 54.5 | — | — | — | 64.3 | — | — | — | 87.6 | — | — | 69.4 | — | — | Rated | Измерения: 4/4 · семейств: 4 | 9 авг. 2026 г. |
| 5 | GPT-5.5OpenAI | 60±8.7 | 53.5% | — | — | — | — | — | 58.6 | 69.8 | — | 84.7 | — | — | — | 82.0 | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 6 | Claude Opus 4.6Anthropic | 59.2±8.0 | 51.9% | — | — | — | 70.7 | — | 53.4 | 57.6 | — | 84.1 | 80.8 | — | 65.3 | — | — | — | Rated | Измерения: 3/4 · семейств: 7 | 9 авг. 2026 г. |
| 7 | Claude Sonnet 5Anthropic | 59.1±6.6 | 48.6% | — | — | — | — | — | 63.2 | — | — | — | 85.2 | 78.3 | — | 80.4 | 80.5 | — | Rated | Измерения: 4/4 · семейств: 5 | 9 авг. 2026 г. |
| 8 | Grok 4.5SpaceXAI | 59±6.9 | 54.1% | — | — | — | — | — | 64.7 | — | — | — | — | 78.0 | — | 83.3 | 81.6 | — | Rated | Измерения: 4/4 · семейств: 4 | 9 авг. 2026 г. |
| 9 | GPT-5.3 CodexOpenAI | 58.7±8.5 | 53.2% | — | — | — | — | — | 56.8 | 61.8 | — | — | 85.0 | — | 58.2 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 10 | Kimi K2.6MoonshotAI | 57.4±6.1 | 53.5% | — | — | 89.6 | — | — | 58.6 | 37.9 | — | — | 80.2 | 76.7 | — | 66.7 | — | — | Rated | Измерения: 4/4 · семейств: 7 | 9 авг. 2026 г. |
| 11 | Qwen3.7 MaxQwen | 57±6.0 | 48.8% | 91.6% | — | — | — | — | 60.6 | — | 47.2 | — | 80.4 | 78.3 | — | 69.7 | 74.5 | 50.8 | Rated | Измерения: 4/4 · семейств: 7 | 9 авг. 2026 г. |
| 12 | GPT-5.2OpenAI | 56.4±8.5 | 46.2% | 89.4% | — | — | — | — | 55.6 | 53.5 | — | — | 80.0 | — | — | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 13 | Gemini 3.5 FlashGoogle | 56.1±8.9 | 53.0% | — | — | — | — | — | 55.1 | 48.7 | — | — | — | — | — | 76.2 | — | — | Rated | Измерения: 3/4 · семейств: 4 | 9 авг. 2026 г. |
| 14 | Claude Sonnet 4.6Anthropic | 56.1±8.6 | 44.1% | — | — | — | — | — | — | 51.5 | — | 80.6 | 79.6 | — | 60.7 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 15 | Claude Opus 4.5Anthropic | 56.1±8.1 | 49.5% | 87.1% | — | 84.8 | — | — | 57.1 | — | 43.2 | — | 80.9 | 77.5 | — | — | — | — | Rated | Измерения: 3/4 · семейств: 6 | 9 авг. 2026 г. |
| 16 | GLM-5.2Z.ai | 54.4±8.9 | 36.1% | — | — | — | — | — | 62.1 | — | 48.9 | — | — | — | — | 81.0 | 77.9 | 50.8 | Rated | Измерения: 3/4 · семейств: 4 | 9 авг. 2026 г. |
| 17 | GLM-5.1Z.ai | 54±8.8 | 36.1% | — | — | — | — | — | 58.4 | 31.5 | 42.7 | — | — | — | 62.7 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 18 | Qwen3.7 PlusQwen | 53.2±6.0 | 45.5% | 89.6% | — | — | — | — | 57.6 | — | 41.1 | — | 77.7 | 75.8 | — | 70.3 | — | — | Rated | Измерения: 4/4 · семейств: 7 | 9 авг. 2026 г. |
| 19 | Inkling SmallThinking Machines | 53±6.9 | 48.7% | — | — | — | — | — | 55.9 | — | — | — | 80.2 | — | — | 64.7 | — | — | Rated | Измерения: 4/4 · семейств: 4 | 9 авг. 2026 г. |
| 20 | Qwen3.6 PlusQwen | 52.3±8.2 | 40.7% | — | — | 87.1 | — | — | 56.6 | 25.6 | — | — | 78.8 | 73.8 | — | — | — | — | Rated | Измерения: 3/4 · семейств: 6 | 9 авг. 2026 г. |
| 21 | Qwen3.6 Max PreviewQwen | 52.2±8.9 | 46.9% | — | — | — | — | — | 57.3 | — | 42.9 | — | — | — | — | 65.4 | — | — | Rated | Измерения: 3/4 · семейств: 4 | 9 авг. 2026 г. |
| 22 | MiniMax M3MiniMax | 52.1±6.6 | 45.4% | — | — | — | — | — | 59.0 | — | 42.1 | — | 80.5 | — | — | 66.0 | 65.2 | 42.4 | Rated | Измерения: 4/4 · семейств: 5 | 9 авг. 2026 г. |
| 23 | GLM-5Z.ai | 51.6±8.1 | 38.3% | — | — | — | — | — | 55.1 | 23.4 | — | 74.8 | 77.8 | 73.3 | 62.8 | — | — | — | Rated | Измерения: 3/4 · семейств: 7 | 9 авг. 2026 г. |
| 24 | DeepSeek V3.2DeepSeek | 51.3±8.6 | 44.0% | 89.6% | — | — | — | — | — | 5.1 | — | 71.5 | — | — | 60.9 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 25 | InklingThinking Machines | 50.8±6.9 | 46.1% | — | — | — | — | — | 54.3 | — | — | — | 77.6 | — | — | 63.8 | — | — | Rated | Измерения: 4/4 · семейств: 4 | 9 авг. 2026 г. |
| 26 | DeepSeek V4 FlashDeepSeek | 50.7±6.3 | 49.9% | — | — | — | — | — | 49.1 | — | 54.2 | — | 73.7 | 69.7 | — | 49.1 | 78.7 | — | Rated | Измерения: 4/4 · семейств: 6 | 9 авг. 2026 г. |
| 27 | Kimi K2.5MoonshotAI | 48.5±7.8 | 49.0% | — | — | 85.0 | — | — | 50.7 | 17.5 | — | 77.2 | 76.8 | 73.0 | 58.5 | — | — | — | Rated | Измерения: 3/4 · семейств: 8 | 9 авг. 2026 г. |
| 28 | DeepSeek V4 ProDeepSeek | 48±6.3 | 42.4% | — | — | — | — | — | 52.1 | 49.9 | — | — | 73.6 | 69.8 | — | 59.1 | 64.0 | 46.2 | Rated | Измерения: 4/4 · семейств: 6 | 9 авг. 2026 г. |
| 29 | MiniMax M2.7MiniMax | 47.5±8.2 | 47.0% | — | — | — | — | — | 56.2 | 27.0 | 39.8 | 71.4 | — | 76.5 | 51.9 | — | — | — | Rated | Измерения: 3/4 · семейств: 7 | 9 авг. 2026 г. |
| 30 | Grok 4.20SpaceXAI | 47.4±8.6 | 45.6% | — | — | — | 74.2 | — | 51.8 | 4.1 | — | — | 76.7 | — | — | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 31 | Qwen3.6 27BQwen | 47.2±6.0 | 37.3% | 83.9% | — | — | — | — | 53.5 | — | 36.2 | — | 77.2 | 71.3 | — | 59.3 | — | — | Rated | Измерения: 4/4 · семейств: 7 | 9 авг. 2026 г. |
| 32 | gpt-oss-120bOpenAI | 46.3±9.0 | 38.9% | 87.8% | — | — | — | — | — | — | — | 71.6 | — | — | — | — | — | 23.5 | Rated | Измерения: 3/4 · семейств: 4 | 9 авг. 2026 г. |
| 33 | Qwen3.5 | 39.9±9.0 | 2.8% | — | — | 83.6 | — | — | 50.9 | — | — | — | 76.2 | — | — | — | — | — | Rated | Измерения: 3/4 · семейств: 4 | 9 авг. 2026 г. |
| 34 | Laguna M 1Poolside | 39.8±8.9 | — | — | — | — | — | — | 49.2 | — | — | — | 74.6 | 63.1 | — | 45.8 | — | — | Rated | Измерения: 3/4 · семейств: 4 | 9 авг. 2026 г. |
| 35 | Gemini 2.5 ProGoogle | 39.2±8.9 | 42.8% | 80.1% | — | — | — | — | — | 0.4 | — | — | 63.8 | — | — | — | — | — | Rated | Измерения: 3/4 · семейств: 4 | 9 авг. 2026 г. |
| 36 | Qwen3.6 35B A3BQwen | 38±6.0 | 1.3% | 80.4% | — | — | — | — | 49.5 | — | 29.4 | — | 73.4 | 67.2 | — | 51.5 | — | — | Rated | Измерения: 4/4 · семейств: 7 | 9 авг. 2026 г. |
| 37 | Laguna Xs 2Poolside | 34.4±8.9 | — | — | — | — | — | — | 46.3 | — | — | — | 69.9 | 57.7 | — | 35.7 | — | — | Rated | Измерения: 3/4 · семейств: 4 | 9 авг. 2026 г. |
| Estimated-модели — без места49 | |||||||||||||||||||||
| — | Qwen3.8 MaxQwen | 67.3±11.2 | 52.9% | — | — | — | — | — | 67.7 | — | 55.9 | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | GPT-5.6 SolOpenAI | 63.2±9.3 | 56.0% | — | — | — | — | — | 64.6 | — | — | — | — | — | — | 91.9 | 88.0 | 65.9 | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | GPT-5.4OpenAI | 62.8±10.3 | 50.3% | — | — | — | 87.5 | — | 57.7 | 67.4 | — | 85.3 | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 5 | 9 авг. 2026 г. |
| — | Claude Opus 4.7Anthropic | 60.4±11.2 | 50.1% | — | — | — | — | — | — | 71.0 | — | 82.8 | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | GPT-5.6 TerraOpenAI | 60.2±9.3 | 50.1% | — | — | — | — | — | 63.4 | — | — | — | — | — | — | 87.4 | 88.0 | 57.6 | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Kimi K3MoonshotAI | 59.6±11.9 | 51.2% | — | — | — | — | — | — | — | — | — | — | — | — | — | 85.0 | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | Gemini 3.1 ProGoogle | 59.2±10.7 | — | — | 58.9 | — | 82.9 | — | — | 32.0 | — | 78.9 | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | GPT-5.2 CodexOpenAI | 58.3±11.8 | 54.6% | — | — | — | — | — | — | 37.9 | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | Muse Spark 1.1Meta | 58.1±9.3 | 58.2% | — | — | — | — | — | 61.5 | — | — | — | — | — | — | 80.0 | 77.9 | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | GPT-5.4 MiniOpenAI | 57.8±11.8 | 49.9% | — | — | — | — | — | — | 48.0 | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | GPT-5.6 LunaOpenAI | 56.9±9.3 | 45.8% | — | — | — | — | — | 62.7 | — | — | — | — | — | — | 84.7 | 80.9 | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Gemini 3 ProGoogle | 55.8±11.2 | 56.1% | 91.7% | — | — | — | — | — | 14.3 | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Gemini 3.6 FlashGoogle | 54.7±11.9 | 52.7% | — | — | — | — | — | — | — | — | — | — | — | — | — | 77.5 | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | Gemini 3 FlashGoogle | 53.9±11.2 | 49.9% | 79.7% | — | — | — | — | — | 20.2 | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Laguna S 2.1Poolside | 53.8±9.3 | — | — | — | — | — | — | 59.4 | — | — | — | — | 78.5 | — | 70.2 | — | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | MiMo-V2-Pro | 53.6±11.8 | 42.5% | — | — | — | — | — | — | — | — | — | 78.0 | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | GLM-4.7Z.ai | 53.4±10.5 | 45.1% | 89.4% | — | — | — | — | — | — | — | — | 73.8 | — | 58.7 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | Claude Sonnet 4.5Anthropic | 52.1±11.2 | 42.8% | 59.0% | — | — | — | — | — | — | — | — | 77.2 | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | MiMo-V2-Flash | 51.1±11.2 | 39.4% | 86.8% | — | — | — | — | — | — | — | — | 73.4 | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | MiMo-V2.5Xiaomi | 50.9±9.3 | 43.1% | — | — | — | — | — | 56.1 | — | — | — | — | — | — | 65.8 | — | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | GPT-5.1 Codex MaxOpenAI | 50.9±11.8 | — | — | 40.2 | — | — | — | — | 22.2 | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | GPT-5.1 CodexOpenAI | 50.6±11.2 | 40.2% | 84.9% | — | — | — | — | — | 13.1 | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Ling-3.0-flashInclusionai | 50.4±9.3 | 41.1% | — | — | — | — | — | 56.6 | — | — | — | — | 72.4 | — | — | — | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | MiniMax M2.5MiniMax | 50.3±11.8 | 42.6% | — | — | — | — | — | — | 14.9 | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | Mistral Medium 3.5Mistral | 49.7±9.4 | 39.6% | — | — | — | — | — | — | — | — | — | 77.6 | — | — | — | — | 33.3 | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | GPT-5.4 NanoOpenAI | 49.7±11.8 | 35.2% | — | — | — | — | — | — | 26.1 | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | GPT-5 MiniOpenAI | 49.6±11.2 | 41.0% | 69.2% | — | — | — | — | — | 14.2 | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Step 3.7 FlashStepFun | 49.4±9.3 | 40.0% | — | — | — | — | — | 56.3 | — | — | — | — | — | — | 59.5 | — | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Qwen3.5-27BQwen | 49.3±11.2 | 39.5% | — | — | — | — | — | — | — | — | — | 72.4 | — | 58.9 | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Qwen3.5-122B-A10BQwen | 49.2±11.8 | 42.0% | — | — | — | — | — | — | — | — | — | 72.0 | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | MiMo-V2-Omni | 49.1±11.8 | 36.7% | — | — | — | — | — | — | — | — | — | 74.8 | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | GPT-5.1OpenAI | 49.1±11.2 | 36.5% | 49.4% | — | — | — | — | — | 24.6 | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | MiMo-V2.5-ProXiaomi | 49.1±9.3 | 39.1% | — | — | — | — | — | 57.2 | — | — | — | — | — | — | 68.4 | 65.2 | 43.2 | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | GPT-5OpenAI | 49±11.2 | 37.8% | 54.3% | — | — | — | — | — | 20.1 | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | gpt-oss-20bOpenAI | 48.1±11.2 | 34.4% | 77.7% | — | — | — | — | — | — | — | 71.0 | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Hy3 previewTencent | 48±9.3 | 39.4% | — | — | — | — | — | — | — | — | — | 74.4 | — | — | 54.4 | — | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Gemini 3.5 Flash-LiteGoogle | 47.9±9.3 | 40.9% | — | — | — | — | — | 54.2 | — | — | — | — | — | — | 54.0 | — | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Claude Haiku 4.5Anthropic | 46.8±11.2 | 34.4% | 51.1% | — | — | — | — | — | — | — | — | 73.3 | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Claude Sonnet 4Anthropic | 46.7±11.2 | 37.3% | 44.9% | — | — | — | — | — | — | — | — | 72.7 | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Qwen3 MaxQwen | 45.1±11.2 | 38.3% | 76.7% | — | — | — | — | — | 3.5 | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Command ACohere | 42.7±11.4 | 37.8% | 28.7% | — | — | — | — | — | — | — | — | — | — | — | — | — | 25.0 | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Qwen3.5-35B-A3BQwen | 42.3±11.2 | 37.7% | — | — | — | — | — | — | — | — | — | 69.2 | — | 53.7 | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | GLM-4.6Z.ai | 41.8±11.2 | 33.1% | 56.1% | — | — | — | — | — | 3.1 | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | O3 MiniOpenAI | 40.8±11.2 | 39.9% | 71.7% | — | — | — | — | — | — | — | — | 49.3 | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Gemini 3.1 Flash LiteGoogle | 40.8±11.8 | — | — | 41.9 | — | — | — | — | 0.0 | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | GPT-4.1 MiniOpenAI | 39.3±11.2 | 40.4% | 48.3% | — | — | — | — | — | — | — | — | 23.6 | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | GPT-4.1OpenAI | 38.5±11.2 | 38.1% | 45.7% | — | — | — | — | — | — | — | — | 54.6 | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | DeepSeek V3 | 37.6±11.2 | 35.8% | 40.5% | — | — | — | — | — | — | — | — | 42.0 | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Claude 3.5 SonnetAnthropic | 36.3±11.2 | 31.6% | 38.1% | — | — | — | — | — | — | — | — | 49.0 | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| Provisional-модели — без места14 | |||||||||||||||||||||
| — | Gemini 3.1 Pro PreviewGoogle | 66.4±16.0 | 58.9% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | Muse Spark 1.2Meta | 64.6±16.0 | 56.4% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | Gemini 3 Flash PreviewGoogle | 63±13.9 | 50.6% | 90.8% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 2 | 9 авг. 2026 г. |
| — | Grok Build 0 1SpaceXAI | 60.2±16.0 | 50.2% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | O4 MiniOpenAI | 59.5±13.9 | 46.5% | 85.9% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 2 | 9 авг. 2026 г. |
| — | Hy3Tencent | 58.4±16.0 | 47.6% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | Kimi K2.7 CodeMoonshotAI | 58.3±16.0 | 47.5% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | Kimi K2 ThinkingMoonshotAI | 57.4±13.9 | 42.4% | 85.3% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 2 | 9 авг. 2026 г. |
| — | GPT-5.1 Codex MiniOpenAI | 57.1±13.9 | 42.6% | 83.6% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 2 | 9 авг. 2026 г. |
| — | GPT-5 CodexOpenAI | 56.4±13.9 | 40.9% | 84.0% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 2 | 9 авг. 2026 г. |
| — | Grok 4.3SpaceXAI | 56.3±16.0 | 44.6% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | Qwen3 235B A22B Instruct 2507Qwen | 56±13.9 | 42.4% | 78.8% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 2 | 9 авг. 2026 г. |
| — | O3OpenAI | 55.7±13.9 | 41.0% | 80.8% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 2 | 9 авг. 2026 г. |
| — | MiniMax M2.1MiniMax | 55.6±13.9 | 40.7% | 81.0% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 2 | 9 авг. 2026 г. |
Что измеряет этот рейтинг
Какая AI-модель лучше подходит для программирования?
Рейтинг охватывает генерацию кода, понимание репозитория, отладку, тесты и работу с инструментами. Одна задача на код не описывает всю программную разработку.
Четыре измерения способности
Четыре измерения заданы схемой категории. Доступные данные могут покрывать только часть из них. Измерение без свидетельств не считается подтверждённой способностью.
Генерация кода
Сейчас это измерение поддерживают 6 столбцов бенчмарков.
- SciCode
- LiveCodeBench
- AA-SciCode
- LiveCodeBench v6
- LiveCodeBench Pro
- AA Coding Index
Работа с репозиториями
Сейчас это измерение поддерживают 4 столбцов бенчмарков.
- SWE-bench Pro
- Vibe Code Bench
- NL2Repo
- React Native Evals
Отладка и тестирование
Сейчас это измерение поддерживают 3 столбцов бенчмарков.
- SWE-bench Verified
- SWE Multilingual
- SWE-Rebench
Инструментальная разработка и качество
Сейчас это измерение поддерживают 3 столбцов бенчмарков.
- Terminal-Bench 2.0
- AA Terminal-Bench 2.1
- Terminal-Bench Hard
Задачи программирования для сравнения
- Ежедневный код, включая функции, объяснения и небольшие возможности.
- Изменения в нескольких файлах с пониманием структуры репозитория.
- Агенты разработки, которые используют терминал, тесты и инструменты для кода.
Как выбрать модель по этому рейтингу
- Шаг 1
Сначала проверьте статус
Только Rated-модели получают место. Estimated и Provisional не имеют формальной позиции.
- Шаг 2
Затем изучите интервал и свидетельства
Если оценки близки, не смотрите только на место. Проверьте неопределённость, измерения и число бенчмарков.
- Шаг 3
В конце проверьте реальную задачу
Рейтинг не заменяет ваш тест. Вместе проверяйте качество, скорость, цену, контекст и ограничения провайдера.
Сначала выберите язык, размер репозитория и инструменты. Затем проверьте тесты, объём изменений, скорость и цену.
Что означают статусы
Rated
Rated означает, что правила по свидетельствам и пересечениям выполнены. Модель может получить формальный ранг.
Estimated
Estimated означает, что полезные свидетельства есть, но их недостаточно для формального ранга.
Provisional
Provisional означает мало свидетельств или недостаточное покрытие аспектов и семейств бенчмарков для статуса Estimated. Это только ранний сигнал.
Бенчмарки и источники свидетельств
Названия источников и группы бенчмарков взяты из доступных данных оценки. Один источник может дать несколько бенчмарков.
Artificial Analysis
AA Coding Index, LiveCodeBench и SciCode
BenchLM
AA Terminal-Bench 2.1, AA-SciCode, LiveCodeBench, LiveCodeBench Pro, LiveCodeBench v6, NL2Repo, React Native Evals, SWE Multilingual, SWE-bench Pro, SWE-bench Verified, SWE-Rebench, Terminal-Bench 2.0, Terminal-Bench Hard и Vibe Code Bench
Как строится рейтинг моделей для кодинга
LMSpeed объединяет подходящие сторонние бенчмарки в четырёх фиксированных измерениях. Rated-модели получают формальный ранг, а Estimated и Provisional остаются видимыми без позиции.
Подробнее о методологии Category ScoreОграничения рейтинга
Category Score использует сторонние бенчмарки, которые сейчас включены в LMSpeed. Тесты могут отличаться данными, запросами и правилами оценки. Результат не вечный и не описывает каждую реальную задачу. Важный выбор проверяйте на своих данных.
Частые вопросы
Какая доступная модель имеет самый высокий формальный ранг?
Среди доступных моделей самый высокий формальный ранг у Claude Opus 5. Глобальная позиция 1, а Category Score равен 70.1. Правила формального рейтинга выполняют 37 доступных моделей. Результат относится только к дате и версии методики на странице.
Можно ли сравнивать оценки разных категорий?
Нет. Каждая категория использует свои измерения и свидетельства. Category Score сравним только внутри одной таблицы. Для другой задачи откройте её категорию.
Полезны ли Estimated и Provisional модели?
Они помогают найти кандидатов, но свидетельств пока недостаточно для формального ранга. Сначала изучите покрытие и неопределённость, затем проверьте модель на реальной задаче.
Как часто обновляется рейтинг?
Рейтинг обновляется после публикации нового завершённого запуска. Дата и версия методики указаны выше. LMSpeed не обещает фиксированное ежедневное или еженедельное обновление.
Модель на первом месте всегда лучше для меня?
Нет. Результат также зависит от скорости, цены, длины контекста, инструментов, региона и ограничений провайдера. Сначала сократите список, затем проведите свой тест.
Чем рейтинг кодинга отличается от общего рассуждения?
Рейтинг кодинга сильнее учитывает код, репозитории, отладку и тесты. Оценка рассуждения полезна, но не заменяет запуск кода и реальные результаты тестов.
