Рейтинг Category Score V3
LMSpeed Лучшие модели для AI-агентов
Сравните лучшие модели для AI-агентов по планированию, инструментам, выполнению задач в среде и восстановлению. Формальный рейтинг следует правилам Category Score V3.
Методология 3.0Методология
Текущий вывод
Среди доступных моделей самый высокий формальный ранг у Kimi K3. Глобальная позиция 1. Category Score равен 68.9, а 80% интервал неопределённости равен ±7.3. Формальный ранг получили 55 доступных моделей. Вывод относится только к этому запуску.
Доступные данные рейтинга
- Показано моделей
- 100
- Моделей с формальным рангом
- 55
- Столбцов бенчмарков
- 26
- Измерений со свидетельствами
- 4/4
Как читать полосы бенчмарков
Каждая полоса сравнивает модели только внутри одного столбца бенчмарка. Длина рассчитана относительно показанных моделей, не является Category Score и несопоставима между столбцами.
| Место | Модель | Оценка LMSpeed | Планирование и декомпозиция | Использование инструментов | Среда и длительное выполнение | Восстановление и надёжность завершения | Статус | Покрытие | Обновлено | ||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Gert LabsМоделей: 50 | DeepPlanningМоделей: 1 | τ²-bench resultsМоделей: 84 | MCP AtlasМоделей: 28 | ToolathlonМоделей: 22 | AA Tau3 BankingМоделей: 17 | τ³-bench resultsМоделей: 9 | MCP-TasksМоделей: 5 | GDPval-AAМоделей: 63 | Terminal-Bench 2.0Моделей: 51 | BrowseCompМоделей: 29 | OSWorld-VerifiedМоделей: 25 | AA EnterpriseOps-GymМоделей: 17 | OSWorld 2.0Моделей: 14 | AA ITBenchМоделей: 11 | DeepSearchQAМоделей: 11 | VITA-BenchМоделей: 9 | WideResearchМоделей: 9 | Claw-EvalМоделей: 28 | APEX-Agents-AAМоделей: 24 | JobBenchМоделей: 22 | ResearchClawBenchМоделей: 19 | AA BriefcaseМоделей: 17 | AA Harvey LABМоделей: 16 | CyberGymМоделей: 13 | ExploitGymМоделей: 6 | ||||||
| Модели с формальным рейтингом55 | |||||||||||||||||||||||||||||||
| 1 | Kimi K3MoonshotAI | 68.9±7.3 | — | — | — | 84.2 | — | 33.4 | — | — | 1687.0 | 88.3 | 91.2 | — | 45.3 | — | 47.7 | 95.0 | — | — | — | 41.3 | 52.9 | — | 1542.0 | 94.6 | — | — | Rated | Измерения: 3/4 · семейств: 12 | 9 авг. 2026 г. |
| 2 | GPT-5.6 SolOpenAI | 68.2±7.3 | — | — | 85.1 | — | 58.0 | 33.0 | — | — | 1735.0 | 91.9 | 92.2 | — | 42.9 | 62.6 | 56.2 | — | — | — | — | — | — | — | 1504.0 | 87.2 | 84.5 | 33.7 | Rated | Измерения: 3/4 · семейств: 12 | 9 авг. 2026 г. |
| 3 | Claude Opus 5Anthropic | 67.5±8.2 | — | — | — | 85.8 | — | 30.3 | — | — | 1862.0 | — | 90.8 | — | 47.5 | 70.6 | — | 95.0 | — | — | — | — | — | — | 1720.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 8 | 9 авг. 2026 г. |
| 4 | Claude Fable 5Anthropic | 65.7±8.2 | — | — | 98.5 | — | — | 26.8 | — | — | 1747.0 | 84.3 | — | 85.0 | 51.1 | — | — | — | — | — | — | — | — | — | 1574.0 | 93.6 | — | — | Rated | Измерения: 3/4 · семейств: 7 | 9 авг. 2026 г. |
| 5 | GPT-5.6 TerraOpenAI | 63.9±7.4 | — | — | 86.3 | — | 53.1 | 31.8 | — | — | 1583.0 | 87.4 | 87.5 | — | — | 50.2 | 51.0 | — | — | — | — | 38.9 | — | — | — | 85.2 | 81.8 | 23.2 | Rated | Измерения: 3/4 · семейств: 11 | 9 авг. 2026 г. |
| 6 | Claude Opus 4.8Anthropic | 63.2±5.3 | 73.0 | — | 94.4 | 82.2 | 59.9 | 27.6 | — | — | 1593.0 | 74.6 | 84.3 | 83.4 | 44.0 | 20.6 | — | 93.1 | — | — | — | — | — | 21.1 | 1345.0 | 91.1 | — | — | Rated | Измерения: 4/4 · семейств: 13 | 9 авг. 2026 г. |
| 7 | GPT-5.5OpenAI | 62.7±5.1 | 72.9 | — | 98.0 | 75.3 | 55.6 | — | — | — | 1490.0 | 82.0 | 84.4 | 78.7 | 46.6 | 13.0 | 45.8 | — | — | — | — | 37.7 | 42.7 | 17.0 | — | — | 81.8 | 13.4 | Rated | Измерения: 4/4 · семейств: 15 | 9 авг. 2026 г. |
| 8 | Grok 4.5SpaceXAI | 61.9±8.4 | — | — | — | — | — | 32.6 | — | — | 1527.0 | 83.3 | — | — | 40.8 | — | — | — | — | — | — | — | — | — | 1315.0 | 92.4 | — | — | Rated | Измерения: 3/4 · семейств: 6 | 9 авг. 2026 г. |
| 9 | Gemini 3.5 FlashGoogle | 61.1±5.6 | 61.9 | — | 95.3 | 83.6 | 56.5 | — | — | — | 1345.0 | 76.2 | — | 78.4 | 50.1 | — | — | — | — | — | — | 47.1 | — | 18.0 | — | — | — | — | Rated | Измерения: 4/4 · семейств: 10 | 9 авг. 2026 г. |
| 10 | GLM-5.2Z.ai | 60.5±7.2 | — | — | 99.1 | 76.8 | 48.2 | 26.8 | — | — | 1510.0 | 81.0 | — | — | 42.7 | — | 42.7 | — | — | — | — | 33.7 | — | 20.7 | 1253.0 | 91.0 | — | — | Rated | Измерения: 3/4 · семейств: 11 | 9 авг. 2026 г. |
| 11 | Muse Spark 1.1Meta | 60.4±7.1 | — | — | — | 88.1 | 75.6 | 25.2 | — | — | 1375.0 | 80.0 | — | 80.8 | 47.2 | 14.2 | — | 84.9 | — | — | — | — | 54.7 | — | 868.0 | 93.1 | 59.0 | 0.8 | Rated | Измерения: 3/4 · семейств: 13 | 9 авг. 2026 г. |
| 12 | GPT-5.6 LunaOpenAI | 59.8±7.4 | — | — | — | — | 53.4 | 27.2 | — | — | 1582.0 | 84.7 | 83.3 | — | — | 45.6 | 40.3 | — | — | — | — | 35.8 | — | — | — | 87.9 | 77.9 | 12.4 | Rated | Измерения: 3/4 · семейств: 11 | 9 авг. 2026 г. |
| 13 | Claude Sonnet 5Anthropic | 59.8±8.2 | — | — | — | — | — | 28.2 | — | — | 1603.0 | 80.4 | 84.7 | 81.2 | 44.7 | — | — | — | — | — | — | — | — | — | 1385.0 | 90.1 | — | — | Rated | Измерения: 3/4 · семейств: 8 | 9 авг. 2026 г. |
| 14 | Claude Opus 4.7 MaxAnthropic | 58±7.7 | — | — | 88.6 | 77.3 | — | — | — | — | 1491.0 | 69.4 | 79.3 | 78.0 | — | 18.2 | 46.7 | — | — | — | — | — | 45.9 | — | — | — | 73.1 | — | Rated | Измерения: 3/4 · семейств: 9 | 9 авг. 2026 г. |
| 15 | GPT-5.4OpenAI | 57.7±5.1 | 64.9 | — | 98.9 | 70.6 | 54.6 | — | — | — | 1391.0 | 75.1 | 82.7 | 75.0 | — | — | — | 73.6 | — | — | 60.3 | 33.3 | 38.9 | 15.3 | — | — | 79.0 | 6.0 | Rated | Измерения: 4/4 · семейств: 15 | 9 авг. 2026 г. |
| 16 | Qwen3.7 MaxQwen | 56.9±5.4 | 64.3 | — | 94.7 | 76.4 | — | — | — | — | 1270.0 | 69.7 | — | — | 45.0 | — | 42.5 | — | 47.9 | — | 65.2 | — | — | 18.7 | 914.0 | 83.4 | — | — | Rated | Измерения: 4/4 · семейств: 12 | 9 авг. 2026 г. |
| 17 | MiniMax M3MiniMax | 56.2±7.3 | — | — | 88.9 | 74.2 | — | — | — | — | 1390.0 | 66.0 | 83.5 | 70.1 | 32.1 | 4.6 | — | — | — | — | 74.5 | — | — | 19.8 | 1108.0 | 88.4 | — | — | Rated | Измерения: 3/4 · семейств: 11 | 9 авг. 2026 г. |
| 18 | Qwen3.6 27BQwen | 56.1±6.6 | 54.8 | — | 94.2 | — | — | — | — | — | 1138.0 | 59.3 | — | — | — | — | — | — | — | — | 72.4 | — | — | — | — | — | — | — | Rated | Измерения: 4/4 · семейств: 5 | 9 авг. 2026 г. |
| 19 | Kimi K2.6MoonshotAI | 55.5±5.3 | 56.8 | — | 95.9 | 55.9 | 50.0 | — | — | — | 1188.0 | 66.7 | 83.2 | 73.1 | — | 4.6 | — | 92.5 | — | 80.8 | 62.3 | 28.5 | — | 18.0 | — | — | — | — | Rated | Измерения: 4/4 · семейств: 13 | 9 авг. 2026 г. |
| 20 | Claude Opus 4.6Anthropic | 55.4±5.7 | 61.9 | — | 84.8 | — | — | — | — | — | — | 65.4 | 83.7 | 72.7 | — | — | — | 73.7 | — | — | 70.4 | 33.0 | 36.7 | 19.9 | — | — | 66.6 | — | Rated | Измерения: 4/4 · семейств: 11 | 9 авг. 2026 г. |
| 21 | Claude Opus 4.7Anthropic | 54.9±6.9 | 65.6 | — | 74.0 | — | — | — | — | — | — | — | — | — | — | 13.9 | — | — | — | — | — | — | — | 20.7 | — | — | — | — | Rated | Измерения: 4/4 · семейств: 4 | 9 авг. 2026 г. |
| 22 | Step 3.7 FlashStepFun | 54.1±5.7 | 51.6 | — | 98.5 | — | 49.5 | — | — | — | 1017.0 | 59.5 | 75.8 | — | — | — | — | 92.8 | — | — | 67.1 | 14.8 | — | — | — | — | — | — | Rated | Измерения: 4/4 · семейств: 9 | 9 авг. 2026 г. |
| 23 | Qwen3.7 PlusQwen | 54±5.7 | — | 62.3 | 93.0 | 73.2 | — | — | — | — | 943.0 | 70.3 | — | 73.3 | — | 2.8 | — | — | 45.6 | — | 62.7 | 22.4 | — | — | — | — | — | — | Rated | Измерения: 4/4 · семейств: 9 | 9 авг. 2026 г. |
| 24 | GLM-5.1Z.ai | 53.9±5.7 | 60.1 | — | 97.7 | 71.8 | — | — | 70.6 | — | 1256.0 | 63.5 | 68.0 | — | — | — | — | — | — | — | 62.3 | — | — | 18.2 | — | — | 68.7 | — | Rated | Измерения: 4/4 · семейств: 9 | 9 авг. 2026 г. |
| 25 | Claude Sonnet 4.6Anthropic | 53.2±6.1 | 62.9 | — | 79.5 | — | — | — | — | — | — | 59.1 | — | 72.1 | — | 8.3 | — | — | — | — | 67.8 | — | 36.9 | — | — | — | 65.2 | — | Rated | Измерения: 4/4 · семейств: 7 | 9 авг. 2026 г. |
| 26 | Gemini 3.6 FlashGoogle | 53±9.0 | — | — | — | — | — | 24.5 | — | — | 1423.0 | — | — | 83.0 | — | — | — | — | — | — | — | — | — | — | 962.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 4 | 9 авг. 2026 г. |
| 27 | GPT-5.3 CodexOpenAI | 53±6.6 | 57.5 | — | 86.0 | — | — | — | — | — | — | 77.3 | — | 64.7 | — | — | — | — | — | — | — | — | 33.7 | — | — | — | — | — | Rated | Измерения: 4/4 · семейств: 5 | 9 авг. 2026 г. |
| 28 | GPT-5.4 MiniOpenAI | 51.8±8.1 | — | — | 93.4 | 57.7 | 42.9 | — | — | — | 1170.0 | 60.0 | — | 72.1 | — | — | — | — | — | — | — | 28.2 | — | — | — | — | — | — | Rated | Измерения: 3/4 · семейств: 7 | 9 авг. 2026 г. |
| 29 | DeepSeek V4 ProDeepSeek | 51.4±5.1 | 50.3 | — | 94.2 | 69.4 | 46.3 | 25.8 | — | — | 1293.0 | 59.1 | 80.4 | — | 40.4 | — | 38.3 | — | — | — | 59.8 | 24.3 | — | 17.1 | 931.0 | 84.4 | — | — | Rated | Измерения: 4/4 · семейств: 14 | 9 авг. 2026 г. |
| 30 | MiMo-V2.5-ProXiaomi | 51.1±5.9 | 62.7 | — | 94.2 | — | — | — | 72.9 | — | 1265.0 | 68.4 | — | — | — | — | 38.2 | — | — | — | 63.8 | 2.4 | — | — | 879.0 | 73.3 | — | — | Rated | Измерения: 4/4 · семейств: 9 | 9 авг. 2026 г. |
| 31 | MiMo-V2.5Xiaomi | 50.8±8.9 | 46.9 | — | — | — | — | — | — | — | — | 65.8 | — | — | — | — | — | — | — | — | 62.3 | — | — | 16.9 | — | — | — | — | Rated | Измерения: 3/4 · семейств: 4 | 9 авг. 2026 г. |
| 32 | Gemini 3.1 ProGoogle | 50.6±6.2 | 56.9 | — | 95.6 | — | — | — | — | — | 965.0 | — | — | — | — | — | — | 69.7 | — | — | 57.8 | 32.0 | — | 13.3 | — | — | — | — | Rated | Измерения: 4/4 · семейств: 7 | 9 авг. 2026 г. |
| 33 | DeepSeek V4 FlashDeepSeek | 50.3±5.7 | 54.4 | — | — | 64.0 | 40.7 | 31.1 | — | — | 1189.0 | 49.1 | 53.5 | — | — | — | — | — | — | — | 57.8 | — | — | — | — | — | 76.7 | — | Rated | Измерения: 4/4 · семейств: 9 | 9 авг. 2026 г. |
| 34 | Qwen3.6 PlusQwen | 50±5.5 | 50.6 | — | 97.7 | 48.2 | 39.8 | — | 70.7 | 74.1 | 1138.0 | 61.6 | — | — | — | — | — | — | 44.3 | 74.3 | 58.8 | — | — | 18.0 | — | — | — | — | Rated | Измерения: 4/4 · семейств: 11 | 9 авг. 2026 г. |
| 35 | InklingThinking Machines | 49.4±8.2 | — | — | — | 74.1 | — | 23.7 | — | — | 1238.0 | 63.8 | 77.1 | — | 38.1 | — | — | — | — | — | — | — | — | — | 840.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 7 | 9 авг. 2026 г. |
| 36 | Claude Opus 4.5Anthropic | 49.3±5.3 | 64.2 | — | 86.3 | 42.3 | 43.5 | — | 70.2 | 71.8 | — | 59.3 | — | 66.3 | — | — | — | — | 23.3 | 76.4 | 59.6 | — | 32.3 | — | — | — | 50.6 | — | Rated | Измерения: 4/4 · семейств: 12 | 9 авг. 2026 г. |
| 37 | Grok 4.3SpaceXAI | 49.1±6.6 | 43.9 | — | 97.7 | — | — | — | — | — | 1084.0 | — | — | — | — | — | — | — | — | — | — | 17.0 | — | 12.4 | — | — | — | — | Rated | Измерения: 4/4 · семейств: 5 | 9 авг. 2026 г. |
| 38 | MiMo-V2-Pro | 48±8.9 | 36.7 | — | 95.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 57.8 | — | — | 15.3 | — | — | — | — | Rated | Измерения: 3/4 · семейств: 4 | 9 авг. 2026 г. |
| 39 | GPT-5.2OpenAI | 47.9±6.6 | 46.5 | — | 84.8 | — | — | — | — | — | — | — | 65.8 | 47.3 | — | — | — | — | — | — | — | — | 34.3 | — | — | — | — | — | Rated | Измерения: 4/4 · семейств: 5 | 9 авг. 2026 г. |
| 40 | GLM-4.7Z.ai | 47.1±8.6 | 40.0 | — | 95.9 | — | — | — | — | — | 1165.0 | 41.0 | 52.0 | — | — | — | — | — | 15.5 | — | — | — | — | — | — | — | — | — | Rated | Измерения: 3/4 · семейств: 6 | 9 авг. 2026 г. |
| 41 | Claude Sonnet 4.5Anthropic | 46.9±8.7 | 48.5 | — | — | — | — | — | — | — | — | 50.0 | — | 61.4 | — | — | — | — | 17.0 | — | — | — | 27.7 | — | — | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 42 | Qwen3.6 35B A3BQwen | 46.8±5.9 | 42.6 | — | 95.3 | 62.8 | 26.9 | — | 67.2 | — | 1053.0 | 51.5 | — | — | — | — | — | — | 35.6 | 60.1 | 68.7 | — | — | — | — | — | — | — | Rated | Измерения: 4/4 · семейств: 9 | 9 авг. 2026 г. |
| 43 | Qwen3.5-27BQwen | 46.2±8.7 | 39.4 | — | 93.9 | — | — | — | — | — | — | 41.6 | 61.0 | 56.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 44 | Mistral Medium 3.5Mistral | 45.9±6.3 | 39.1 | — | 94.2 | — | — | — | 91.4 | — | 932.0 | — | — | — | 33.7 | — | — | — | — | — | — | — | — | — | 516.0 | 69.1 | — | — | Rated | Измерения: 4/4 · семейств: 6 | 9 авг. 2026 г. |
| 45 | GPT-5.4 NanoOpenAI | 45.5±8.1 | — | — | 92.5 | 56.1 | 35.5 | — | — | — | 1101.0 | 46.3 | — | 39.0 | — | — | — | — | — | — | — | 24.9 | — | — | — | — | — | — | Rated | Измерения: 3/4 · семейств: 7 | 9 авг. 2026 г. |
| 46 | Qwen3.5 | 45.4±5.3 | 46.8 | — | 95.6 | 46.1 | 36.3 | — | 68.4 | 74.2 | 963.0 | 52.5 | 62.0 | — | — | — | — | — | 43.7 | 74.0 | 56.8 | 15.3 | — | 14.2 | — | — | — | — | Rated | Измерения: 4/4 · семейств: 13 | 9 авг. 2026 г. |
| 47 | MiniMax M2.7MiniMax | 45.2±6.0 | 40.4 | — | 84.8 | — | 46.3 | — | — | — | 1158.0 | 57.0 | — | — | — | — | — | — | — | — | 48.7 | 10.6 | — | — | — | — | — | — | Rated | Измерения: 4/4 · семейств: 7 | 9 авг. 2026 г. |
| 48 | Gemini 3 FlashGoogle | 43.1±8.9 | 56.6 | — | 43.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 49.2 | — | 11.4 | — | — | — | — | — | Rated | Измерения: 3/4 · семейств: 4 | 9 авг. 2026 г. |
| 49 | Qwen3.5-35B-A3BQwen | 43.1±8.7 | 29.0 | — | 89.2 | — | — | — | — | — | — | 40.5 | 61.0 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 50 | Gemini 3.1 Flash LiteGoogle | 42.3±6.9 | 38.5 | — | 31.3 | — | — | — | — | — | 647.0 | — | — | — | — | — | — | — | — | — | — | 12.2 | — | — | — | — | — | — | Rated | Измерения: 4/4 · семейств: 4 | 9 авг. 2026 г. |
| 51 | GLM-5Z.ai | 41.7±5.6 | 51.0 | — | 98.2 | 31.1 | 38.0 | — | 65.6 | 60.8 | — | 56.2 | — | — | — | — | — | — | — | 69.8 | 57.7 | 14.5 | — | — | — | — | 43.2 | — | Rated | Измерения: 4/4 · семейств: 10 | 9 авг. 2026 г. |
| 52 | Gemini 3.5 Flash-LiteGoogle | 41.3±8.8 | — | — | — | — | — | 16.5 | — | — | 1139.0 | 54.0 | — | 74.0 | — | — | — | — | — | — | — | — | — | — | 635.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 53 | Kimi K2.5MoonshotAI | 39.7±5.1 | 45.9 | — | 95.9 | 29.5 | 27.8 | — | 65.7 | 59.1 | 1003.0 | 50.8 | 60.6 | — | — | — | — | 77.1 | — | 72.7 | 52.3 | 11.5 | 8.7 | 14.0 | — | — | — | — | Rated | Измерения: 4/4 · семейств: 14 | 9 авг. 2026 г. |
| 54 | DeepSeek V3.2DeepSeek | 39.2±6.9 | 29.6 | — | 78.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | 18.5 | — | 40.2 | — | — | — | — | — | — | — | Rated | Измерения: 4/4 · семейств: 4 | 9 авг. 2026 г. |
| 55 | gpt-oss-120bOpenAI | 35.3±6.2 | 29.6 | — | 65.8 | — | — | — | — | — | 802.0 | — | — | — | 25.5 | — | 5.6 | — | — | — | — | 3.1 | — | — | — | 13.9 | — | — | Rated | Измерения: 4/4 · семейств: 7 | 9 авг. 2026 г. |
| Estimated-модели — без места31 | |||||||||||||||||||||||||||||||
| — | Qwen3.8 MaxQwen | 65.8±11.3 | — | — | — | — | — | — | — | — | — | — | — | 86.1 | — | 19.4 | — | — | — | 81.9 | — | — | 53.4 | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Inkling SmallThinking Machines | 55.8±10.9 | — | — | — | 79.6 | — | — | — | — | 1268.0 | 64.7 | 77.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | Kimi K2.7 CodeMoonshotAI | 54±11.2 | — | — | 90.1 | 76.0 | — | — | — | — | 1189.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Qwen3.6 Max PreviewQwen | 54±11.8 | — | — | 95.9 | — | — | — | — | — | — | 65.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | GLM-5 TurboZ.ai | 52±11.9 | — | — | 98.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 55.8 | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | GPT-5.2 CodexOpenAI | 51.4±9.3 | 51.8 | — | 92.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 26.0 | — | — | — | — | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Ling-3.0-flashInclusionai | 50.5±10.2 | — | — | — | 65.5 | — | 28.0 | — | — | 1107.0 | — | 72.2 | — | — | — | — | — | — | 73.6 | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 5 | 9 авг. 2026 г. |
| — | GPT-5.1 CodexOpenAI | 49.9±9.3 | 49.7 | — | 83.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 26.2 | — | — | — | — | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Gemini 3 ProGoogle | 49.4±9.3 | 63.2 | — | 87.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 11.4 | — | — | — | — | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Qwen3.5-122B-A10BQwen | 48.5±10.6 | — | — | 93.6 | — | — | — | — | — | 982.0 | 49.4 | 63.8 | 58.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 5 | 9 авг. 2026 г. |
| — | GPT-5.1OpenAI | 47.8±9.3 | 41.2 | — | 81.9 | — | — | — | — | — | 988.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Qwen3 MaxQwen | 47.6±11.8 | 43.7 | — | 74.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | MiMo-V2-Flash | 47.3±11.8 | — | — | 83.9 | — | — | — | — | — | 838.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | GLM-5V TurboZ.ai | 47.1±9.3 | 30.8 | — | 98.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 53.8 | — | — | — | — | — | — | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Hy3 previewTencent | 46.5±11.2 | 36.9 | — | — | — | — | — | — | — | 1215.0 | 54.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Command ACohere | 46.1±11.8 | — | — | 85.0 | — | — | — | — | — | 718.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | GPT-5OpenAI | 45.6±9.3 | — | — | 86.5 | — | — | — | — | — | 1082.0 | — | — | — | — | — | — | — | — | — | — | — | 8.5 | — | — | — | — | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Claude Sonnet 4Anthropic | 44.5±9.3 | 39.7 | — | 52.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 18.4 | — | — | — | — | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Ling 2.6 FlashinclusionAI | 44.4±11.8 | — | — | 86.0 | — | — | — | — | — | 550.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | Trinity Large ThinkingArcee AI | 43.9±9.3 | 32.5 | — | 90.1 | — | — | — | — | — | 564.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Gemini 2.5 ProGoogle | 43.7±9.3 | 42.0 | — | 54.1 | — | — | — | — | — | 669.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Grok 4.20SpaceXAI | 43.3±11.2 | 38.4 | — | — | — | — | — | — | — | — | 47.1 | — | — | — | — | — | 62.8 | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | MiMo-V2-Omni | 41.5±11.9 | — | — | 91.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 45.2 | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | GPT-4.1 MiniOpenAI | 40.4±11.8 | — | — | 52.9 | — | — | — | — | — | 505.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | GPT-4.1OpenAI | 39.9±11.8 | 25.6 | — | 47.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | Mistral Large 3 | 39.4±11.8 | — | — | 24.6 | — | — | — | — | — | 640.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | gpt-oss-20bOpenAI | 37.7±9.3 | — | — | 60.2 | — | — | — | — | — | 564.0 | — | — | — | — | — | — | — | — | — | — | 0.7 | — | — | — | — | — | — | Estimated | Измерения: 3/4 · семейств: 3 | 9 авг. 2026 г. |
| — | DeepSeek V3 | 34.6±11.8 | — | — | 22.8 | — | — | — | — | — | 231.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | Llama 4 MaverickMeta | 33.3±11.8 | — | — | 17.8 | — | — | — | — | — | 5.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | GPT-4.1 NanoOpenAI | 33.2±11.8 | — | — | 17.3 | — | — | — | — | — | 62.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| — | Llama 4 ScoutMeta | 32.9±11.8 | — | — | 15.5 | — | — | — | — | — | 111.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 2 | 9 авг. 2026 г. |
| Provisional-модели — без места14 | |||||||||||||||||||||||||||||||
| — | Muse Spark 1.2Meta | 62.3±16.0 | — | — | — | — | — | — | — | — | 1631.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | GPT-5.5 ProOpenAI | 61.4±16.1 | — | — | — | — | — | — | — | — | — | — | 90.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | GPT-5.4 ProOpenAI | 60.5±16.1 | — | — | — | — | — | — | — | — | — | — | 89.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | Laguna S 2.1Poolside | 53.7±16.0 | — | — | — | — | — | — | — | — | — | 70.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | Hy3Tencent | 52.8±16.0 | — | — | — | — | — | — | — | — | 1215.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | GPT-5.1 Codex MaxOpenAI | 50.1±16.0 | — | — | 83.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | Grok Build 0 1SpaceXAI | 50±16.1 | 49.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | O3OpenAI | 49.5±16.0 | — | — | 80.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | GLM-4.6Z.ai | 48.6±16.0 | — | — | 76.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | Claude Opus 4.1Anthropic | 46.8±16.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 21.9 | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | O1OpenAI | 45.8±16.0 | — | — | 62.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | Kimi K2MoonshotAI | 45.5±16.0 | — | — | 61.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | Qwen3.5 PlusAlibaba | 44.7±16.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 18.5 | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
| — | GLM-4.5 AirZ.ai | 43.1±16.0 | — | — | 46.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | Provisional | Измерения: 1/4 · семейств: 1 | 9 авг. 2026 г. |
Что измеряет этот рейтинг
Какая AI-модель лучше подходит для агентных задач?
Рейтинг проверяет планирование, работу с инструментами, действия в среде и восстановление после ошибок. Умения только отвечать на вопросы недостаточно.
Четыре измерения способности
Четыре измерения заданы схемой категории. Доступные данные могут покрывать только часть из них. Измерение без свидетельств не считается подтверждённой способностью.
Планирование и декомпозиция
Сейчас это измерение поддерживают 2 столбцов бенчмарков.
- Gert Labs
- DeepPlanning
Использование инструментов
Сейчас это измерение поддерживают 6 столбцов бенчмарков.
- τ²-bench results
- MCP Atlas
- Toolathlon
- AA Tau3 Banking
- τ³-bench results
- MCP-Tasks
Среда и длительное выполнение
Сейчас это измерение поддерживают 10 столбцов бенчмарков.
- GDPval-AA
- Terminal-Bench 2.0
- BrowseComp
- OSWorld-Verified
- AA EnterpriseOps-Gym
- OSWorld 2.0
- AA ITBench
- DeepSearchQA
- VITA-Bench
- WideResearch
Восстановление и надёжность завершения
Сейчас это измерение поддерживают 8 столбцов бенчмарков.
- Claw-Eval
- APEX-Agents-AA
- JobBench
- ResearchClawBench
- AA Briefcase
- AA Harvey LAB
- CyberGym
- ExploitGym
Агентные задачи для сравнения
- Исследовательские помощники, которые ищут данные, собирают свидетельства и меняют план.
- Работа в браузере и на компьютере с несколькими инструментами и шагами.
- Бизнес-автоматизация, которая соблюдает правила, обрабатывает ошибки и сохраняет проверяемый результат.
Как выбрать модель по этому рейтингу
- Шаг 1
Сначала проверьте статус
Только Rated-модели получают место. Estimated и Provisional не имеют формальной позиции.
- Шаг 2
Затем изучите интервал и свидетельства
Если оценки близки, не смотрите только на место. Проверьте неопределённость, измерения и число бенчмарков.
- Шаг 3
В конце проверьте реальную задачу
Рейтинг не заменяет ваш тест. Вместе проверяйте качество, скорость, цену, контекст и ограничения провайдера.
Сначала учтите инструменты и среду. Затем сравните восстановление, скорость, цену и права доступа. Первое место подходит не каждому агенту.
Что означают статусы
Rated
Rated означает, что правила по свидетельствам и пересечениям выполнены. Модель может получить формальный ранг.
Estimated
Estimated означает, что полезные свидетельства есть, но их недостаточно для формального ранга.
Provisional
Provisional означает мало свидетельств или недостаточное покрытие аспектов и семейств бенчмарков для статуса Estimated. Это только ранний сигнал.
Бенчмарки и источники свидетельств
Названия источников и группы бенчмарков взяты из доступных данных оценки. Один источник может дать несколько бенчмарков.
BenchLM
AA Briefcase, AA EnterpriseOps-Gym, AA Harvey LAB, AA ITBench, AA Tau3 Banking, APEX-Agents-AA, BrowseComp, Claw-Eval, CyberGym, DeepPlanning, DeepSearchQA, ExploitGym, GDPval-AA, Gert Labs, JobBench, MCP Atlas, MCP-Tasks, OSWorld 2.0, OSWorld-Verified, ResearchClawBench, Terminal-Bench 2.0, Toolathlon, VITA-Bench, WideResearch, τ²-bench results и τ³-bench results
Как строится рейтинг агентных моделей
LMSpeed объединяет подходящие сторонние бенчмарки в четырёх фиксированных измерениях. Rated-модели получают формальный ранг, а Estimated и Provisional остаются видимыми без позиции.
Подробнее о методологии Category ScoreОграничения рейтинга
Category Score использует сторонние бенчмарки, которые сейчас включены в LMSpeed. Тесты могут отличаться данными, запросами и правилами оценки. Результат не вечный и не описывает каждую реальную задачу. Важный выбор проверяйте на своих данных.
Частые вопросы
Какая доступная модель имеет самый высокий формальный ранг?
Среди доступных моделей самый высокий формальный ранг у Kimi K3. Глобальная позиция 1, а Category Score равен 68.9. Правила формального рейтинга выполняют 55 доступных моделей. Результат относится только к дате и версии методики на странице.
Можно ли сравнивать оценки разных категорий?
Нет. Каждая категория использует свои измерения и свидетельства. Category Score сравним только внутри одной таблицы. Для другой задачи откройте её категорию.
Полезны ли Estimated и Provisional модели?
Они помогают найти кандидатов, но свидетельств пока недостаточно для формального ранга. Сначала изучите покрытие и неопределённость, затем проверьте модель на реальной задаче.
Как часто обновляется рейтинг?
Рейтинг обновляется после публикации нового завершённого запуска. Дата и версия методики указаны выше. LMSpeed не обещает фиксированное ежедневное или еженедельное обновление.
Модель на первом месте всегда лучше для меня?
Нет. Результат также зависит от скорости, цены, длины контекста, инструментов, региона и ограничений провайдера. Сначала сократите список, затем проведите свой тест.
Чем рейтинг агентов отличается от рейтинга рассуждения?
Рейтинг рассуждения проверяет логику, причинность и свидетельства. Рейтинг агентов также проверяет планирование, инструменты, действия и восстановление. Сильное рассуждение не гарантирует завершение агентного процесса.
