При поддержкеFusecodeКорпоративный API для Claude Code, Codex и модельных рабочих процессов.
LogoLMSpeed
  • Бесплатные
  • Модели
  • Провайдеры
  • Рейтинги
LogoLMSpeed
  1. Главная
  2. Рейтинг
  3. Best Model For Agent
LogoLMSpeed

Лучший инструмент для проверки скорости API

GitHubGitHubTwitterX (Twitter)Email
Продукт
  • Возможности
  • Цены
  • FAQ
Рейтинги
  • Обзор
  • Рейтинг скорости
  • Рейтинг задержки
  • Рейтинг стабильности
  • Цены моделей
  • Скорость моделей
  • Reasoning
  • Coding
Модели
  • Все модели
  • GPT
  • Claude
  • Gemini
  • DeepSeek
  • Llama
  • Qwen
Бесплатные модели
  • Все бесплатные модели
  • Бесплатный GPT
  • Бесплатный Claude
  • Бесплатный Gemini
  • Бесплатный DeepSeek
  • Бесплатный Llama
  • Бесплатный Qwen
Tools
  • Speed Test
  • Provider Audit
Компания
  • О нас
Ресурсы
  • Каталог провайдеров
  • Документация
  • Публичный API
  • Botab
  • VidBee
Правовая информация
  • Политика cookie
  • Политика конфиденциальности
  • Условия использования
© 2026 LMSpeed All Rights Reserved.Made by Nexmoe with ❤️
АгентыКодингРассуждениеЗнанияМатематикаМультиязычностьМультимодальностьСледование инструкциям

Рейтинг Category Score V3

LMSpeed Лучшие модели для AI-агентов

Сравните лучшие модели для AI-агентов по планированию, инструментам, выполнению задач в среде и восстановлению. Формальный рейтинг следует правилам Category Score V3.

Обновлено 9 августа 2026 г.·Методология 3.0·Методология

Текущий вывод

Среди доступных моделей самый высокий формальный ранг у Kimi K3. Глобальная позиция 1. Category Score равен 68.9, а 80% интервал неопределённости равен ±7.3. Формальный ранг получили 55 доступных моделей. Вывод относится только к этому запуску.

Открыть данные Kimi K3Рейтинг меняется вместе с данными и методикой. Дата запуска указана выше.

Доступные данные рейтинга

Показано моделей
100
Моделей с формальным рангом
55
Столбцов бенчмарков
26
Измерений со свидетельствами
4/4

Как читать полосы бенчмарков

Каждая полоса сравнивает модели только внутри одного столбца бенчмарка. Длина рассчитана относительно показанных моделей, не является Category Score и несопоставима между столбцами.

МестоМодельОценка LMSpeedПланирование и декомпозицияИспользование инструментовСреда и длительное выполнениеВосстановление и надёжность завершенияСтатусПокрытиеОбновлено
Gert LabsМоделей: 50DeepPlanningМоделей: 1τ²-bench resultsМоделей: 84MCP AtlasМоделей: 28ToolathlonМоделей: 22AA Tau3 BankingМоделей: 17τ³-bench resultsМоделей: 9MCP-TasksМоделей: 5GDPval-AAМоделей: 63Terminal-Bench 2.0Моделей: 51BrowseCompМоделей: 29OSWorld-VerifiedМоделей: 25AA EnterpriseOps-GymМоделей: 17OSWorld 2.0Моделей: 14AA ITBenchМоделей: 11DeepSearchQAМоделей: 11VITA-BenchМоделей: 9WideResearchМоделей: 9Claw-EvalМоделей: 28APEX-Agents-AAМоделей: 24JobBenchМоделей: 22ResearchClawBenchМоделей: 19AA BriefcaseМоделей: 17AA Harvey LABМоделей: 16CyberGymМоделей: 13ExploitGymМоделей: 6
Модели с формальным рейтингом55
1MoonshotAIKimi K3MoonshotAI
68.9±7.3
———84.2—33.4——1687.088.391.2—45.3—47.795.0———41.352.9—1542.094.6——RatedИзмерения: 3/4 · семейств: 129 авг. 2026 г.
2OpenAIGPT-5.6 SolOpenAI
68.2±7.3
——85.1—58.033.0——1735.091.992.2—42.962.656.2———————1504.087.284.533.7RatedИзмерения: 3/4 · семейств: 129 авг. 2026 г.
3ClaudeClaude Opus 5Anthropic
67.5±8.2
———85.8—30.3——1862.0—90.8—47.570.6—95.0——————1720.0———RatedИзмерения: 3/4 · семейств: 89 авг. 2026 г.
4ClaudeClaude Fable 5Anthropic
65.7±8.2
——98.5——26.8——1747.084.3—85.051.1—————————1574.093.6——RatedИзмерения: 3/4 · семейств: 79 авг. 2026 г.
5OpenAIGPT-5.6 TerraOpenAI
63.9±7.4
——86.3—53.131.8——1583.087.487.5——50.251.0————38.9———85.281.823.2RatedИзмерения: 3/4 · семейств: 119 авг. 2026 г.
6ClaudeClaude Opus 4.8Anthropic
63.2±5.3
73.0—94.482.259.927.6——1593.074.684.383.444.020.6—93.1—————21.11345.091.1——RatedИзмерения: 4/4 · семейств: 139 авг. 2026 г.
7OpenAIGPT-5.5OpenAI
62.7±5.1
72.9—98.075.355.6———1490.082.084.478.746.613.045.8————37.742.717.0——81.813.4RatedИзмерения: 4/4 · семейств: 159 авг. 2026 г.
8GrokGrok 4.5SpaceXAI
61.9±8.4
—————32.6——1527.083.3——40.8—————————1315.092.4——RatedИзмерения: 3/4 · семейств: 69 авг. 2026 г.
9GeminiGemini 3.5 FlashGoogle
61.1±5.6
61.9—95.383.656.5———1345.076.2—78.450.1——————47.1—18.0————RatedИзмерения: 4/4 · семейств: 109 авг. 2026 г.
10ChatGLMGLM-5.2Z.ai
60.5±7.2
——99.176.848.226.8——1510.081.0——42.7—42.7————33.7—20.71253.091.0——RatedИзмерения: 3/4 · семейств: 119 авг. 2026 г.
11SparkMuse Spark 1.1Meta
60.4±7.1
———88.175.625.2——1375.080.0—80.847.214.2—84.9————54.7—868.093.159.00.8RatedИзмерения: 3/4 · семейств: 139 авг. 2026 г.
12OpenAIGPT-5.6 LunaOpenAI
59.8±7.4
————53.427.2——1582.084.783.3——45.640.3————35.8———87.977.912.4RatedИзмерения: 3/4 · семейств: 119 авг. 2026 г.
13ClaudeClaude Sonnet 5Anthropic
59.8±8.2
—————28.2——1603.080.484.781.244.7—————————1385.090.1——RatedИзмерения: 3/4 · семейств: 89 авг. 2026 г.
14ClaudeClaude Opus 4.7 MaxAnthropic
58±7.7
——88.677.3————1491.069.479.378.0—18.246.7—————45.9———73.1—RatedИзмерения: 3/4 · семейств: 99 авг. 2026 г.
15OpenAIGPT-5.4OpenAI
57.7±5.1
64.9—98.970.654.6———1391.075.182.775.0———73.6——60.333.338.915.3——79.06.0RatedИзмерения: 4/4 · семейств: 159 авг. 2026 г.
16QwenQwen3.7 MaxQwen
56.9±5.4
64.3—94.776.4————1270.069.7——45.0—42.5—47.9—65.2——18.7914.083.4——RatedИзмерения: 4/4 · семейств: 129 авг. 2026 г.
17MinimaxMiniMax M3MiniMax
56.2±7.3
——88.974.2————1390.066.083.570.132.14.6————74.5——19.81108.088.4——RatedИзмерения: 3/4 · семейств: 119 авг. 2026 г.
18QwenQwen3.6 27BQwen
56.1±6.6
54.8—94.2—————1138.059.3————————72.4———————RatedИзмерения: 4/4 · семейств: 59 авг. 2026 г.
19MoonshotAIKimi K2.6MoonshotAI
55.5±5.3
56.8—95.955.950.0———1188.066.783.273.1—4.6—92.5—80.862.328.5—18.0————RatedИзмерения: 4/4 · семейств: 139 авг. 2026 г.
20ClaudeClaude Opus 4.6Anthropic
55.4±5.7
61.9—84.8——————65.483.772.7———73.7——70.433.036.719.9——66.6—RatedИзмерения: 4/4 · семейств: 119 авг. 2026 г.
21ClaudeClaude Opus 4.7Anthropic
54.9±6.9
65.6—74.0——————————13.9———————20.7————RatedИзмерения: 4/4 · семейств: 49 авг. 2026 г.
22StepfunStep 3.7 FlashStepFun
54.1±5.7
51.6—98.5—49.5———1017.059.575.8————92.8——67.114.8——————RatedИзмерения: 4/4 · семейств: 99 авг. 2026 г.
23QwenQwen3.7 PlusQwen
54±5.7
—62.393.073.2————943.070.3—73.3—2.8——45.6—62.722.4——————RatedИзмерения: 4/4 · семейств: 99 авг. 2026 г.
24ChatGLMGLM-5.1Z.ai
53.9±5.7
60.1—97.771.8——70.6—1256.063.568.0———————62.3——18.2——68.7—RatedИзмерения: 4/4 · семейств: 99 авг. 2026 г.
25ClaudeClaude Sonnet 4.6Anthropic
53.2±6.1
62.9—79.5——————59.1—72.1—8.3————67.8—36.9———65.2—RatedИзмерения: 4/4 · семейств: 79 авг. 2026 г.
26GeminiGemini 3.6 FlashGoogle
53±9.0
—————24.5——1423.0——83.0——————————962.0———RatedИзмерения: 3/4 · семейств: 49 авг. 2026 г.
27OpenAIGPT-5.3 CodexOpenAI
53±6.6
57.5—86.0——————77.3—64.7————————33.7—————RatedИзмерения: 4/4 · семейств: 59 авг. 2026 г.
28OpenAIGPT-5.4 MiniOpenAI
51.8±8.1
——93.457.742.9———1170.060.0—72.1———————28.2——————RatedИзмерения: 3/4 · семейств: 79 авг. 2026 г.
29DeepSeekDeepSeek V4 ProDeepSeek
51.4±5.1
50.3—94.269.446.325.8——1293.059.180.4—40.4—38.3———59.824.3—17.1931.084.4——RatedИзмерения: 4/4 · семейств: 149 авг. 2026 г.
30MiMo-V2.5-ProXiaomi
51.1±5.9
62.7—94.2———72.9—1265.068.4————38.2———63.82.4——879.073.3——RatedИзмерения: 4/4 · семейств: 99 авг. 2026 г.
31MiMo-V2.5Xiaomi
50.8±8.9
46.9————————65.8————————62.3——16.9————RatedИзмерения: 3/4 · семейств: 49 авг. 2026 г.
32GeminiGemini 3.1 ProGoogle
50.6±6.2
56.9—95.6—————965.0——————69.7——57.832.0—13.3————RatedИзмерения: 4/4 · семейств: 79 авг. 2026 г.
33DeepSeekDeepSeek V4 FlashDeepSeek
50.3±5.7
54.4——64.040.731.1——1189.049.153.5———————57.8—————76.7—RatedИзмерения: 4/4 · семейств: 99 авг. 2026 г.
34QwenQwen3.6 PlusQwen
50±5.5
50.6—97.748.239.8—70.774.11138.061.6——————44.374.358.8——18.0————RatedИзмерения: 4/4 · семейств: 119 авг. 2026 г.
35InklingThinking Machines
49.4±8.2
———74.1—23.7——1238.063.877.1—38.1—————————840.0———RatedИзмерения: 3/4 · семейств: 79 авг. 2026 г.
36ClaudeClaude Opus 4.5Anthropic
49.3±5.3
64.2—86.342.343.5—70.271.8—59.3—66.3————23.376.459.6—32.3———50.6—RatedИзмерения: 4/4 · семейств: 129 авг. 2026 г.
37GrokGrok 4.3SpaceXAI
49.1±6.6
43.9—97.7—————1084.0——————————17.0—12.4————RatedИзмерения: 4/4 · семейств: 59 авг. 2026 г.
38MiMo-V2-Pro
48±8.9
36.7—95.0———————————————57.8——15.3————RatedИзмерения: 3/4 · семейств: 49 авг. 2026 г.
39OpenAIGPT-5.2OpenAI
47.9±6.6
46.5—84.8———————65.847.3————————34.3—————RatedИзмерения: 4/4 · семейств: 59 авг. 2026 г.
40ChatGLMGLM-4.7Z.ai
47.1±8.6
40.0—95.9—————1165.041.052.0—————15.5—————————RatedИзмерения: 3/4 · семейств: 69 авг. 2026 г.
41ClaudeClaude Sonnet 4.5Anthropic
46.9±8.7
48.5————————50.0—61.4————17.0———27.7—————RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
42QwenQwen3.6 35B A3BQwen
46.8±5.9
42.6—95.362.826.9—67.2—1053.051.5——————35.660.168.7———————RatedИзмерения: 4/4 · семейств: 99 авг. 2026 г.
43QwenQwen3.5-27BQwen
46.2±8.7
39.4—93.9——————41.661.056.2——————————————RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
44MistralMistral Medium 3.5Mistral
45.9±6.3
39.1—94.2———91.4—932.0———33.7—————————516.069.1——RatedИзмерения: 4/4 · семейств: 69 авг. 2026 г.
45OpenAIGPT-5.4 NanoOpenAI
45.5±8.1
——92.556.135.5———1101.046.3—39.0———————24.9——————RatedИзмерения: 3/4 · семейств: 79 авг. 2026 г.
46QwenQwen3.5
45.4±5.3
46.8—95.646.136.3—68.474.2963.052.562.0—————43.774.056.815.3—14.2————RatedИзмерения: 4/4 · семейств: 139 авг. 2026 г.
47MinimaxMiniMax M2.7MiniMax
45.2±6.0
40.4—84.8—46.3———1158.057.0————————48.710.6——————RatedИзмерения: 4/4 · семейств: 79 авг. 2026 г.
48GeminiGemini 3 FlashGoogle
43.1±8.9
56.6—43.3———————————————49.2—11.4—————RatedИзмерения: 3/4 · семейств: 49 авг. 2026 г.
49QwenQwen3.5-35B-A3BQwen
43.1±8.7
29.0—89.2——————40.561.054.5——————————————RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
50GeminiGemini 3.1 Flash LiteGoogle
42.3±6.9
38.5—31.3—————647.0——————————12.2——————RatedИзмерения: 4/4 · семейств: 49 авг. 2026 г.
51ChatGLMGLM-5Z.ai
41.7±5.6
51.0—98.231.138.0—65.660.8—56.2———————69.857.714.5————43.2—RatedИзмерения: 4/4 · семейств: 109 авг. 2026 г.
52GeminiGemini 3.5 Flash-LiteGoogle
41.3±8.8
—————16.5——1139.054.0—74.0——————————635.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
53MoonshotAIKimi K2.5MoonshotAI
39.7±5.1
45.9—95.929.527.8—65.759.11003.050.860.6————77.1—72.752.311.58.714.0————RatedИзмерения: 4/4 · семейств: 149 авг. 2026 г.
54DeepSeekDeepSeek V3.2DeepSeek
39.2±6.9
29.6—78.9—————————————18.5—40.2———————RatedИзмерения: 4/4 · семейств: 49 авг. 2026 г.
55OpenAIgpt-oss-120bOpenAI
35.3±6.2
29.6—65.8—————802.0———25.5—5.6————3.1———13.9——RatedИзмерения: 4/4 · семейств: 79 авг. 2026 г.
Estimated-модели — без места31
—QwenQwen3.8 MaxQwen
65.8±11.3
———————————86.1—19.4———81.9——53.4—————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—Inkling SmallThinking Machines
55.8±10.9
———79.6————1268.064.777.4———————————————EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—MoonshotAIKimi K2.7 CodeMoonshotAI
54±11.2
——90.176.0————1189.0—————————————————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—QwenQwen3.6 Max PreviewQwen
54±11.8
——95.9——————65.4————————————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—ChatGLMGLM-5 TurboZ.ai
52±11.9
——98.5———————————————55.8———————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—OpenAIGPT-5.2 CodexOpenAI
51.4±9.3
51.8—92.1—————————————————26.0—————EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—Ling-3.0-flashInclusionai
50.5±10.2
———65.5—28.0——1107.0—72.2——————73.6————————EstimatedИзмерения: 2/4 · семейств: 59 авг. 2026 г.
—OpenAIGPT-5.1 CodexOpenAI
49.9±9.3
49.7—83.0—————————————————26.2—————EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—GeminiGemini 3 ProGoogle
49.4±9.3
63.2—87.1—————————————————11.4—————EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—QwenQwen3.5-122B-A10BQwen
48.5±10.6
——93.6—————982.049.463.858.0——————————————EstimatedИзмерения: 2/4 · семейств: 59 авг. 2026 г.
—OpenAIGPT-5.1OpenAI
47.8±9.3
41.2—81.9—————988.0—————————————————EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—QwenQwen3 MaxQwen
47.6±11.8
43.7—74.3———————————————————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—MiMo-V2-Flash
47.3±11.8
——83.9—————838.0—————————————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—ChatGLMGLM-5V TurboZ.ai
47.1±9.3
30.8—98.5———————————————53.8———————EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—HunyuanHy3 previewTencent
46.5±11.2
36.9———————1215.054.4————————————————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—CohereCommand ACohere
46.1±11.8
——85.0—————718.0—————————————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—OpenAIGPT-5OpenAI
45.6±9.3
——86.5—————1082.0———————————8.5—————EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—ClaudeClaude Sonnet 4Anthropic
44.5±9.3
39.7—52.3—————————————————18.4—————EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—Ling 2.6 FlashinclusionAI
44.4±11.8
——86.0—————550.0—————————————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—Trinity Large ThinkingArcee AI
43.9±9.3
32.5—90.1—————564.0—————————————————EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—GeminiGemini 2.5 ProGoogle
43.7±9.3
42.0—54.1—————669.0—————————————————EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—GrokGrok 4.20SpaceXAI
43.3±11.2
38.4————————47.1—————62.8——————————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—MiMo-V2-Omni
41.5±11.9
——91.2———————————————45.2———————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—OpenAIGPT-4.1 MiniOpenAI
40.4±11.8
——52.9—————505.0—————————————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—OpenAIGPT-4.1OpenAI
39.9±11.8
25.6—47.1———————————————————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—MistralMistral Large 3
39.4±11.8
——24.6—————640.0—————————————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—OpenAIgpt-oss-20bOpenAI
37.7±9.3
——60.2—————564.0——————————0.7——————EstimatedИзмерения: 3/4 · семейств: 39 авг. 2026 г.
—DeepSeekDeepSeek V3
34.6±11.8
——22.8—————231.0—————————————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—MetaAILlama 4 MaverickMeta
33.3±11.8
——17.8—————5.0—————————————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—OpenAIGPT-4.1 NanoOpenAI
33.2±11.8
——17.3—————62.0—————————————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
—MetaAILlama 4 ScoutMeta
32.9±11.8
——15.5—————111.0—————————————————EstimatedИзмерения: 2/4 · семейств: 29 авг. 2026 г.
Provisional-модели — без места14
—SparkMuse Spark 1.2Meta
62.3±16.0
————————1631.0—————————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—OpenAIGPT-5.5 ProOpenAI
61.4±16.1
——————————90.1———————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—OpenAIGPT-5.4 ProOpenAI
60.5±16.1
——————————89.3———————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—Laguna S 2.1Poolside
53.7±16.0
—————————70.2————————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—HunyuanHy3Tencent
52.8±16.0
————————1215.0—————————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—OpenAIGPT-5.1 Codex MaxOpenAI
50.1±16.0
——83.0———————————————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—GrokGrok Build 0 1SpaceXAI
50±16.1
49.1—————————————————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—OpenAIO3OpenAI
49.5±16.0
——80.7———————————————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—ChatGLMGLM-4.6Z.ai
48.6±16.0
——76.9———————————————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—ClaudeClaude Opus 4.1Anthropic
46.8±16.2
————————————————————21.9—————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—OpenAIO1OpenAI
45.8±16.0
——62.6———————————————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—MoonshotAIKimi K2MoonshotAI
45.5±16.0
——61.1———————————————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—QwenQwen3.5 PlusAlibaba
44.7±16.2
————————————————————18.5—————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.
—ChatGLMGLM-4.5 AirZ.ai
43.1±16.0
——46.5———————————————————————ProvisionalИзмерения: 1/4 · семейств: 19 авг. 2026 г.

Что измеряет этот рейтинг

Какая AI-модель лучше подходит для агентных задач?

Рейтинг проверяет планирование, работу с инструментами, действия в среде и восстановление после ошибок. Умения только отвечать на вопросы недостаточно.

Доступные данные покрывают 4/4 измерений и показывают 26 столбцов бенчмарков.

Четыре измерения способности

Четыре измерения заданы схемой категории. Доступные данные могут покрывать только часть из них. Измерение без свидетельств не считается подтверждённой способностью.

Планирование и декомпозиция

Сейчас это измерение поддерживают 2 столбцов бенчмарков.

  • Gert Labs
  • DeepPlanning

Использование инструментов

Сейчас это измерение поддерживают 6 столбцов бенчмарков.

  • τ²-bench results
  • MCP Atlas
  • Toolathlon
  • AA Tau3 Banking
  • τ³-bench results
  • MCP-Tasks

Среда и длительное выполнение

Сейчас это измерение поддерживают 10 столбцов бенчмарков.

  • GDPval-AA
  • Terminal-Bench 2.0
  • BrowseComp
  • OSWorld-Verified
  • AA EnterpriseOps-Gym
  • OSWorld 2.0
  • AA ITBench
  • DeepSearchQA
  • VITA-Bench
  • WideResearch

Восстановление и надёжность завершения

Сейчас это измерение поддерживают 8 столбцов бенчмарков.

  • Claw-Eval
  • APEX-Agents-AA
  • JobBench
  • ResearchClawBench
  • AA Briefcase
  • AA Harvey LAB
  • CyberGym
  • ExploitGym

Агентные задачи для сравнения

  • Исследовательские помощники, которые ищут данные, собирают свидетельства и меняют план.
  • Работа в браузере и на компьютере с несколькими инструментами и шагами.
  • Бизнес-автоматизация, которая соблюдает правила, обрабатывает ошибки и сохраняет проверяемый результат.

Как выбрать модель по этому рейтингу

  1. Шаг 1

    Сначала проверьте статус

    Только Rated-модели получают место. Estimated и Provisional не имеют формальной позиции.

  2. Шаг 2

    Затем изучите интервал и свидетельства

    Если оценки близки, не смотрите только на место. Проверьте неопределённость, измерения и число бенчмарков.

  3. Шаг 3

    В конце проверьте реальную задачу

    Рейтинг не заменяет ваш тест. Вместе проверяйте качество, скорость, цену, контекст и ограничения провайдера.

Сначала учтите инструменты и среду. Затем сравните восстановление, скорость, цену и права доступа. Первое место подходит не каждому агенту.

Что означают статусы

Rated

Rated означает, что правила по свидетельствам и пересечениям выполнены. Модель может получить формальный ранг.

Estimated

Estimated означает, что полезные свидетельства есть, но их недостаточно для формального ранга.

Provisional

Provisional означает мало свидетельств или недостаточное покрытие аспектов и семейств бенчмарков для статуса Estimated. Это только ранний сигнал.

Бенчмарки и источники свидетельств

Названия источников и группы бенчмарков взяты из доступных данных оценки. Один источник может дать несколько бенчмарков.

  • BenchLM

    AA Briefcase, AA EnterpriseOps-Gym, AA Harvey LAB, AA ITBench, AA Tau3 Banking, APEX-Agents-AA, BrowseComp, Claw-Eval, CyberGym, DeepPlanning, DeepSearchQA, ExploitGym, GDPval-AA, Gert Labs, JobBench, MCP Atlas, MCP-Tasks, OSWorld 2.0, OSWorld-Verified, ResearchClawBench, Terminal-Bench 2.0, Toolathlon, VITA-Bench, WideResearch, τ²-bench results и τ³-bench results

Как строится рейтинг агентных моделей

LMSpeed объединяет подходящие сторонние бенчмарки в четырёх фиксированных измерениях. Rated-модели получают формальный ранг, а Estimated и Provisional остаются видимыми без позиции.

Подробнее о методологии Category Score

Ограничения рейтинга

Category Score использует сторонние бенчмарки, которые сейчас включены в LMSpeed. Тесты могут отличаться данными, запросами и правилами оценки. Результат не вечный и не описывает каждую реальную задачу. Важный выбор проверяйте на своих данных.

Частые вопросы

Какая доступная модель имеет самый высокий формальный ранг?

Среди доступных моделей самый высокий формальный ранг у Kimi K3. Глобальная позиция 1, а Category Score равен 68.9. Правила формального рейтинга выполняют 55 доступных моделей. Результат относится только к дате и версии методики на странице.

Можно ли сравнивать оценки разных категорий?

Нет. Каждая категория использует свои измерения и свидетельства. Category Score сравним только внутри одной таблицы. Для другой задачи откройте её категорию.

Полезны ли Estimated и Provisional модели?

Они помогают найти кандидатов, но свидетельств пока недостаточно для формального ранга. Сначала изучите покрытие и неопределённость, затем проверьте модель на реальной задаче.

Как часто обновляется рейтинг?

Рейтинг обновляется после публикации нового завершённого запуска. Дата и версия методики указаны выше. LMSpeed не обещает фиксированное ежедневное или еженедельное обновление.

Модель на первом месте всегда лучше для меня?

Нет. Результат также зависит от скорости, цены, длины контекста, инструментов, региона и ограничений провайдера. Сначала сократите список, затем проведите свой тест.

Чем рейтинг агентов отличается от рейтинга рассуждения?

Рейтинг рассуждения проверяет логику, причинность и свидетельства. Рейтинг агентов также проверяет планирование, инструменты, действия и восстановление. Сильное рассуждение не гарантирует завершение агентного процесса.