Рейтинг Category Score V3

LMSpeed Лучшие модели для AI-агентов

Сравните лучшие модели для AI-агентов по планированию, инструментам, выполнению задач в среде и восстановлению. Формальный рейтинг следует правилам Category Score V3.

Методология 3.0Методология

Текущий вывод

Среди доступных моделей самый высокий формальный ранг у Kimi K3. Глобальная позиция 1. Category Score равен 68.3, а 80% интервал неопределённости равен ±7.3. Формальный ранг получили 55 доступных моделей. Вывод относится только к этому запуску.

Открыть данные Kimi K3Рейтинг меняется вместе с данными и методикой. Дата запуска указана выше.

Доступные данные рейтинга

Показано моделей
100
Моделей с формальным рангом
55
Столбцов бенчмарков
26
Измерений со свидетельствами
4/4

Как читать полосы бенчмарков

Каждая полоса сравнивает модели только внутри одного столбца бенчмарка. Длина рассчитана относительно показанных моделей, не является Category Score и несопоставима между столбцами.

МестоМодельОценка LMSpeedПланирование и декомпозицияИспользование инструментовСреда и длительное выполнениеВосстановление и надёжность завершенияСтатусПокрытиеОбновлено
Gert LabsМоделей: undefinedDeepPlanningМоделей: undefinedτ²-bench resultsМоделей: undefinedMCP AtlasМоделей: undefinedToolathlonМоделей: undefinedAA Tau3 BankingМоделей: undefinedτ³-bench resultsМоделей: undefinedMCP-TasksМоделей: undefinedGDPval-AAМоделей: undefinedTerminal-Bench 2.0Моделей: undefinedBrowseCompМоделей: undefinedOSWorld-VerifiedМоделей: undefinedOSWorld 2.0Моделей: undefinedDeepSearchQAМоделей: undefinedAA EnterpriseOps-GymМоделей: undefinedVITA-BenchМоделей: undefinedWideResearchМоделей: undefinedAA ITBenchМоделей: undefinedClaw-EvalМоделей: undefinedAPEX-Agents-AAМоделей: undefinedJobBenchМоделей: undefinedResearchClawBenchМоделей: undefinedAA BriefcaseМоделей: undefinedCyberGymМоделей: undefinedAA Harvey LABМоделей: undefinedExploitGymМоделей: undefined
Модели с формальным рейтингом55
1Kimi K3MoonshotAI
68.3±7.3
84.246.01677.088.391.295.045.347.741.352.91542.094.6RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
2GPT-5.6 SolOpenAI
67.1±7.3
85.158.044.31735.091.992.262.642.956.21503.084.587.233.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
3Claude Opus 5Anthropic
66.1±8.2
85.842.11862.090.870.695.047.51720.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
4Claude Fable 5Anthropic
64.6±8.2
98.538.11747.084.385.051.11574.093.6RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
5Muse Spark 1.1Meta
63.1±7.4
88.175.61375.080.080.814.284.947.254.759.093.10.8RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
6GPT-5.6 TerraOpenAI
62.8±7.4
86.353.140.21583.087.487.550.251.038.981.885.223.2RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
7Grok 4.6SpaceXAI
62.8±8.6
50.71753.081.61577.079.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
8Claude Opus 4.8Anthropic
62.7±5.5
73.094.482.259.91593.074.684.383.420.693.121.191.1RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
9GPT-5.5OpenAI
61.9±5.1
72.998.075.355.61490.082.084.478.713.046.645.837.742.717.081.813.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
10Gemini 3.5 FlashGoogle
60.6±5.6
61.995.383.656.51345.076.278.450.147.118.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
11GLM-5.2Z.ai
59.8±7.2
99.176.848.234.61505.081.042.742.733.720.71252.091.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
12GPT-5.6 LunaOpenAI
58.3±7.4
53.431.11582.084.783.345.640.335.877.987.912.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
13DeepSeek V4 Pro 0813DeepSeek
57.5±7.7
96.273.651.839.61306.067.983.424.383.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
14Claude Opus 4.7 MaxAnthropic
57.3±7.7
88.677.31490.069.479.378.018.246.745.973.1RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
15GPT-5.4OpenAI
57.2±5.1
64.998.970.654.61394.075.182.775.073.660.333.338.915.379.06.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
16Gemini 3.7 FlashGoogle
57.2±8.6
32.81532.047.91131.090.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
17Qwen3.7 MaxQwen
56.9±5.8
64.394.776.41271.069.747.965.218.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
18Qwen3.6 27BQwen
55.5±6.6
54.894.21140.059.372.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
19Kimi K2.6MoonshotAI
55±5.3
56.895.955.950.01192.066.783.273.14.692.580.862.328.518.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
20Claude Opus 4.6Anthropic
54.9±5.7
61.984.865.483.772.773.770.433.036.719.966.6RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
21Claude Opus 4.7Anthropic
54.6±6.9
65.674.013.920.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
22MiniMax M3MiniMax
54±7.3
88.974.215.31387.066.083.570.14.632.174.519.81107.088.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
23Step 3.7 FlashStepFun
53.7±5.7
51.698.549.51018.059.575.892.867.114.8RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
24Qwen3.7 PlusQwen
53.6±5.7
62.393.073.2945.070.373.32.845.662.722.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
25Gemini 3.6 FlashGoogle
53.3±8.6
29.91423.083.0963.085.1RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
26GLM-5.1Z.ai
53.3±5.7
60.197.771.870.61258.063.568.062.318.268.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
27GPT-5.3 CodexOpenAI
52.7±6.6
57.586.077.364.733.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
28Claude Sonnet 4.6Anthropic
52.7±6.1
62.979.559.172.18.367.836.965.2RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
29DeepSeek V4 Flash 0731DeepSeek
52.1±8.4
69.047.81189.056.973.276.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
30MiMo-V2.5-ProXiaomi
51.4±6.3
62.794.272.91265.068.463.82.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
31GPT-5.4 MiniOpenAI
51±8.1
93.457.742.91172.060.072.128.2RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
32InklingThinking Machines
50.9±8.3
74.129.11239.063.877.138.0841.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
33MiMo-V2.5Xiaomi
50.6±8.9
46.965.862.316.9RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
34Gemini 3.1 ProGoogle
50.6±6.1
56.995.6965.069.757.832.013.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
35Qwen3.6 PlusQwen
49.3±5.5
50.697.748.239.870.774.11140.061.644.374.358.818.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
36Grok 4.3SpaceXAI
49.1±6.6
43.997.71088.017.012.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
37Claude Opus 4.5Anthropic
48.5±5.3
64.286.342.343.570.271.859.366.323.376.459.632.350.6RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
38MiMo-V2-Pro
48.1±8.9
36.795.057.815.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
39GPT-5.2OpenAI
47.6±6.6
46.584.865.847.334.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
40Mistral Medium 3.5Mistral
47.1±6.3
39.194.291.4933.033.7517.069.1RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
41GLM-4.7Z.ai
46.7±8.6
40.095.91169.041.052.015.5RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
42Claude Sonnet 4.5Anthropic
46.6±8.7
48.550.061.417.027.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
43DeepSeek V4 FlashDeepSeek
46±6.3
54.464.040.749.153.557.8RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
44Qwen3.6 35B A3BQwen
46±5.9
42.695.362.826.967.21055.051.535.660.168.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
45Qwen3.5-27BQwen
45.9±8.7
39.493.941.661.056.2RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
46MiniMax M2.7MiniMax
45±6.0
40.484.846.31160.057.048.710.6RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
47GPT-5.4 NanoOpenAI
44.8±8.1
92.556.135.51105.046.339.024.9RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
48Qwen3.5
44.7±5.2
46.895.646.136.368.474.2964.052.562.043.774.056.815.314.2RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
49Gemini 3.5 Flash-LiteGoogle
43.6±8.8
17.51139.054.074.0635.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
50Gemini 3 FlashGoogle
43±8.9
56.643.349.211.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
51Qwen3.5-35B-A3BQwen
42.8±8.7
29.089.240.561.054.5RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
52GLM-5Z.ai
41.1±5.6
51.098.231.138.065.660.856.269.857.714.543.2RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
53Kimi K2.5MoonshotAI
39.1±5.1
45.995.929.527.865.759.11006.050.860.677.172.752.311.58.714.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
54DeepSeek V3.2DeepSeek
39.1±6.9
29.678.918.540.2RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
55gpt-oss-120bOpenAI
35.9±6.0
29.665.8800.025.55.63.18.013.9RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Estimated-модели — без места36
Qwen3.8 MaxQwen
66.4±10.9
1739.086.119.481.953.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Grok 4.5SpaceXAI
61.8±11.3
1526.083.392.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.8 27BQwen
57.2±11.9
84.333.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Muse Spark 1.2Meta
56.9±9.3
34.81631.01358.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Inkling SmallThinking Machines
55.7±10.9
79.61268.064.777.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K2.7 CodeMoonshotAI
53.7±11.2
90.176.01191.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.6 Max PreviewQwen
53.7±11.8
95.965.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-5 TurboZ.ai
52.1±11.9
98.555.8EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.2 CodexOpenAI
51.2±9.3
51.892.126.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek V4 ProDeepSeek
51±10.5
69.446.359.180.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.1 CodexOpenAI
49.7±9.3
49.783.026.2EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3 ProGoogle
49±9.3
63.287.111.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.5-122B-A10BQwen
48±10.6
93.6988.049.463.858.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Ling-3.0-flashInclusionai
47.8±10.2
65.528.01107.072.273.6EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.1OpenAI
47.7±9.3
41.281.9993.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Muse Glimmer 30BMeta
47.7±10.2
75.523.5953.065.974.6EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3 MaxQwen
47.5±11.8
43.774.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-5V TurboZ.ai
47.3±9.3
30.898.553.8EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiMo-V2-Flash
47.1±11.8
83.9839.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Hy3 previewTencent
46.3±11.2
36.91214.054.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5OpenAI
45±9.3
84.81083.08.5EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Command ACohere
44.8±9.3
85.0717.0369.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Sonnet 4Anthropic
44.4±9.3
39.752.318.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Ling 2.6 FlashinclusionAI
44.3±11.8
86.0550.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Trinity Large ThinkingArcee AI
43.9±9.3
32.590.1563.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 2.5 ProGoogle
43.6±9.3
42.054.1669.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Grok 4.20SpaceXAI
43.1±11.2
38.447.162.8EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiMo-V2-Omni
42±11.9
91.245.2EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4.1 MiniOpenAI
40.3±11.8
52.9505.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4.1OpenAI
40±11.8
25.647.1EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Mistral Large 3
39.3±11.8
24.6639.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
gpt-oss-20bOpenAI
37.6±9.3
60.2565.00.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek V3
34.6±11.8
22.8231.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Llama 4 MaverickMeta
33±11.8
17.83.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4.1 NanoOpenAI
33±11.8
17.361.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Llama 4 ScoutMeta
32.7±11.8
15.5109.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Provisional-модели — без места9
Claude Sonnet 5Anthropic
64.2±12.2
1603.080.484.781.2ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.5 ProOpenAI
61.3±16.1
90.1ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.4 ProOpenAI
60.4±16.1
89.3ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Laguna S 2.1Poolside
53.5±16.0
70.2ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Hy3Tencent
52.3±16.0
1214.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Grok Build 0 1SpaceXAI
50.1±16.1
49.1ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.1 Codex MaxOpenAI
49.9±16.0
83.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
O3OpenAI
49.3±16.0
80.7ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-4.6Z.ai
48.4±16.0
76.9ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.

Что измеряет этот рейтинг

Какая AI-модель лучше подходит для агентных задач?

Рейтинг проверяет планирование, работу с инструментами, действия в среде и восстановление после ошибок. Умения только отвечать на вопросы недостаточно.

Доступные данные покрывают 4/4 измерений и показывают 26 столбцов бенчмарков.

Четыре измерения способности

Четыре измерения заданы схемой категории. Доступные данные могут покрывать только часть из них. Измерение без свидетельств не считается подтверждённой способностью.

Планирование и декомпозиция

Сейчас это измерение поддерживают 2 столбцов бенчмарков.

  • Gert Labs
  • DeepPlanning

Использование инструментов

Сейчас это измерение поддерживают 6 столбцов бенчмарков.

  • τ²-bench results
  • MCP Atlas
  • Toolathlon
  • AA Tau3 Banking
  • τ³-bench results
  • MCP-Tasks

Среда и длительное выполнение

Сейчас это измерение поддерживают 10 столбцов бенчмарков.

  • GDPval-AA
  • Terminal-Bench 2.0
  • BrowseComp
  • OSWorld-Verified
  • OSWorld 2.0
  • DeepSearchQA
  • AA EnterpriseOps-Gym
  • VITA-Bench
  • WideResearch
  • AA ITBench

Восстановление и надёжность завершения

Сейчас это измерение поддерживают 8 столбцов бенчмарков.

  • Claw-Eval
  • APEX-Agents-AA
  • JobBench
  • ResearchClawBench
  • AA Briefcase
  • CyberGym
  • AA Harvey LAB
  • ExploitGym

Агентные задачи для сравнения

  • Исследовательские помощники, которые ищут данные, собирают свидетельства и меняют план.
  • Работа в браузере и на компьютере с несколькими инструментами и шагами.
  • Бизнес-автоматизация, которая соблюдает правила, обрабатывает ошибки и сохраняет проверяемый результат.

Как выбрать модель по этому рейтингу

  1. Шаг 1

    Сначала проверьте статус

    Только Rated-модели получают место. Estimated и Provisional не имеют формальной позиции.

  2. Шаг 2

    Затем изучите интервал и свидетельства

    Если оценки близки, не смотрите только на место. Проверьте неопределённость, измерения и число бенчмарков.

  3. Шаг 3

    В конце проверьте реальную задачу

    Рейтинг не заменяет ваш тест. Вместе проверяйте качество, скорость, цену, контекст и ограничения провайдера.

Сначала учтите инструменты и среду. Затем сравните восстановление, скорость, цену и права доступа. Первое место подходит не каждому агенту.

Что означают статусы

Rated

Rated означает, что правила по свидетельствам и пересечениям выполнены. Модель может получить формальный ранг.

Estimated

Estimated означает, что полезные свидетельства есть, но их недостаточно для формального ранга.

Provisional

Provisional означает мало свидетельств или недостаточное покрытие аспектов и семейств бенчмарков для статуса Estimated. Это только ранний сигнал.

Бенчмарки и источники свидетельств

Названия источников и группы бенчмарков взяты из доступных данных оценки. Один источник может дать несколько бенчмарков.

  • BenchLM

    AA Briefcase, AA EnterpriseOps-Gym, AA Harvey LAB, AA ITBench, AA Tau3 Banking, APEX-Agents-AA, BrowseComp, Claw-Eval, CyberGym, DeepPlanning, DeepSearchQA, ExploitGym, GDPval-AA, Gert Labs, JobBench, MCP Atlas, MCP-Tasks, OSWorld 2.0, OSWorld-Verified, ResearchClawBench, Terminal-Bench 2.0, Toolathlon, VITA-Bench, WideResearch, τ²-bench results и τ³-bench results

Как строится рейтинг агентных моделей

LMSpeed объединяет подходящие сторонние бенчмарки в четырёх фиксированных измерениях. Rated-модели получают формальный ранг, а Estimated и Provisional остаются видимыми без позиции.

Подробнее о методологии Category Score

Ограничения рейтинга

Category Score использует сторонние бенчмарки, которые сейчас включены в LMSpeed. Тесты могут отличаться данными, запросами и правилами оценки. Результат не вечный и не описывает каждую реальную задачу. Важный выбор проверяйте на своих данных.

Частые вопросы

Какая доступная модель имеет самый высокий формальный ранг?

Среди доступных моделей самый высокий формальный ранг у Kimi K3. Глобальная позиция 1, а Category Score равен 68.3. Правила формального рейтинга выполняют 55 доступных моделей. Результат относится только к дате и версии методики на странице.

Можно ли сравнивать оценки разных категорий?

Нет. Каждая категория использует свои измерения и свидетельства. Category Score сравним только внутри одной таблицы. Для другой задачи откройте её категорию.

Полезны ли Estimated и Provisional модели?

Они помогают найти кандидатов, но свидетельств пока недостаточно для формального ранга. Сначала изучите покрытие и неопределённость, затем проверьте модель на реальной задаче.

Как часто обновляется рейтинг?

Рейтинг обновляется после публикации нового завершённого запуска. Дата и версия методики указаны выше. LMSpeed не обещает фиксированное ежедневное или еженедельное обновление.

Модель на первом месте всегда лучше для меня?

Нет. Результат также зависит от скорости, цены, длины контекста, инструментов, региона и ограничений провайдера. Сначала сократите список, затем проведите свой тест.

Чем рейтинг агентов отличается от рейтинга рассуждения?

Рейтинг рассуждения проверяет логику, причинность и свидетельства. Рейтинг агентов также проверяет планирование, инструменты, действия и восстановление. Сильное рассуждение не гарантирует завершение агентного процесса.