Рейтинг Category Score V3

LMSpeed Лучшие модели для рассуждений

Сравните модели по абстрактной логике, научному рассуждению, многошаговым ограничениям и проверке свидетельств с учётом неопределённости.

Методология 3.0Методология

Текущий вывод

Среди доступных моделей самый высокий формальный ранг у GPT-5.6 Sol. Глобальная позиция 1. Category Score равен 61.2, а 80% интервал неопределённости равен ±8.7. Формальный ранг получили 64 доступных моделей. Вывод относится только к этому запуску.

Открыть данные GPT-5.6 SolРейтинг меняется вместе с данными и методикой. Дата запуска указана выше.

Доступные данные рейтинга

Показано моделей
100
Моделей с формальным рангом
64
Столбцов бенчмарков
12
Измерений со свидетельствами
4/4

Как читать полосы бенчмарков

Каждая полоса сравнивает модели только внутри одного столбца бенчмарка. Длина рассчитана относительно показанных моделей, не является Category Score и несопоставима между столбцами.

МестоМодельОценка LMSpeedАбстрактная логикаНаучное и причинное рассуждениеМногошаговые ограниченияИнтеграция и проверка свидетельствСтатусПокрытиеОбновлено
ARC-AGI-2Моделей: undefinedGPQAМоделей: undefinedHLEМоделей: undefinedCritPtМоделей: undefinedHLE w/o toolsМоделей: undefinedAA-GPQA DiamondМоделей: undefinedAA-HLEМоделей: undefinedMMLU-ProМоделей: undefinedAA-LCRМоделей: undefinedLongBench v2Моделей: undefinedMRCR 1MМоделей: undefinedAI-NeedleМоделей: undefined
Модели с формальным рейтингом64
1GPT-5.6 SolOpenAI
61.2±8.7
92.593.1%47.3%32.377.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
2DeepSeek V4 Pro 0813DeepSeek
61±8.3
18.092.841.087.5%75.383.5RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
3Claude Opus 4.5Anthropic
60.7±8.1
86.6%30.1%0.389.5%67.364.474.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
4Claude Opus 5Anthropic
60.3±8.7
90.491.9%51.3%29.156.375.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
5Qwen3.7 MaxQwen
59.6±8.7
92.3%40.5%13.489.6%74.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
6DeepSeek V4 Flash 0731DeepSeek
59.4±8.3
16.690.838.686.2%74.378.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
7GPT-5.5OpenAI
59.2±8.7
85.092.6%42.4%27.141.479.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
8GPT-5.6 TerraOpenAI
58.7±8.7
83.989.6%38.5%30.079.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
9Gemini 3.1 ProGoogle
58.2±8.7
77.117.745.494.147.079.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
10Qwen3.7 PlusQwen
57.4±8.7
90.0%35.6%9.188.5%69.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
11Claude Opus 4.7 MaxAnthropic
56.7±8.7
75.812.046.991.442.375.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
12Qwen3.6 PlusQwen
56.6±8.1
88.2%27.8%2.988.5%72.362.068.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
13Claude Opus 4.8Anthropic
56.4±8.7
72.192.0%48.7%20.949.873.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
14GPT-5.4OpenAI
56.2±8.7
74.087.1%30.8%23.439.877.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
15Kimi K2.5MoonshotAI
55.5±8.3
87.9%30.7%3.187.1%73.061.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
16GPT-5.1 CodexOpenAI
55.3±8.7
86.0%25.7%5.786.0%69.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
17DeepSeek V4 ProDeepSeek
54.8±9.0
92.8%41.0%82.9%44.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
18GPT-5.6 LunaOpenAI
54.4±8.7
59.585.9%25.8%20.678.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
19GLM-4.7Z.ai
54.4±8.7
85.9%27.4%1.785.6%68.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
20Qwen3.6 27BQwen
54.4±8.7
82.9%15.1%1.186.2%73.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
21Grok 4.5SpaceXAI
54.4±8.7
52.693.1%42.7%15.474.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
22O3OpenAI
54.3±8.7
82.7%20.1%1.185.3%73.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
23Gemini 2.5 ProGoogle
54.2±8.7
84.4%22.5%2.686.2%66.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
24Gemini 3 ProGoogle
54.1±6.4
31.190.8%39.7%9.189.8%73.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
25GPT-5.1OpenAI
54±8.7
64.3%5.3%4.987.0%76.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
26DeepSeek V4 FlashDeepSeek
53.7±9.0
90.8%38.6%83.0%37.5RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
27Qwen3.5-27BQwen
53.6±8.3
85.8%23.9%0.986.1%72.360.6RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
28GPT-5.2OpenAI
53.5±6.4
52.986.4%26.7%11.681.4%79.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
29Claude Opus 4.6Anthropic
53.4±8.7
89.6%39.9%2.840.082.0%62.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
30Gemini 3.5 FlashGoogle
53.4±8.4
72.192.1%41.3%13.169.326.6RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
31Qwen3.5-122B-A10BQwen
53.1±8.3
85.7%25.2%0.686.7%70.360.2RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
32GPT-5OpenAI
52.7±8.7
68.6%6.6%5.782.0%76.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
33Qwen3.6 35B A3BQwen
52.4±8.7
81.7%13.9%0.385.2%66.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
34Qwen3.5
52.3±8.1
45.6%2.6%1.787.8%72.763.268.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
35Gemini 3 FlashGoogle
52.2±8.7
81.2%15.0%1.488.2%53.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
36Qwen3.5-35B-A3BQwen
51.2±8.3
84.5%21.0%0.985.3%68.359.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
37DeepSeek V3.2DeepSeek
51±8.7
87.1%28.7%0.986.3%42.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
38Inkling SmallThinking Machines
50.9±8.7
40.189.5%33.3%8.331.669.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
39O1OpenAI
50.7±8.7
76.5%7.0%0.384.8%63.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
40DeepSeek R1DeepSeek
50.2±8.7
70.8%8.5%1.484.9%56.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
41Claude Sonnet 4.6Anthropic
49.8±8.7
79.7%11.2%0.979.2%62.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
42gpt-oss-120bOpenAI
49.2±8.7
78.2%19.6%1.180.8%51.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
43Gemini 2.5 FlashGoogle
48.9±8.7
76.6%8.7%1.483.6%48.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
44GLM-5Z.ai
48.9±8.1
66.6%7.6%2.085.7%70.760.863.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
45Qwen3 MaxQwen
48.9±8.7
76.4%11.9%0.084.1%48.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
46DeepSeek V3.1DeepSeek
48.7±8.7
77.9%14.3%0.083.3%46.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
47Kimi K2MoonshotAI
48.6±8.7
76.6%7.4%0.082.4%53.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
48GPT-4.1OpenAI
48.5±8.7
66.6%4.2%0.080.6%64.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
49MiMo-V2-Flash
48.4±8.7
84.6%22.8%0.084.3%35.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
50Claude Sonnet 4Anthropic
47.4±8.7
68.3%4.3%1.183.7%45.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
51GLM-4.5 AirZ.ai
47±8.7
73.3%7.0%0.081.5%45.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
52Llama 4 MaverickMeta
46.8±8.7
67.1%4.9%0.080.9%50.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
53Command ACohere
45.5±8.7
76.1%12.0%0.371.2%48.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
54GPT-4.1 MiniOpenAI
45.4±8.7
66.4%5.0%0.078.1%45.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
55Mistral Large 3
44.5±8.7
68.0%4.2%0.080.7%34.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
56DeepSeek V3
44.4±8.7
65.5%4.7%0.081.9%31.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
57gpt-oss-20bOpenAI
44.2±8.7
68.8%11.0%1.474.8%33.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
58GLM-4.6Z.ai
42.8±8.7
63.2%5.5%0.078.4%28.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
59Mistral Medium 3Mistral
42.3±8.7
57.8%4.1%0.076.0%31.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
60Llama 4 ScoutMeta
41.8±8.7
58.7%3.8%0.075.2%30.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
61GPT-4oOpenAI
39.9±8.7
51.1%2.7%0.077.3%0.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
62DeepSeek R1 Distill QwenDeepSeek
39.1±8.9
48.4%4.1%74.0%8.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
63Phi 4Microsoft
39.1±8.7
57.5%3.8%0.071.4%0.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
64GPT-4.1 NanoOpenAI
37.6±8.7
51.2%3.8%0.065.7%19.3RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Estimated-модели — без места36
Qwen3.8 MaxQwen
64.5±10.1
92.7%43.0%20.043.674.366.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Muse Spark 1.2Meta
61.3±10.8
90.4%45.5%17.783.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Fable 5Anthropic
60.6±10.8
92.6%55.5%28.676.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3 Flash PreviewGoogle
60.2±11.1
89.8%36.6%89.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3.6 FlashGoogle
59.7±10.8
92.8%40.8%10.679.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.3 CodexOpenAI
59.7±10.8
91.5%42.5%16.978.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Muse Spark 1.1Meta
59.5±10.2
89.8%46.2%15.152.281.354.1EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3.7 FlashGoogle
59.3±10.8
90.1%35.1%14.380.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Grok 4.6SpaceXAI
59.3±10.8
93.5%44.1%17.175.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K3MoonshotAI
59.3±10.8
84.2%25.0%23.443.582.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiniMax M3MiniMax
59.2±10.8
92.9%39.0%3.780.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.4 ProOpenAI
59.1±11.3
83.358.7%30.042.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.2 CodexOpenAI
58.7±10.8
89.9%35.7%8.779.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K2.7 CodeMoonshotAI
57.5±10.8
89.6%35.0%10.075.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiniMax M2.1MiniMax
56.8±11.1
83.0%23.2%87.5%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Hy3Tencent
56.7±10.8
89.7%33.5%4.974.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5 CodexOpenAI
56.7±11.1
83.7%27.8%86.5%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Sonnet 5Anthropic
56.3±10.8
80.0%19.0%16.943.277.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Muse Glimmer 30BMeta
56.1±10.8
2.683.522.080.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.7Anthropic
55.9±10.8
88.5%33.3%5.172.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.4 MiniOpenAI
55.6±10.8
87.5%28.1%10.028.273.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.6 Max PreviewQwen
55.5±10.8
88.8%30.8%3.772.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K2 ThinkingMoonshotAI
55.5±11.1
83.8%23.8%84.8%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
InklingThinking Machines
55.4±10.8
87.2%31.9%5.430.073.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 2.5 Pro Preview 06-05Google
55.4±11.1
83.6%18.0%85.8%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K2.6MoonshotAI
55.3±10.8
78.8%19.6%8.076.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3 Max ThinkingQwen
55.1±11.1
86.1%28.0%82.4%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiniMax M2.7MiniMax
54.6±10.8
87.4%29.6%0.675.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-5.2Z.ai
54.5±10.8
68.6%9.8%20.940.576.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.1 Codex MaxOpenAI
54.3±10.8
5.786.025.769.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Grok 4.3SpaceXAI
54.3±10.8
89.0%30.0%8.064.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiMo-V2.5-ProXiaomi
54.2±10.8
76.2%14.8%4.034.077.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek V3.1 TerminusDeepSeek
54.1±11.1
79.2%16.4%85.1%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek V3.2 ExpDeepSeek
54±11.1
79.7%14.9%85.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-5.1Z.ai
53.8±10.8
83.9%27.9%4.668.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3 235B A22B Instruct 2507Qwen
53.6±11.1
79.0%15.9%84.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.

Что измеряет этот рейтинг

Какая AI-модель лучше подходит для сложного рассуждения?

Рейтинг охватывает логику, причинность, многошаговые ограничения и проверку свидетельств. Он не измеряет все способности модели.

Доступные данные покрывают 4/4 измерений и показывают 12 столбцов бенчмарков.

Четыре измерения способности

Четыре измерения заданы схемой категории. Доступные данные могут покрывать только часть из них. Измерение без свидетельств не считается подтверждённой способностью.

Абстрактная логика

Сейчас это измерение поддерживают 1 столбцов бенчмарков.

  • ARC-AGI-2

Научное и причинное рассуждение

Сейчас это измерение поддерживают 6 столбцов бенчмарков.

  • GPQA
  • HLE
  • CritPt
  • HLE w/o tools
  • AA-GPQA Diamond
  • AA-HLE

Многошаговые ограничения

Сейчас это измерение поддерживают 1 столбцов бенчмарков.

  • MMLU-Pro

Интеграция и проверка свидетельств

Сейчас это измерение поддерживают 4 столбцов бенчмарков.

  • AA-LCR
  • LongBench v2
  • MRCR 1M
  • AI-Needle

Задачи рассуждения для сравнения

  • Сложный анализ с несколькими условиями и связанными выводами.
  • Научные вопросы с причинностью, гипотезами и свидетельствами.
  • Проверка выводов, поиск пробелов и оценка силы доказательств.

Как выбрать модель по этому рейтингу

  1. Шаг 1

    Сначала проверьте статус

    Только Rated-модели получают место. Estimated и Provisional не имеют формальной позиции.

  2. Шаг 2

    Затем изучите интервал и свидетельства

    Если оценки близки, не смотрите только на место. Проверьте неопределённость, измерения и число бенчмарков.

  3. Шаг 3

    В конце проверьте реальную задачу

    Рейтинг не заменяет ваш тест. Вместе проверяйте качество, скорость, цену, контекст и ограничения провайдера.

Не смотрите только на высокий балл. Учитывайте интервал, тип задачи, стабильность ответа и цену проверки.

Что означают статусы

Rated

Rated означает, что правила по свидетельствам и пересечениям выполнены. Модель может получить формальный ранг.

Estimated

Estimated означает, что полезные свидетельства есть, но их недостаточно для формального ранга.

Provisional

Provisional означает мало свидетельств или недостаточное покрытие аспектов и семейств бенчмарков для статуса Estimated. Это только ранний сигнал.

Бенчмарки и источники свидетельств

Названия источников и группы бенчмарков взяты из доступных данных оценки. Один источник может дать несколько бенчмарков.

  • Artificial Analysis

    GPQA, HLE и MMLU-Pro

  • BenchLM

    AA-GPQA Diamond, AA-HLE, AA-LCR, AI-Needle, ARC-AGI-2, CritPt, GPQA, HLE, HLE w/o tools, LongBench v2, MMLU-Pro и MRCR 1M

Как строится рейтинг моделей рассуждения

LMSpeed объединяет подходящие сторонние бенчмарки в четырёх фиксированных измерениях. Rated-модели получают формальный ранг, а Estimated и Provisional остаются видимыми без позиции.

Подробнее о методологии Category Score

Ограничения рейтинга

Category Score использует сторонние бенчмарки, которые сейчас включены в LMSpeed. Тесты могут отличаться данными, запросами и правилами оценки. Результат не вечный и не описывает каждую реальную задачу. Важный выбор проверяйте на своих данных.

Частые вопросы

Какая доступная модель имеет самый высокий формальный ранг?

Среди доступных моделей самый высокий формальный ранг у GPT-5.6 Sol. Глобальная позиция 1, а Category Score равен 61.2. Правила формального рейтинга выполняют 64 доступных моделей. Результат относится только к дате и версии методики на странице.

Можно ли сравнивать оценки разных категорий?

Нет. Каждая категория использует свои измерения и свидетельства. Category Score сравним только внутри одной таблицы. Для другой задачи откройте её категорию.

Полезны ли Estimated и Provisional модели?

Они помогают найти кандидатов, но свидетельств пока недостаточно для формального ранга. Сначала изучите покрытие и неопределённость, затем проверьте модель на реальной задаче.

Как часто обновляется рейтинг?

Рейтинг обновляется после публикации нового завершённого запуска. Дата и версия методики указаны выше. LMSpeed не обещает фиксированное ежедневное или еженедельное обновление.

Модель на первом месте всегда лучше для меня?

Нет. Результат также зависит от скорости, цены, длины контекста, инструментов, региона и ограничений провайдера. Сначала сократите список, затем проведите свой тест.

Оценка рассуждения совпадает с оценкой математики?

Нет. Математика является отдельной категорией. Рейтинг рассуждения также проверяет логику, причинность, ограничения и свидетельства. Высокая математика не гарантирует лучший результат во всех задачах.