При поддержкеFusecodeКорпоративный API для Claude Code, Codex и модельных рабочих процессов.
LogoLMSpeed
  • Бесплатные
  • Модели
  • Провайдеры
  • Рейтинги
LogoLMSpeed
  1. Главная
  2. Рейтинг
  3. Best Model For Reasoning
LogoLMSpeed

Лучший инструмент для проверки скорости API

GitHubGitHubTwitterX (Twitter)Email
Продукт
  • Возможности
  • Цены
  • FAQ
Рейтинги
  • Обзор
  • Рейтинг скорости
  • Рейтинг задержки
  • Рейтинг стабильности
  • Цены моделей
  • Скорость моделей
  • Reasoning
  • Coding
Модели
  • Все модели
  • GPT
  • Claude
  • Gemini
  • DeepSeek
  • Llama
  • Qwen
Бесплатные модели
  • Все бесплатные модели
  • Бесплатный GPT
  • Бесплатный Claude
  • Бесплатный Gemini
  • Бесплатный DeepSeek
  • Бесплатный Llama
  • Бесплатный Qwen
Tools
  • Speed Test
  • Provider Audit
Компания
  • О нас
Ресурсы
  • Каталог провайдеров
  • Документация
  • Публичный API
  • Botab
  • VidBee
Правовая информация
  • Политика cookie
  • Политика конфиденциальности
  • Условия использования
© 2026 LMSpeed All Rights Reserved.Made by Nexmoe with ❤️
АгентыКодингРассуждениеЗнанияМатематикаМультиязычностьМультимодальностьСледование инструкциям

Рейтинг Category Score V3

LMSpeed Лучшие модели для рассуждений

Сравните модели по абстрактной логике, научному рассуждению, многошаговым ограничениям и проверке свидетельств с учётом неопределённости.

Обновлено 9 августа 2026 г.·Методология 3.0·Методология

Текущий вывод

Среди доступных моделей самый высокий формальный ранг у GPT-5.6 Sol. Глобальная позиция 1. Category Score равен 61.7, а 80% интервал неопределённости равен ±8.7. Формальный ранг получили 62 доступных моделей. Вывод относится только к этому запуску.

Открыть данные GPT-5.6 SolРейтинг меняется вместе с данными и методикой. Дата запуска указана выше.

Доступные данные рейтинга

Показано моделей
100
Моделей с формальным рангом
62
Столбцов бенчмарков
12
Измерений со свидетельствами
4/4

Как читать полосы бенчмарков

Каждая полоса сравнивает модели только внутри одного столбца бенчмарка. Длина рассчитана относительно показанных моделей, не является Category Score и несопоставима между столбцами.

МестоМодельОценка LMSpeedАбстрактная логикаНаучное и причинное рассуждениеМногошаговые ограниченияИнтеграция и проверка свидетельствСтатусПокрытиеОбновлено
ARC-AGI-2Моделей: 17GPQAМоделей: 199HLEМоделей: 198CritPtМоделей: 98HLE w/o toolsМоделей: 20AA-GPQA DiamondМоделей: 5AA-HLEМоделей: 5MMLU-ProМоделей: 125AA-LCRМоделей: 97LongBench v2Моделей: 9AI-NeedleМоделей: 4MRCR 1MМоделей: 4
Модели с формальным рейтингом62
1OpenAIGPT-5.6 SolOpenAI
61.7±8.7
92.593.1%47.3%32.3————73.7———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
2ClaudeClaude Opus 4.5Anthropic
61.4±8.1
—86.6%30.1%0.3———89.5%65.364.474.0—RatedИзмерения: 3/4 · семейств: 79 авг. 2026 г.
3ClaudeClaude Opus 5Anthropic
60.6±8.7
90.491.9%51.3%29.156.3———70.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
4QwenQwen3.7 MaxQwen
60±8.7
—92.3%40.5%13.4———89.6%69.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
5OpenAIGPT-5.5OpenAI
59.6±8.7
85.092.6%42.4%27.141.4———74.3———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
6OpenAIGPT-5.6 TerraOpenAI
59±8.7
83.989.6%38.5%30.0————74.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
7GeminiGemini 3.1 ProGoogle
58.3±8.7
77.1——17.745.494.144.7—72.7———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
8QwenQwen3.7 PlusQwen
58.1±8.7
—90.0%35.6%9.1———88.5%65.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
9QwenQwen3.6 PlusQwen
57.4±8.1
—88.2%27.8%2.9———88.5%69.762.068.3—RatedИзмерения: 3/4 · семейств: 79 авг. 2026 г.
10ClaudeClaude Opus 4.7 MaxAnthropic
57±8.7
75.8——12.046.991.439.6—70.3———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
11OpenAIGPT-5.4OpenAI
56.8±8.7
74.087.1%30.8%23.439.8———74.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
12ClaudeClaude Opus 4.8Anthropic
56.8±8.7
72.192.0%48.7%20.949.8———67.7———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
13OpenAIGPT-5.1 CodexOpenAI
56.3±8.7
—86.0%25.7%5.7———86.0%67.3———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
14DeepSeekDeepSeek V4 FlashDeepSeek
56.1±8.4
—90.8%38.6%16.6———83.0%65.7——37.5RatedИзмерения: 3/4 · семейств: 69 авг. 2026 г.
15MoonshotAIKimi K2.5MoonshotAI
55.7±8.3
—87.9%30.7%3.1———87.1%65.361.0——RatedИзмерения: 3/4 · семейств: 69 авг. 2026 г.
16GeminiGemini 2.5 ProGoogle
55.4±8.7
—84.4%22.5%2.6———86.2%66.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
17OpenAIGPT-5.1OpenAI
55.1±8.7
—64.3%5.3%4.9———87.0%75.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
18ChatGLMGLM-4.7Z.ai
55±8.7
—85.9%27.4%1.7———85.6%64.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
19OpenAIGPT-5.6 LunaOpenAI
54.9±8.7
59.585.9%25.8%20.6————74.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
20OpenAIO3OpenAI
54.9±8.7
—82.7%20.1%1.1———85.3%69.3———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
21QwenQwen3.6 27BQwen
54.9±8.7
—82.9%15.1%1.1———86.2%68.7———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
22GeminiGemini 3 ProGoogle
54.8±6.4
31.190.8%39.7%9.1———89.8%70.7———RatedИзмерения: 4/4 · семейств: 69 авг. 2026 г.
23GrokGrok 4.5SpaceXAI
54.5±8.7
52.693.1%42.7%15.4————67.7———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
24QwenQwen3.5-27BQwen
54±8.3
—85.8%23.9%0.9———86.1%67.360.6——RatedИзмерения: 3/4 · семейств: 69 авг. 2026 г.
25ClaudeClaude Opus 4.6Anthropic
53.8±8.7
—89.6%39.9%2.840.0——82.0%58.3———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
26DeepSeekDeepSeek V4 ProDeepSeek
53.8±8.4
—71.7%8.2%10.0———82.9%65.0——44.7RatedИзмерения: 3/4 · семейств: 69 авг. 2026 г.
27QwenQwen3.5-122B-A10BQwen
53.7±8.3
—85.7%25.2%0.6———86.7%66.760.2——RatedИзмерения: 3/4 · семейств: 69 авг. 2026 г.
28OpenAIGPT-5.2OpenAI
53.5±6.4
52.986.4%26.7%11.6———81.4%72.7———RatedИзмерения: 4/4 · семейств: 69 авг. 2026 г.
29GeminiGemini 3.5 FlashGoogle
53.5±8.4
72.192.1%41.3%13.1————69.3——26.6RatedИзмерения: 3/4 · семейств: 69 авг. 2026 г.
30QwenQwen3.6 35B A3BQwen
53±8.7
—81.7%13.9%0.3———85.2%63.7———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
31QwenQwen3.5
52.6±8.1
—45.6%2.6%1.7———87.8%65.763.268.7—RatedИзмерения: 3/4 · семейств: 79 авг. 2026 г.
32GeminiGemini 3 FlashGoogle
52.4±8.7
—81.2%15.0%1.4———88.2%48.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
33OpenAIGPT-5OpenAI
52±8.7
—68.6%6.6%0.0———82.0%72.8———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
34QwenQwen3.5-35B-A3BQwen
51.6±8.3
—84.5%21.0%0.9———85.3%62.759.0——RatedИзмерения: 3/4 · семейств: 69 авг. 2026 г.
35DeepSeekDeepSeek V3.2DeepSeek
51.2±8.7
—87.1%28.7%0.9———86.3%39.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
36Inkling SmallThinking Machines
51±8.7
40.189.5%33.3%8.331.6———63.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
37DeepSeekDeepSeek R1DeepSeek
50.9±8.7
—70.8%8.5%1.4———84.9%54.7———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
38OpenAIO1OpenAI
50.8±8.7
—74.7%7.0%0.3———84.1%59.3———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
39ClaudeClaude Sonnet 4.6Anthropic
50.1±8.7
—79.7%11.2%0.9———79.2%57.7———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
40OpenAIgpt-oss-120bOpenAI
50±8.7
—78.2%19.6%1.1———80.8%50.7———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
41QwenQwen3 MaxQwen
49.5±8.7
—76.4%11.9%0.0———84.1%46.7———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
42GeminiGemini 2.5 FlashGoogle
49.5±8.7
—76.6%8.7%1.4———83.6%45.9———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
43DeepSeekDeepSeek V3.1DeepSeek
49.2±8.7
—77.9%14.3%0.0———83.3%45.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
44ChatGLMGLM-5Z.ai
49.1±8.1
—66.6%7.6%2.0———85.7%63.360.863.3—RatedИзмерения: 3/4 · семейств: 79 авг. 2026 г.
45MoonshotAIKimi K2MoonshotAI
49.1±8.7
—76.6%7.4%0.0———82.4%51.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
46OpenAIGPT-4.1OpenAI
49±8.7
—66.6%4.2%0.0———80.6%61.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
47MiMo-V2-Flash
48.3±8.7
—84.6%22.8%0.0———84.3%31.3———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
48ClaudeClaude Sonnet 4Anthropic
48±8.7
—68.3%4.3%1.1———83.7%44.3———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
49ChatGLMGLM-4.5 AirZ.ai
47.5±8.7
—73.3%7.0%0.0———81.5%43.7———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
50MetaAILlama 4 MaverickMeta
47±8.7
—67.1%4.9%0.0———80.9%46.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
51CohereCommand ACohere
45.8±8.7
—76.1%12.0%0.3———71.2%46.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
52OpenAIGPT-4.1 MiniOpenAI
45.6±8.7
—66.4%5.0%0.0———78.1%42.3———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
53MistralMistral Large 3
45±8.7
—68.0%4.2%0.0———80.7%34.7———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
54DeepSeekDeepSeek V3
44.4±8.7
—65.5%4.7%0.0———81.9%29.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
55OpenAIgpt-oss-20bOpenAI
44.2±8.7
—68.8%11.0%1.4———74.8%30.7———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
56ChatGLMGLM-4.6Z.ai
42.9±8.7
—63.2%5.5%0.0———78.4%26.3———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
57MistralMistral Medium 3Mistral
42±8.7
—57.8%4.1%0.0———76.0%28.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
58MetaAILlama 4 ScoutMeta
41.4±8.7
—58.7%3.8%0.0———75.2%25.8———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
59OpenAIGPT-4oOpenAI
40.1±8.7
—51.1%2.7%0.0———77.3%0.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
60QwenDeepSeek R1 Distill QwenDeepSeek
39.3±8.9
—48.4%4.1%————74.0%9.7———RatedИзмерения: 3/4 · семейств: 49 авг. 2026 г.
61AzurePhi 4Microsoft
39.2±8.7
—57.5%3.8%0.0———71.4%0.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
62OpenAIGPT-4.1 NanoOpenAI
37.7±8.7
—51.2%3.8%0.0———65.7%17.0———RatedИзмерения: 3/4 · семейств: 59 авг. 2026 г.
Estimated-модели — без места38
—QwenQwen3.8 MaxQwen
65.9±11.3
—92.7%43.0%—43.6————66.3——EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—SparkMuse Spark 1.1Meta
61.4±10.2
—89.8%46.2%15.152.2———63.3——54.1EstimatedИзмерения: 2/4 · семейств: 59 авг. 2026 г.
—ClaudeClaude Fable 5Anthropic
60.7±10.8
—92.6%55.5%28.6————70.0———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—GeminiGemini 3 Flash PreviewGoogle
60.7±11.1
—89.8%36.6%————89.0%————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—OpenAIGPT-5.3 CodexOpenAI
60.4±10.8
—91.5%42.5%16.9————74.0———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—OpenAIGPT-5.2 CodexOpenAI
59.6±10.8
—89.9%35.7%8.7————75.7———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—OpenAIGPT-5.4 ProOpenAI
59.5±11.3
83.3—58.7%30.042.7———————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—MinimaxMiniMax M3MiniMax
59.2±10.8
—92.9%39.0%3.7————74.0———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—GeminiGemini 3.6 FlashGoogle
59±10.8
—92.8%40.8%10.6————69.7———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—MoonshotAIKimi K3MoonshotAI
58.8±10.8
—84.2%25.0%23.443.5———74.7———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—MinimaxMiniMax M2.1MiniMax
57.2±11.1
—83.0%23.2%————87.5%————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—OpenAIGPT-5 CodexOpenAI
57.1±11.1
—83.7%27.8%————86.5%————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—MoonshotAIKimi K2.7 CodeMoonshotAI
57±10.8
—89.6%35.0%10.0————66.3———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—QwenQwen3.6 Max PreviewQwen
56.6±10.8
—88.8%30.8%3.7————69.7———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—ClaudeClaude Sonnet 5Anthropic
56.5±10.8
—80.0%19.0%16.943.2———70.7———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—HunyuanHy3Tencent
56.4±10.8
—89.7%33.5%4.9————66.7———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—OpenAIGPT-5.4 MiniOpenAI
56.4±10.8
—87.5%28.1%10.028.2———69.3———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—ClaudeClaude Opus 4.7Anthropic
56.3±10.8
—88.5%33.3%5.1————67.0———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—GrokGrok 4.3SpaceXAI
55.9±10.8
—89.0%30.0%8.0————64.3———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—MoonshotAIKimi K2 ThinkingMoonshotAI
55.8±11.1
—83.8%23.8%————84.8%————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—GeminiGemini 2.5 Pro Preview 06-05Google
55.8±11.1
—83.6%18.0%————85.8%————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—OpenAIGPT-5.1 Codex MaxOpenAI
55.5±10.8
———5.7—86.023.4—67.3———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—QwenQwen3 Max ThinkingQwen
55.4±11.1
—86.1%28.0%————82.4%————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—MoonshotAIKimi K2.6MoonshotAI
55.2±10.8
—78.8%19.6%8.0————69.7———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—ChatGLMGLM-5.2Z.ai
54.9±10.8
—68.6%9.8%20.940.5———71.3———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—MiMo-V2.5-ProXiaomi
54.8±10.8
—76.2%14.8%4.034.0———73.3———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—MinimaxMiniMax M2.7MiniMax
54.6±10.8
—87.4%29.6%0.6————68.7———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—InklingThinking Machines
54.5±10.8
—87.2%31.9%5.430.0———63.3———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—DeepSeekDeepSeek V3.1 TerminusDeepSeek
54.5±11.1
—79.2%16.4%————85.1%————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—DeepSeekDeepSeek V3.2 ExpDeepSeek
54.3±11.1
—79.7%14.9%————85.0%————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—ChatGLMGLM-5.1Z.ai
54±10.8
—83.9%27.9%4.6————62.3———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—QwenQwen3 235B A22B Instruct 2507Qwen
53.9±11.1
—79.0%15.9%————84.3%————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—OpenAIGPT-5 MiniOpenAI
53.8±11.1
—80.3%15.9%————83.7%————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—OpenAIGPT-5.1 Codex MiniOpenAI
53.4±11.1
—81.3%18.5%————82.0%————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—MiMo-V2-Omni
53.4±10.8
—82.8%22.1%1.1————66.7———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.
—OpenAIO4 MiniOpenAI
53.4±11.1
—78.4%16.5%————83.2%————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—ChatGLMGLM-4.5Z.ai
53±11.1
—78.2%13.0%————83.5%————EstimatedИзмерения: 2/4 · семейств: 39 авг. 2026 г.
—StepfunStep 3.7 FlashStepFun
53±10.8
—80.9%21.4%2.3————63.7———EstimatedИзмерения: 2/4 · семейств: 49 авг. 2026 г.

Что измеряет этот рейтинг

Какая AI-модель лучше подходит для сложного рассуждения?

Рейтинг охватывает логику, причинность, многошаговые ограничения и проверку свидетельств. Он не измеряет все способности модели.

Доступные данные покрывают 4/4 измерений и показывают 12 столбцов бенчмарков.

Четыре измерения способности

Четыре измерения заданы схемой категории. Доступные данные могут покрывать только часть из них. Измерение без свидетельств не считается подтверждённой способностью.

Абстрактная логика

Сейчас это измерение поддерживают 1 столбцов бенчмарков.

  • ARC-AGI-2

Научное и причинное рассуждение

Сейчас это измерение поддерживают 6 столбцов бенчмарков.

  • GPQA
  • HLE
  • CritPt
  • HLE w/o tools
  • AA-GPQA Diamond
  • AA-HLE

Многошаговые ограничения

Сейчас это измерение поддерживают 1 столбцов бенчмарков.

  • MMLU-Pro

Интеграция и проверка свидетельств

Сейчас это измерение поддерживают 4 столбцов бенчмарков.

  • AA-LCR
  • LongBench v2
  • AI-Needle
  • MRCR 1M

Задачи рассуждения для сравнения

  • Сложный анализ с несколькими условиями и связанными выводами.
  • Научные вопросы с причинностью, гипотезами и свидетельствами.
  • Проверка выводов, поиск пробелов и оценка силы доказательств.

Как выбрать модель по этому рейтингу

  1. Шаг 1

    Сначала проверьте статус

    Только Rated-модели получают место. Estimated и Provisional не имеют формальной позиции.

  2. Шаг 2

    Затем изучите интервал и свидетельства

    Если оценки близки, не смотрите только на место. Проверьте неопределённость, измерения и число бенчмарков.

  3. Шаг 3

    В конце проверьте реальную задачу

    Рейтинг не заменяет ваш тест. Вместе проверяйте качество, скорость, цену, контекст и ограничения провайдера.

Не смотрите только на высокий балл. Учитывайте интервал, тип задачи, стабильность ответа и цену проверки.

Что означают статусы

Rated

Rated означает, что правила по свидетельствам и пересечениям выполнены. Модель может получить формальный ранг.

Estimated

Estimated означает, что полезные свидетельства есть, но их недостаточно для формального ранга.

Provisional

Provisional означает мало свидетельств или недостаточное покрытие аспектов и семейств бенчмарков для статуса Estimated. Это только ранний сигнал.

Бенчмарки и источники свидетельств

Названия источников и группы бенчмарков взяты из доступных данных оценки. Один источник может дать несколько бенчмарков.

  • Artificial Analysis

    GPQA, HLE и MMLU-Pro

  • BenchLM

    AA-GPQA Diamond, AA-HLE, AA-LCR, AI-Needle, ARC-AGI-2, CritPt, GPQA, HLE, HLE w/o tools, LongBench v2, MMLU-Pro и MRCR 1M

Как строится рейтинг моделей рассуждения

LMSpeed объединяет подходящие сторонние бенчмарки в четырёх фиксированных измерениях. Rated-модели получают формальный ранг, а Estimated и Provisional остаются видимыми без позиции.

Подробнее о методологии Category Score

Ограничения рейтинга

Category Score использует сторонние бенчмарки, которые сейчас включены в LMSpeed. Тесты могут отличаться данными, запросами и правилами оценки. Результат не вечный и не описывает каждую реальную задачу. Важный выбор проверяйте на своих данных.

Частые вопросы

Какая доступная модель имеет самый высокий формальный ранг?

Среди доступных моделей самый высокий формальный ранг у GPT-5.6 Sol. Глобальная позиция 1, а Category Score равен 61.7. Правила формального рейтинга выполняют 62 доступных моделей. Результат относится только к дате и версии методики на странице.

Можно ли сравнивать оценки разных категорий?

Нет. Каждая категория использует свои измерения и свидетельства. Category Score сравним только внутри одной таблицы. Для другой задачи откройте её категорию.

Полезны ли Estimated и Provisional модели?

Они помогают найти кандидатов, но свидетельств пока недостаточно для формального ранга. Сначала изучите покрытие и неопределённость, затем проверьте модель на реальной задаче.

Как часто обновляется рейтинг?

Рейтинг обновляется после публикации нового завершённого запуска. Дата и версия методики указаны выше. LMSpeed не обещает фиксированное ежедневное или еженедельное обновление.

Модель на первом месте всегда лучше для меня?

Нет. Результат также зависит от скорости, цены, длины контекста, инструментов, региона и ограничений провайдера. Сначала сократите список, затем проведите свой тест.

Оценка рассуждения совпадает с оценкой математики?

Нет. Математика является отдельной категорией. Рейтинг рассуждения также проверяет логику, причинность, ограничения и свидетельства. Высокая математика не гарантирует лучший результат во всех задачах.