Рейтинг Category Score V3
LMSpeed Лучшие модели для рассуждений
Сравните модели по абстрактной логике, научному рассуждению, многошаговым ограничениям и проверке свидетельств с учётом неопределённости.
Методология 3.0Методология
Текущий вывод
Среди доступных моделей самый высокий формальный ранг у GPT-5.6 Sol. Глобальная позиция 1. Category Score равен 61.7, а 80% интервал неопределённости равен ±8.7. Формальный ранг получили 62 доступных моделей. Вывод относится только к этому запуску.
Доступные данные рейтинга
- Показано моделей
- 100
- Моделей с формальным рангом
- 62
- Столбцов бенчмарков
- 12
- Измерений со свидетельствами
- 4/4
Как читать полосы бенчмарков
Каждая полоса сравнивает модели только внутри одного столбца бенчмарка. Длина рассчитана относительно показанных моделей, не является Category Score и несопоставима между столбцами.
| Место | Модель | Оценка LMSpeed | Абстрактная логика | Научное и причинное рассуждение | Многошаговые ограничения | Интеграция и проверка свидетельств | Статус | Покрытие | Обновлено | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ARC-AGI-2Моделей: 17 | GPQAМоделей: 199 | HLEМоделей: 198 | CritPtМоделей: 98 | HLE w/o toolsМоделей: 20 | AA-GPQA DiamondМоделей: 5 | AA-HLEМоделей: 5 | MMLU-ProМоделей: 125 | AA-LCRМоделей: 97 | LongBench v2Моделей: 9 | AI-NeedleМоделей: 4 | MRCR 1MМоделей: 4 | ||||||
| Модели с формальным рейтингом62 | |||||||||||||||||
| 1 | GPT-5.6 SolOpenAI | 61.7±8.7 | 92.5 | 93.1% | 47.3% | 32.3 | — | — | — | — | 73.7 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 2 | Claude Opus 4.5Anthropic | 61.4±8.1 | — | 86.6% | 30.1% | 0.3 | — | — | — | 89.5% | 65.3 | 64.4 | 74.0 | — | Rated | Измерения: 3/4 · семейств: 7 | 9 авг. 2026 г. |
| 3 | Claude Opus 5Anthropic | 60.6±8.7 | 90.4 | 91.9% | 51.3% | 29.1 | 56.3 | — | — | — | 70.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 4 | Qwen3.7 MaxQwen | 60±8.7 | — | 92.3% | 40.5% | 13.4 | — | — | — | 89.6% | 69.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 5 | GPT-5.5OpenAI | 59.6±8.7 | 85.0 | 92.6% | 42.4% | 27.1 | 41.4 | — | — | — | 74.3 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 6 | GPT-5.6 TerraOpenAI | 59±8.7 | 83.9 | 89.6% | 38.5% | 30.0 | — | — | — | — | 74.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 7 | Gemini 3.1 ProGoogle | 58.3±8.7 | 77.1 | — | — | 17.7 | 45.4 | 94.1 | 44.7 | — | 72.7 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 8 | Qwen3.7 PlusQwen | 58.1±8.7 | — | 90.0% | 35.6% | 9.1 | — | — | — | 88.5% | 65.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 9 | Qwen3.6 PlusQwen | 57.4±8.1 | — | 88.2% | 27.8% | 2.9 | — | — | — | 88.5% | 69.7 | 62.0 | 68.3 | — | Rated | Измерения: 3/4 · семейств: 7 | 9 авг. 2026 г. |
| 10 | Claude Opus 4.7 MaxAnthropic | 57±8.7 | 75.8 | — | — | 12.0 | 46.9 | 91.4 | 39.6 | — | 70.3 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 11 | GPT-5.4OpenAI | 56.8±8.7 | 74.0 | 87.1% | 30.8% | 23.4 | 39.8 | — | — | — | 74.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 12 | Claude Opus 4.8Anthropic | 56.8±8.7 | 72.1 | 92.0% | 48.7% | 20.9 | 49.8 | — | — | — | 67.7 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 13 | GPT-5.1 CodexOpenAI | 56.3±8.7 | — | 86.0% | 25.7% | 5.7 | — | — | — | 86.0% | 67.3 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 14 | DeepSeek V4 FlashDeepSeek | 56.1±8.4 | — | 90.8% | 38.6% | 16.6 | — | — | — | 83.0% | 65.7 | — | — | 37.5 | Rated | Измерения: 3/4 · семейств: 6 | 9 авг. 2026 г. |
| 15 | Kimi K2.5MoonshotAI | 55.7±8.3 | — | 87.9% | 30.7% | 3.1 | — | — | — | 87.1% | 65.3 | 61.0 | — | — | Rated | Измерения: 3/4 · семейств: 6 | 9 авг. 2026 г. |
| 16 | Gemini 2.5 ProGoogle | 55.4±8.7 | — | 84.4% | 22.5% | 2.6 | — | — | — | 86.2% | 66.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 17 | GPT-5.1OpenAI | 55.1±8.7 | — | 64.3% | 5.3% | 4.9 | — | — | — | 87.0% | 75.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 18 | GLM-4.7Z.ai | 55±8.7 | — | 85.9% | 27.4% | 1.7 | — | — | — | 85.6% | 64.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 19 | GPT-5.6 LunaOpenAI | 54.9±8.7 | 59.5 | 85.9% | 25.8% | 20.6 | — | — | — | — | 74.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 20 | O3OpenAI | 54.9±8.7 | — | 82.7% | 20.1% | 1.1 | — | — | — | 85.3% | 69.3 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 21 | Qwen3.6 27BQwen | 54.9±8.7 | — | 82.9% | 15.1% | 1.1 | — | — | — | 86.2% | 68.7 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 22 | Gemini 3 ProGoogle | 54.8±6.4 | 31.1 | 90.8% | 39.7% | 9.1 | — | — | — | 89.8% | 70.7 | — | — | — | Rated | Измерения: 4/4 · семейств: 6 | 9 авг. 2026 г. |
| 23 | Grok 4.5SpaceXAI | 54.5±8.7 | 52.6 | 93.1% | 42.7% | 15.4 | — | — | — | — | 67.7 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 24 | Qwen3.5-27BQwen | 54±8.3 | — | 85.8% | 23.9% | 0.9 | — | — | — | 86.1% | 67.3 | 60.6 | — | — | Rated | Измерения: 3/4 · семейств: 6 | 9 авг. 2026 г. |
| 25 | Claude Opus 4.6Anthropic | 53.8±8.7 | — | 89.6% | 39.9% | 2.8 | 40.0 | — | — | 82.0% | 58.3 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 26 | DeepSeek V4 ProDeepSeek | 53.8±8.4 | — | 71.7% | 8.2% | 10.0 | — | — | — | 82.9% | 65.0 | — | — | 44.7 | Rated | Измерения: 3/4 · семейств: 6 | 9 авг. 2026 г. |
| 27 | Qwen3.5-122B-A10BQwen | 53.7±8.3 | — | 85.7% | 25.2% | 0.6 | — | — | — | 86.7% | 66.7 | 60.2 | — | — | Rated | Измерения: 3/4 · семейств: 6 | 9 авг. 2026 г. |
| 28 | GPT-5.2OpenAI | 53.5±6.4 | 52.9 | 86.4% | 26.7% | 11.6 | — | — | — | 81.4% | 72.7 | — | — | — | Rated | Измерения: 4/4 · семейств: 6 | 9 авг. 2026 г. |
| 29 | Gemini 3.5 FlashGoogle | 53.5±8.4 | 72.1 | 92.1% | 41.3% | 13.1 | — | — | — | — | 69.3 | — | — | 26.6 | Rated | Измерения: 3/4 · семейств: 6 | 9 авг. 2026 г. |
| 30 | Qwen3.6 35B A3BQwen | 53±8.7 | — | 81.7% | 13.9% | 0.3 | — | — | — | 85.2% | 63.7 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 31 | Qwen3.5 | 52.6±8.1 | — | 45.6% | 2.6% | 1.7 | — | — | — | 87.8% | 65.7 | 63.2 | 68.7 | — | Rated | Измерения: 3/4 · семейств: 7 | 9 авг. 2026 г. |
| 32 | Gemini 3 FlashGoogle | 52.4±8.7 | — | 81.2% | 15.0% | 1.4 | — | — | — | 88.2% | 48.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 33 | GPT-5OpenAI | 52±8.7 | — | 68.6% | 6.6% | 0.0 | — | — | — | 82.0% | 72.8 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 34 | Qwen3.5-35B-A3BQwen | 51.6±8.3 | — | 84.5% | 21.0% | 0.9 | — | — | — | 85.3% | 62.7 | 59.0 | — | — | Rated | Измерения: 3/4 · семейств: 6 | 9 авг. 2026 г. |
| 35 | DeepSeek V3.2DeepSeek | 51.2±8.7 | — | 87.1% | 28.7% | 0.9 | — | — | — | 86.3% | 39.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 36 | Inkling SmallThinking Machines | 51±8.7 | 40.1 | 89.5% | 33.3% | 8.3 | 31.6 | — | — | — | 63.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 37 | DeepSeek R1DeepSeek | 50.9±8.7 | — | 70.8% | 8.5% | 1.4 | — | — | — | 84.9% | 54.7 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 38 | O1OpenAI | 50.8±8.7 | — | 74.7% | 7.0% | 0.3 | — | — | — | 84.1% | 59.3 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 39 | Claude Sonnet 4.6Anthropic | 50.1±8.7 | — | 79.7% | 11.2% | 0.9 | — | — | — | 79.2% | 57.7 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 40 | gpt-oss-120bOpenAI | 50±8.7 | — | 78.2% | 19.6% | 1.1 | — | — | — | 80.8% | 50.7 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 41 | Qwen3 MaxQwen | 49.5±8.7 | — | 76.4% | 11.9% | 0.0 | — | — | — | 84.1% | 46.7 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 42 | Gemini 2.5 FlashGoogle | 49.5±8.7 | — | 76.6% | 8.7% | 1.4 | — | — | — | 83.6% | 45.9 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 43 | DeepSeek V3.1DeepSeek | 49.2±8.7 | — | 77.9% | 14.3% | 0.0 | — | — | — | 83.3% | 45.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 44 | GLM-5Z.ai | 49.1±8.1 | — | 66.6% | 7.6% | 2.0 | — | — | — | 85.7% | 63.3 | 60.8 | 63.3 | — | Rated | Измерения: 3/4 · семейств: 7 | 9 авг. 2026 г. |
| 45 | Kimi K2MoonshotAI | 49.1±8.7 | — | 76.6% | 7.4% | 0.0 | — | — | — | 82.4% | 51.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 46 | GPT-4.1OpenAI | 49±8.7 | — | 66.6% | 4.2% | 0.0 | — | — | — | 80.6% | 61.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 47 | MiMo-V2-Flash | 48.3±8.7 | — | 84.6% | 22.8% | 0.0 | — | — | — | 84.3% | 31.3 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 48 | Claude Sonnet 4Anthropic | 48±8.7 | — | 68.3% | 4.3% | 1.1 | — | — | — | 83.7% | 44.3 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 49 | GLM-4.5 AirZ.ai | 47.5±8.7 | — | 73.3% | 7.0% | 0.0 | — | — | — | 81.5% | 43.7 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 50 | Llama 4 MaverickMeta | 47±8.7 | — | 67.1% | 4.9% | 0.0 | — | — | — | 80.9% | 46.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 51 | Command ACohere | 45.8±8.7 | — | 76.1% | 12.0% | 0.3 | — | — | — | 71.2% | 46.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 52 | GPT-4.1 MiniOpenAI | 45.6±8.7 | — | 66.4% | 5.0% | 0.0 | — | — | — | 78.1% | 42.3 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 53 | Mistral Large 3 | 45±8.7 | — | 68.0% | 4.2% | 0.0 | — | — | — | 80.7% | 34.7 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 54 | DeepSeek V3 | 44.4±8.7 | — | 65.5% | 4.7% | 0.0 | — | — | — | 81.9% | 29.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 55 | gpt-oss-20bOpenAI | 44.2±8.7 | — | 68.8% | 11.0% | 1.4 | — | — | — | 74.8% | 30.7 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 56 | GLM-4.6Z.ai | 42.9±8.7 | — | 63.2% | 5.5% | 0.0 | — | — | — | 78.4% | 26.3 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 57 | Mistral Medium 3Mistral | 42±8.7 | — | 57.8% | 4.1% | 0.0 | — | — | — | 76.0% | 28.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 58 | Llama 4 ScoutMeta | 41.4±8.7 | — | 58.7% | 3.8% | 0.0 | — | — | — | 75.2% | 25.8 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 59 | GPT-4oOpenAI | 40.1±8.7 | — | 51.1% | 2.7% | 0.0 | — | — | — | 77.3% | 0.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 60 | DeepSeek R1 Distill QwenDeepSeek | 39.3±8.9 | — | 48.4% | 4.1% | — | — | — | — | 74.0% | 9.7 | — | — | — | Rated | Измерения: 3/4 · семейств: 4 | 9 авг. 2026 г. |
| 61 | Phi 4Microsoft | 39.2±8.7 | — | 57.5% | 3.8% | 0.0 | — | — | — | 71.4% | 0.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| 62 | GPT-4.1 NanoOpenAI | 37.7±8.7 | — | 51.2% | 3.8% | 0.0 | — | — | — | 65.7% | 17.0 | — | — | — | Rated | Измерения: 3/4 · семейств: 5 | 9 авг. 2026 г. |
| Estimated-модели — без места38 | |||||||||||||||||
| — | Qwen3.8 MaxQwen | 65.9±11.3 | — | 92.7% | 43.0% | — | 43.6 | — | — | — | — | 66.3 | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Muse Spark 1.1Meta | 61.4±10.2 | — | 89.8% | 46.2% | 15.1 | 52.2 | — | — | — | 63.3 | — | — | 54.1 | Estimated | Измерения: 2/4 · семейств: 5 | 9 авг. 2026 г. |
| — | Claude Fable 5Anthropic | 60.7±10.8 | — | 92.6% | 55.5% | 28.6 | — | — | — | — | 70.0 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | Gemini 3 Flash PreviewGoogle | 60.7±11.1 | — | 89.8% | 36.6% | — | — | — | — | 89.0% | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | GPT-5.3 CodexOpenAI | 60.4±10.8 | — | 91.5% | 42.5% | 16.9 | — | — | — | — | 74.0 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | GPT-5.2 CodexOpenAI | 59.6±10.8 | — | 89.9% | 35.7% | 8.7 | — | — | — | — | 75.7 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | GPT-5.4 ProOpenAI | 59.5±11.3 | 83.3 | — | 58.7% | 30.0 | 42.7 | — | — | — | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | MiniMax M3MiniMax | 59.2±10.8 | — | 92.9% | 39.0% | 3.7 | — | — | — | — | 74.0 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | Gemini 3.6 FlashGoogle | 59±10.8 | — | 92.8% | 40.8% | 10.6 | — | — | — | — | 69.7 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | Kimi K3MoonshotAI | 58.8±10.8 | — | 84.2% | 25.0% | 23.4 | 43.5 | — | — | — | 74.7 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | MiniMax M2.1MiniMax | 57.2±11.1 | — | 83.0% | 23.2% | — | — | — | — | 87.5% | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | GPT-5 CodexOpenAI | 57.1±11.1 | — | 83.7% | 27.8% | — | — | — | — | 86.5% | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Kimi K2.7 CodeMoonshotAI | 57±10.8 | — | 89.6% | 35.0% | 10.0 | — | — | — | — | 66.3 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | Qwen3.6 Max PreviewQwen | 56.6±10.8 | — | 88.8% | 30.8% | 3.7 | — | — | — | — | 69.7 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | Claude Sonnet 5Anthropic | 56.5±10.8 | — | 80.0% | 19.0% | 16.9 | 43.2 | — | — | — | 70.7 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | Hy3Tencent | 56.4±10.8 | — | 89.7% | 33.5% | 4.9 | — | — | — | — | 66.7 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | GPT-5.4 MiniOpenAI | 56.4±10.8 | — | 87.5% | 28.1% | 10.0 | 28.2 | — | — | — | 69.3 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | Claude Opus 4.7Anthropic | 56.3±10.8 | — | 88.5% | 33.3% | 5.1 | — | — | — | — | 67.0 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | Grok 4.3SpaceXAI | 55.9±10.8 | — | 89.0% | 30.0% | 8.0 | — | — | — | — | 64.3 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | Kimi K2 ThinkingMoonshotAI | 55.8±11.1 | — | 83.8% | 23.8% | — | — | — | — | 84.8% | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Gemini 2.5 Pro Preview 06-05Google | 55.8±11.1 | — | 83.6% | 18.0% | — | — | — | — | 85.8% | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | GPT-5.1 Codex MaxOpenAI | 55.5±10.8 | — | — | — | 5.7 | — | 86.0 | 23.4 | — | 67.3 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | Qwen3 Max ThinkingQwen | 55.4±11.1 | — | 86.1% | 28.0% | — | — | — | — | 82.4% | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Kimi K2.6MoonshotAI | 55.2±10.8 | — | 78.8% | 19.6% | 8.0 | — | — | — | — | 69.7 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | GLM-5.2Z.ai | 54.9±10.8 | — | 68.6% | 9.8% | 20.9 | 40.5 | — | — | — | 71.3 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | MiMo-V2.5-ProXiaomi | 54.8±10.8 | — | 76.2% | 14.8% | 4.0 | 34.0 | — | — | — | 73.3 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | MiniMax M2.7MiniMax | 54.6±10.8 | — | 87.4% | 29.6% | 0.6 | — | — | — | — | 68.7 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | InklingThinking Machines | 54.5±10.8 | — | 87.2% | 31.9% | 5.4 | 30.0 | — | — | — | 63.3 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | DeepSeek V3.1 TerminusDeepSeek | 54.5±11.1 | — | 79.2% | 16.4% | — | — | — | — | 85.1% | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | DeepSeek V3.2 ExpDeepSeek | 54.3±11.1 | — | 79.7% | 14.9% | — | — | — | — | 85.0% | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | GLM-5.1Z.ai | 54±10.8 | — | 83.9% | 27.9% | 4.6 | — | — | — | — | 62.3 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | Qwen3 235B A22B Instruct 2507Qwen | 53.9±11.1 | — | 79.0% | 15.9% | — | — | — | — | 84.3% | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | GPT-5 MiniOpenAI | 53.8±11.1 | — | 80.3% | 15.9% | — | — | — | — | 83.7% | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | GPT-5.1 Codex MiniOpenAI | 53.4±11.1 | — | 81.3% | 18.5% | — | — | — | — | 82.0% | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | MiMo-V2-Omni | 53.4±10.8 | — | 82.8% | 22.1% | 1.1 | — | — | — | — | 66.7 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
| — | O4 MiniOpenAI | 53.4±11.1 | — | 78.4% | 16.5% | — | — | — | — | 83.2% | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | GLM-4.5Z.ai | 53±11.1 | — | 78.2% | 13.0% | — | — | — | — | 83.5% | — | — | — | — | Estimated | Измерения: 2/4 · семейств: 3 | 9 авг. 2026 г. |
| — | Step 3.7 FlashStepFun | 53±10.8 | — | 80.9% | 21.4% | 2.3 | — | — | — | — | 63.7 | — | — | — | Estimated | Измерения: 2/4 · семейств: 4 | 9 авг. 2026 г. |
Что измеряет этот рейтинг
Какая AI-модель лучше подходит для сложного рассуждения?
Рейтинг охватывает логику, причинность, многошаговые ограничения и проверку свидетельств. Он не измеряет все способности модели.
Четыре измерения способности
Четыре измерения заданы схемой категории. Доступные данные могут покрывать только часть из них. Измерение без свидетельств не считается подтверждённой способностью.
Абстрактная логика
Сейчас это измерение поддерживают 1 столбцов бенчмарков.
- ARC-AGI-2
Научное и причинное рассуждение
Сейчас это измерение поддерживают 6 столбцов бенчмарков.
- GPQA
- HLE
- CritPt
- HLE w/o tools
- AA-GPQA Diamond
- AA-HLE
Многошаговые ограничения
Сейчас это измерение поддерживают 1 столбцов бенчмарков.
- MMLU-Pro
Интеграция и проверка свидетельств
Сейчас это измерение поддерживают 4 столбцов бенчмарков.
- AA-LCR
- LongBench v2
- AI-Needle
- MRCR 1M
Задачи рассуждения для сравнения
- Сложный анализ с несколькими условиями и связанными выводами.
- Научные вопросы с причинностью, гипотезами и свидетельствами.
- Проверка выводов, поиск пробелов и оценка силы доказательств.
Как выбрать модель по этому рейтингу
- Шаг 1
Сначала проверьте статус
Только Rated-модели получают место. Estimated и Provisional не имеют формальной позиции.
- Шаг 2
Затем изучите интервал и свидетельства
Если оценки близки, не смотрите только на место. Проверьте неопределённость, измерения и число бенчмарков.
- Шаг 3
В конце проверьте реальную задачу
Рейтинг не заменяет ваш тест. Вместе проверяйте качество, скорость, цену, контекст и ограничения провайдера.
Не смотрите только на высокий балл. Учитывайте интервал, тип задачи, стабильность ответа и цену проверки.
Что означают статусы
Rated
Rated означает, что правила по свидетельствам и пересечениям выполнены. Модель может получить формальный ранг.
Estimated
Estimated означает, что полезные свидетельства есть, но их недостаточно для формального ранга.
Provisional
Provisional означает мало свидетельств или недостаточное покрытие аспектов и семейств бенчмарков для статуса Estimated. Это только ранний сигнал.
Бенчмарки и источники свидетельств
Названия источников и группы бенчмарков взяты из доступных данных оценки. Один источник может дать несколько бенчмарков.
Artificial Analysis
GPQA, HLE и MMLU-Pro
BenchLM
AA-GPQA Diamond, AA-HLE, AA-LCR, AI-Needle, ARC-AGI-2, CritPt, GPQA, HLE, HLE w/o tools, LongBench v2, MMLU-Pro и MRCR 1M
Как строится рейтинг моделей рассуждения
LMSpeed объединяет подходящие сторонние бенчмарки в четырёх фиксированных измерениях. Rated-модели получают формальный ранг, а Estimated и Provisional остаются видимыми без позиции.
Подробнее о методологии Category ScoreОграничения рейтинга
Category Score использует сторонние бенчмарки, которые сейчас включены в LMSpeed. Тесты могут отличаться данными, запросами и правилами оценки. Результат не вечный и не описывает каждую реальную задачу. Важный выбор проверяйте на своих данных.
Частые вопросы
Какая доступная модель имеет самый высокий формальный ранг?
Среди доступных моделей самый высокий формальный ранг у GPT-5.6 Sol. Глобальная позиция 1, а Category Score равен 61.7. Правила формального рейтинга выполняют 62 доступных моделей. Результат относится только к дате и версии методики на странице.
Можно ли сравнивать оценки разных категорий?
Нет. Каждая категория использует свои измерения и свидетельства. Category Score сравним только внутри одной таблицы. Для другой задачи откройте её категорию.
Полезны ли Estimated и Provisional модели?
Они помогают найти кандидатов, но свидетельств пока недостаточно для формального ранга. Сначала изучите покрытие и неопределённость, затем проверьте модель на реальной задаче.
Как часто обновляется рейтинг?
Рейтинг обновляется после публикации нового завершённого запуска. Дата и версия методики указаны выше. LMSpeed не обещает фиксированное ежедневное или еженедельное обновление.
Модель на первом месте всегда лучше для меня?
Нет. Результат также зависит от скорости, цены, длины контекста, инструментов, региона и ограничений провайдера. Сначала сократите список, затем проведите свой тест.
Оценка рассуждения совпадает с оценкой математики?
Нет. Математика является отдельной категорией. Рейтинг рассуждения также проверяет логику, причинность, ограничения и свидетельства. Высокая математика не гарантирует лучший результат во всех задачах.
