Рейтинг Category Score V3
LMSpeed Лучшие модели для математики
Сравните модели по базовой и олимпиадной математике, доказательствам и задачам с инструментами, просматривая исходные результаты рядом с Category Score.
Методология 3.0Методология
Текущий вывод
Сейчас ни одна модель не соответствует правилам формального рейтинга. В таблице есть Estimated моделей 89 и Provisional моделей 11. Это полезные сигналы, но не формальные места.
Доступные данные рейтинга
- Показано моделей
- 100
- Моделей с формальным рангом
- 0
- Столбцов бенчмарков
- 13
- Измерений со свидетельствами
- 4/4
Как читать полосы бенчмарков
Каждая полоса сравнивает модели только внутри одного столбца бенчмарка. Длина рассчитана относительно показанных моделей, не является Category Score и несопоставима между столбцами.
| Место | Модель | Оценка LMSpeed | Базовая математика | Олимпиадная математика | Продвинутые доказательства | Прикладная математика и инструменты | Статус | Покрытие | Обновлено | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| MATH-500Моделей: undefined | AA Math IndexМоделей: undefined | AIMEМоделей: undefined | HMMT Feb 2026Моделей: undefined | AIME26Моделей: undefined | HMMT Nov 2025Моделей: undefined | HMMT Feb 2025Моделей: undefined | AIME 2025Моделей: undefined | FrontierMath v2 (Tiers 1-3)Моделей: undefined | FrontierMath v2 (Tier 4)Моделей: undefined | FrontierMath (legacy)Моделей: undefined | IMOAnswerBenchМоделей: undefined | MMAnswerBenchМоделей: undefined | ||||||
| Estimated-модели — без места89 | ||||||||||||||||||
| — | GLM-5.2Z.ai | 70.1±11.5 | — | — | — | 92.5 | 99.2 | 94.4 | — | — | — | — | — | — | 91.0 | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | O4 MiniOpenAI | 63.9±11.8 | 98.9% | — | 94.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3 235B A22B Instruct 2507Qwen | 62.9±11.8 | 98.4% | — | 94.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3.7 MaxQwen | 62.2±12.2 | — | — | — | 97.1 | — | — | — | — | — | — | — | 90.0 | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-5OpenAI | 61.4±11.8 | 98.7% | — | 83.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | o3 Mini HighOpenAI | 61.3±11.8 | 98.5% | — | 86.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Gemini 2.5 Pro Preview 06-05Google | 60.7±11.8 | 98.0% | — | 87.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GLM-4.5Z.ai | 60.5±11.8 | 97.9% | — | 87.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | DeepSeek V4 Pro 0813DeepSeek | 58.9±12.2 | — | — | — | 95.2 | — | — | — | — | — | — | — | 89.8 | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | MiniMax M1MiniMax | 58.9±11.8 | 97.2% | — | 81.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | O3OpenAI | 58.8±9.3 | 99.2% | — | 90.3% | — | — | — | — | — | 18.7 | 2.1 | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Kimi K2.6MoonshotAI | 58.6±9.0 | — | — | — | 92.7 | 96.4 | — | — | — | 39.0 | 14.6 | — | — | 86.0 | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | O3 MiniOpenAI | 58.5±11.8 | 97.3% | — | 77.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3 | 58.3±11.8 | 97.5% | — | 72.7% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | DeepSeek V4 Flash 0731DeepSeek | 57.9±12.2 | — | — | — | 94.8 | — | — | — | — | — | — | — | 88.4 | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Sonar Reasoning ProPerplexity | 57.4±11.8 | 95.7% | — | 79.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | DeepSeek R1DeepSeek | 57±11.8 | 96.6% | — | 68.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GLM-4.5 AirZ.ai | 56.9±11.8 | 96.5% | — | 67.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Gemini 2.5 ProGoogle | 56.1±9.3 | 96.7% | — | 88.7% | — | — | — | — | — | 14.1 | 4.2 | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | DeepSeek R1 Distill QwenDeepSeek | 55.7±11.8 | 94.9% | — | 66.7% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3.7 PlusQwen | 55.2±12.2 | — | — | — | 92.9 | — | — | — | — | — | — | — | 86.0 | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | R1 Distill Llama 70BDeepSeek | 55±11.8 | 93.5% | — | 67.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | O1 MiniOpenAI | 54.9±11.8 | 94.4% | — | 60.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude Opus 4Anthropic | 54.4±11.8 | 94.1% | — | 56.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Kimi K2MoonshotAI | 53.7±9.3 | 97.1% | — | 69.3% | — | — | — | — | — | 21.4 | 0.0 | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Gemini 2.5 Flash LiteGoogle | 53.3±11.8 | 92.6% | — | 50.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude Sonnet 4Anthropic | 52.9±11.8 | 93.4% | — | 40.7% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | O1OpenAI | 52.6±9.3 | 92.4% | — | 72.3% | — | — | — | — | — | 9.3 | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Reka Flash 3Rekaai | 52.2±11.8 | 89.3% | — | 51.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3.6 PlusQwen | 52.2±9.1 | — | — | — | 87.8 | 95.3 | 94.6 | 96.7 | — | 26.2 | 8.3 | — | — | 83.8 | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Mistral Medium 3Mistral | 52.1±11.8 | 90.7% | — | 44.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Gemini 2.0 FlashGoogle | 52.1±11.8 | 93.0% | — | 33.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Gemini 2.0 ProGoogle | 52.1±11.8 | 92.3% | — | 36.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GLM-5.1Z.ai | 51.7±9.1 | — | — | — | 82.6 | 95.3 | 94.0 | — | — | 33.4 | 12.5 | — | — | 83.8 | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GLM-5Z.ai | 51.1±9.1 | — | — | — | 86.4 | 95.8 | 96.9 | 97.5 | — | 16.4 | 2.1 | — | — | 82.5 | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3 235B A22BQwen | 51.1±11.8 | 90.2% | — | 32.7% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Gemini 2.5 FlashGoogle | 50.8±9.3 | 92.6% | — | 43.3% | — | — | — | — | — | 4.8 | 4.2 | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3 Coder 30B A3B InstructQwen | 50.5±11.8 | 89.3% | — | 29.7% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | SonarPerplexity | 50.3±11.8 | 81.7% | — | 48.7% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Gemini 2.0 Flash LiteGoogle | 50.1±11.8 | 87.3% | — | 30.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3 32BQwen | 49.9±11.8 | 86.9% | — | 30.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-4.1 MiniOpenAI | 49.9±9.3 | 92.5% | — | 43.0% | — | — | — | — | — | 4.5 | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude Opus 4.5Anthropic | 49.9±9.1 | — | — | — | 85.3 | 95.1 | 93.3 | 92.9 | — | 20.7 | 4.2 | — | — | 84.0 | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Gemini 2.0 Flash Lite 001Google | 49.8±11.8 | 87.3% | — | 27.7% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3 14BQwen | 49.8±11.8 | 87.1% | — | 28.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | DeepSeek V3 | 49.5±9.3 | 94.2% | — | 52.0% | — | — | — | — | — | 1.7 | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3 30B A3BQwen | 49.4±11.8 | 86.3% | — | 26.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Kimi K2.5MoonshotAI | 49.2±9.0 | — | — | — | 87.1 | 95.8 | 91.1 | 95.4 | 96.1 | 27.9 | 4.2 | — | — | 81.8 | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-4.1OpenAI | 49±9.3 | 91.3% | — | 43.7% | — | — | — | — | — | 5.5 | 0.0 | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GLM-4.7Z.ai | 48.8±12.3 | — | — | — | — | — | — | — | 95.7 | 2.4 | 0.0 | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude 3.7 SonnetAnthropic | 48.7±11.8 | 85.0% | — | 22.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3 8BQwen | 48.5±11.8 | 82.8% | — | 24.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Sonar ProPerplexity | 47.5±11.8 | 74.5% | — | 29.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Grok 3 | 47.3±9.3 | 87.0% | — | 33.0% | — | — | — | — | — | 3.8 | 0.0 | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Phi 4Microsoft | 46.9±11.8 | 81.0% | — | 14.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Ling-3.0-flashInclusionai | 46.7±11.5 | — | — | — | 87.0 | 93.2 | — | — | — | — | — | — | 83.7 | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Command ACohere | 46.2±11.8 | 81.9% | — | 9.7% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Grok-2 | 46.2±11.8 | 77.8% | — | 13.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-4o (2024-08-06)OpenAI | 46.2±11.8 | 79.5% | — | 11.7% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Llama 4 MaverickMeta | 46.2±9.3 | 88.9% | — | 39.0% | — | — | — | — | — | 0.7 | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-4o MiniOpenAI | 46.1±11.8 | 78.9% | — | 11.7% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-4o (2024-05-13)OpenAI | 46±11.8 | 79.1% | — | 11.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-4 TurboOpenAI | 45.8±11.8 | 73.7% | — | 15.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | DeepSeek R1 Distill Qwen 1.5BDeepSeek | 45.5±11.8 | 68.7% | — | 17.7% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-4.1 NanoOpenAI | 45.2±9.3 | 84.8% | — | 23.7% | — | — | — | — | — | 1.0 | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Mistral SabaMistral | 44.7±11.8 | 67.7% | — | 13.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Mistral Large 2407Mistralai | 44.5±11.8 | 71.4% | — | 9.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Llama 4 ScoutMeta | 44.4±9.3 | 84.4% | — | 28.3% | — | — | — | — | — | 0.0 | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Phi 4 Multimodal Instruct | 44.2±11.8 | 69.3% | — | 9.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Gemini 1.5 ProGoogle | 43.7±11.8 | 67.3% | — | 8.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Devstral SmallMistral AI | 43.4±11.8 | 68.4% | — | 6.7% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude 3.5 SonnetAnthropic | 43±9.3 | 69.5% | — | 9.7% | — | — | — | — | — | 2.1 | 0.0 | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Gemini 1.5 FlashGoogle | 42.6±11.8 | 55.4% | — | 9.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude 3.5 HaikuAnthropic | 42.5±11.8 | 72.1% | — | 3.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude Sonnet 4.5Anthropic | 42.5±12.3 | — | — | — | — | — | — | — | 87.0 | 13.5 | 4.2 | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-4oOpenAI | 42.2±9.3 | 79.7% | — | 10.3% | — | — | — | — | — | 0.3 | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Phi 4 Mini Instruct | 42±11.8 | 69.6% | — | 3.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude 3 OpusAnthropic | 41.5±11.8 | 64.1% | — | 3.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3.5 | 41.4±11.5 | — | — | — | 87.9 | 93.3 | 92.7 | 94.8 | — | — | — | — | — | 80.9 | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3.6 27BQwen | 41.3±11.5 | — | — | — | 84.3 | 94.1 | 90.7 | 93.8 | — | — | — | — | — | 80.8 | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Hermes 3 70B InstructNous | 39.6±11.8 | 53.8% | — | 2.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude 3 SonnetAnthropic | 39.6±11.8 | 41.4% | — | 4.7% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude 2.1Anthropic | 38.5±11.8 | 37.4% | — | 3.3% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Mixtral 8x22B InstructMistral | 36.8±11.8 | 54.5% | — | 0.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Mistral LargeMistralai | 36.6±11.8 | 52.7% | — | 0.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude 3 HaikuAnthropic | 36.4±11.8 | 39.4% | — | 1.0% | — | — | — | — | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3.6 35B A3BQwen | 34.6±11.5 | — | — | — | 83.6 | 92.7 | 89.1 | 90.7 | — | — | — | — | — | 78.9 | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | DeepSeek V4 FlashDeepSeek | 32.6±12.2 | — | — | — | 40.8 | — | — | — | — | — | — | — | 41.9 | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | DeepSeek V4 ProDeepSeek | 31.6±12.2 | — | — | — | 31.7 | — | — | — | — | — | — | — | 35.3 | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| Provisional-модели — без места11 | ||||||||||||||||||
| — | GPT-5.6 SolOpenAI | 67±16.1 | — | — | — | — | — | — | — | — | 89.0 | 83.0 | 89.0 | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | InklingThinking Machines | 65.4±16.3 | — | — | — | — | 97.1 | — | — | — | — | — | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-5.6 TerraOpenAI | 64.5±16.1 | — | — | — | — | — | — | — | — | 84.9 | 68.3 | 84.9 | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-5.6 LunaOpenAI | 62.4±16.1 | — | — | — | — | — | — | — | — | 78.6 | 58.5 | 78.6 | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude Opus 4.8Anthropic | 58±16.1 | — | — | — | — | — | — | — | — | 47.2 | 31.3 | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-5.4OpenAI | 57.6±16.1 | — | — | — | — | — | — | — | — | 47.6 | 27.1 | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-5.5 ProOpenAI | 57.2±16.1 | — | — | — | — | — | — | — | — | 51.0 | 39.6 | 52.4 | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-5.5OpenAI | 56.9±16.1 | — | — | — | — | — | — | — | — | 51.7 | 35.4 | 51.7 | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-5.4 ProOpenAI | 56.8±16.1 | — | — | — | — | — | — | — | — | 50.0 | 37.5 | 50.0 | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude Opus 4.7Anthropic | 56.8±16.1 | — | — | — | — | — | — | — | — | 43.8 | 22.9 | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude Opus 4.6Anthropic | 56.5±16.1 | — | — | — | — | — | — | — | — | 40.7 | 22.9 | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
Что измеряет этот рейтинг
Какая AI-модель лучше подходит для математики?
Рейтинг охватывает базовую математику, олимпиады, сложные доказательства и работу с инструментами. Разные задачи требуют разных способностей.
Четыре измерения способности
Четыре измерения заданы схемой категории. Доступные данные могут покрывать только часть из них. Измерение без свидетельств не считается подтверждённой способностью.
Базовая математика
Сейчас это измерение поддерживают 2 столбцов бенчмарков.
- MATH-500
- AA Math Index
Олимпиадная математика
Сейчас это измерение поддерживают 6 столбцов бенчмарков.
- AIME
- HMMT Feb 2026
- AIME26
- HMMT Nov 2025
- HMMT Feb 2025
- AIME 2025
Продвинутые доказательства
Сейчас это измерение поддерживают 4 столбцов бенчмарков.
- FrontierMath v2 (Tiers 1-3)
- FrontierMath v2 (Tier 4)
- FrontierMath (legacy)
- IMOAnswerBench
Прикладная математика и инструменты
Сейчас это измерение поддерживают 1 столбцов бенчмарков.
- MMAnswerBench
Математические задачи для сравнения
- Базовые задачи по арифметике, алгебре и школьной математике.
- Олимпиадные задачи и доказательства с корректными шагами.
- Прикладные расчёты с формулами и проверкой результата инструмента.
Как выбрать модель по этому рейтингу
- Шаг 1
Сначала проверьте статус
Только Rated-модели получают место. Estimated и Provisional не имеют формальной позиции.
- Шаг 2
Затем изучите интервал и свидетельства
Если оценки близки, не смотрите только на место. Проверьте неопределённость, измерения и число бенчмарков.
- Шаг 3
В конце проверьте реальную задачу
Рейтинг не заменяет ваш тест. Вместе проверяйте качество, скорость, цену, контекст и ограничения провайдера.
Выбирайте модель по типу задачи. Пересчитывайте важные значения и проверяйте каждый шаг доказательства.
Что означают статусы
Rated
Rated означает, что правила по свидетельствам и пересечениям выполнены. Модель может получить формальный ранг.
Estimated
Estimated означает, что полезные свидетельства есть, но их недостаточно для формального ранга.
Provisional
Provisional означает мало свидетельств или недостаточное покрытие аспектов и семейств бенчмарков для статуса Estimated. Это только ранний сигнал.
Бенчмарки и источники свидетельств
Названия источников и группы бенчмарков взяты из доступных данных оценки. Один источник может дать несколько бенчмарков.
Artificial Analysis
AA Math Index, AIME и MATH-500
BenchLM
AIME 2025, AIME26, FrontierMath (legacy), FrontierMath v2 (Tier 4), FrontierMath v2 (Tiers 1-3), HMMT Feb 2025, HMMT Feb 2026, HMMT Nov 2025, IMOAnswerBench и MMAnswerBench
Как строится математический рейтинг
LMSpeed объединяет подходящие сторонние бенчмарки в четырёх фиксированных измерениях. Rated-модели получают формальный ранг, а Estimated и Provisional остаются видимыми без позиции.
Подробнее о методологии Category ScoreОграничения рейтинга
Category Score использует сторонние бенчмарки, которые сейчас включены в LMSpeed. Тесты могут отличаться данными, запросами и правилами оценки. Результат не вечный и не описывает каждую реальную задачу. Важный выбор проверяйте на своих данных.
Частые вопросы
Какая доступная модель имеет самый высокий формальный ранг?
Сейчас формального первого места нет. На странице есть Estimated моделей 89 и Provisional моделей 11. У них нет формального ранга, поэтому их нельзя называть победителями.
Можно ли сравнивать оценки разных категорий?
Нет. Каждая категория использует свои измерения и свидетельства. Category Score сравним только внутри одной таблицы. Для другой задачи откройте её категорию.
Полезны ли Estimated и Provisional модели?
Они помогают найти кандидатов, но свидетельств пока недостаточно для формального ранга. Сначала изучите покрытие и неопределённость, затем проверьте модель на реальной задаче.
Как часто обновляется рейтинг?
Рейтинг обновляется после публикации нового завершённого запуска. Дата и версия методики указаны выше. LMSpeed не обещает фиксированное ежедневное или еженедельное обновление.
Модель на первом месте всегда лучше для меня?
Нет. Результат также зависит от скорости, цены, длины контекста, инструментов, региона и ограничений провайдера. Сначала сократите список, затем проведите свой тест.
Математический рейтинг описывает общее рассуждение?
Нет. Он описывает только математические задачи. Для логики, причинности и проверки свидетельств смотрите рейтинг рассуждения. Реальная работа также может требовать инструментов.
