Рейтинг Category Score V3

LMSpeed Лучшие модели для математики

Сравните модели по базовой и олимпиадной математике, доказательствам и задачам с инструментами, просматривая исходные результаты рядом с Category Score.

Методология 3.0Методология

Текущий вывод

Сейчас ни одна модель не соответствует правилам формального рейтинга. В таблице есть Estimated моделей 89 и Provisional моделей 11. Это полезные сигналы, но не формальные места.

Рейтинг меняется вместе с данными и методикой. Дата запуска указана выше.

Доступные данные рейтинга

Показано моделей
100
Моделей с формальным рангом
0
Столбцов бенчмарков
13
Измерений со свидетельствами
4/4

Как читать полосы бенчмарков

Каждая полоса сравнивает модели только внутри одного столбца бенчмарка. Длина рассчитана относительно показанных моделей, не является Category Score и несопоставима между столбцами.

МестоМодельОценка LMSpeedБазовая математикаОлимпиадная математикаПродвинутые доказательстваПрикладная математика и инструментыСтатусПокрытиеОбновлено
MATH-500Моделей: undefinedAA Math IndexМоделей: undefinedAIMEМоделей: undefinedHMMT Feb 2026Моделей: undefinedAIME26Моделей: undefinedHMMT Nov 2025Моделей: undefinedHMMT Feb 2025Моделей: undefinedAIME 2025Моделей: undefinedFrontierMath v2 (Tiers 1-3)Моделей: undefinedFrontierMath v2 (Tier 4)Моделей: undefinedFrontierMath (legacy)Моделей: undefinedIMOAnswerBenchМоделей: undefinedMMAnswerBenchМоделей: undefined
Estimated-модели — без места89
GLM-5.2Z.ai
70.1±11.5
92.599.294.491.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
O4 MiniOpenAI
63.9±11.8
98.9%94.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3 235B A22B Instruct 2507Qwen
62.9±11.8
98.4%94.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.7 MaxQwen
62.2±12.2
97.190.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5OpenAI
61.4±11.8
98.7%83.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
o3 Mini HighOpenAI
61.3±11.8
98.5%86.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 2.5 Pro Preview 06-05Google
60.7±11.8
98.0%87.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-4.5Z.ai
60.5±11.8
97.9%87.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek V4 Pro 0813DeepSeek
58.9±12.2
95.289.8EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiniMax M1MiniMax
58.9±11.8
97.2%81.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
O3OpenAI
58.8±9.3
99.2%90.3%18.72.1EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K2.6MoonshotAI
58.6±9.0
92.796.439.014.686.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
O3 MiniOpenAI
58.5±11.8
97.3%77.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3
58.3±11.8
97.5%72.7%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek V4 Flash 0731DeepSeek
57.9±12.2
94.888.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Sonar Reasoning ProPerplexity
57.4±11.8
95.7%79.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek R1DeepSeek
57±11.8
96.6%68.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-4.5 AirZ.ai
56.9±11.8
96.5%67.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 2.5 ProGoogle
56.1±9.3
96.7%88.7%14.14.2EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek R1 Distill QwenDeepSeek
55.7±11.8
94.9%66.7%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.7 PlusQwen
55.2±12.2
92.986.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
R1 Distill Llama 70BDeepSeek
55±11.8
93.5%67.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
O1 MiniOpenAI
54.9±11.8
94.4%60.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4Anthropic
54.4±11.8
94.1%56.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K2MoonshotAI
53.7±9.3
97.1%69.3%21.40.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 2.5 Flash LiteGoogle
53.3±11.8
92.6%50.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Sonnet 4Anthropic
52.9±11.8
93.4%40.7%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
O1OpenAI
52.6±9.3
92.4%72.3%9.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Reka Flash 3Rekaai
52.2±11.8
89.3%51.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.6 PlusQwen
52.2±9.1
87.895.394.696.726.28.383.8EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Mistral Medium 3Mistral
52.1±11.8
90.7%44.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 2.0 FlashGoogle
52.1±11.8
93.0%33.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 2.0 ProGoogle
52.1±11.8
92.3%36.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-5.1Z.ai
51.7±9.1
82.695.394.033.412.583.8EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-5Z.ai
51.1±9.1
86.495.896.997.516.42.182.5EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3 235B A22BQwen
51.1±11.8
90.2%32.7%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 2.5 FlashGoogle
50.8±9.3
92.6%43.3%4.84.2EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3 Coder 30B A3B InstructQwen
50.5±11.8
89.3%29.7%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
SonarPerplexity
50.3±11.8
81.7%48.7%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 2.0 Flash LiteGoogle
50.1±11.8
87.3%30.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3 32BQwen
49.9±11.8
86.9%30.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4.1 MiniOpenAI
49.9±9.3
92.5%43.0%4.5EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.5Anthropic
49.9±9.1
85.395.193.392.920.74.284.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 2.0 Flash Lite 001Google
49.8±11.8
87.3%27.7%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3 14BQwen
49.8±11.8
87.1%28.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek V3
49.5±9.3
94.2%52.0%1.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3 30B A3BQwen
49.4±11.8
86.3%26.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K2.5MoonshotAI
49.2±9.0
87.195.891.195.496.127.94.281.8EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4.1OpenAI
49±9.3
91.3%43.7%5.50.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-4.7Z.ai
48.8±12.3
95.72.40.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude 3.7 SonnetAnthropic
48.7±11.8
85.0%22.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3 8BQwen
48.5±11.8
82.8%24.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Sonar ProPerplexity
47.5±11.8
74.5%29.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Grok 3
47.3±9.3
87.0%33.0%3.80.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Phi 4Microsoft
46.9±11.8
81.0%14.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Ling-3.0-flashInclusionai
46.7±11.5
87.093.283.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Command ACohere
46.2±11.8
81.9%9.7%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Grok-2
46.2±11.8
77.8%13.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4o (2024-08-06)OpenAI
46.2±11.8
79.5%11.7%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Llama 4 MaverickMeta
46.2±9.3
88.9%39.0%0.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4o MiniOpenAI
46.1±11.8
78.9%11.7%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4o (2024-05-13)OpenAI
46±11.8
79.1%11.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4 TurboOpenAI
45.8±11.8
73.7%15.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek R1 Distill Qwen 1.5BDeepSeek
45.5±11.8
68.7%17.7%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4.1 NanoOpenAI
45.2±9.3
84.8%23.7%1.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Mistral SabaMistral
44.7±11.8
67.7%13.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Mistral Large 2407Mistralai
44.5±11.8
71.4%9.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Llama 4 ScoutMeta
44.4±9.3
84.4%28.3%0.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Phi 4 Multimodal Instruct
44.2±11.8
69.3%9.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 1.5 ProGoogle
43.7±11.8
67.3%8.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Devstral SmallMistral AI
43.4±11.8
68.4%6.7%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude 3.5 SonnetAnthropic
43±9.3
69.5%9.7%2.10.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 1.5 FlashGoogle
42.6±11.8
55.4%9.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude 3.5 HaikuAnthropic
42.5±11.8
72.1%3.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Sonnet 4.5Anthropic
42.5±12.3
87.013.54.2EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4oOpenAI
42.2±9.3
79.7%10.3%0.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Phi 4 Mini Instruct
42±11.8
69.6%3.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude 3 OpusAnthropic
41.5±11.8
64.1%3.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.5
41.4±11.5
87.993.392.794.880.9EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.6 27BQwen
41.3±11.5
84.394.190.793.880.8EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Hermes 3 70B InstructNous
39.6±11.8
53.8%2.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude 3 SonnetAnthropic
39.6±11.8
41.4%4.7%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude 2.1Anthropic
38.5±11.8
37.4%3.3%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Mixtral 8x22B InstructMistral
36.8±11.8
54.5%0.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Mistral LargeMistralai
36.6±11.8
52.7%0.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude 3 HaikuAnthropic
36.4±11.8
39.4%1.0%EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.6 35B A3BQwen
34.6±11.5
83.692.789.190.778.9EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek V4 FlashDeepSeek
32.6±12.2
40.841.9EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek V4 ProDeepSeek
31.6±12.2
31.735.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Provisional-модели — без места11
GPT-5.6 SolOpenAI
67±16.1
89.083.089.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
InklingThinking Machines
65.4±16.3
97.1ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.6 TerraOpenAI
64.5±16.1
84.968.384.9ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.6 LunaOpenAI
62.4±16.1
78.658.578.6ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.8Anthropic
58±16.1
47.231.3ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.4OpenAI
57.6±16.1
47.627.1ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.5 ProOpenAI
57.2±16.1
51.039.652.4ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.5OpenAI
56.9±16.1
51.735.451.7ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.4 ProOpenAI
56.8±16.1
50.037.550.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.7Anthropic
56.8±16.1
43.822.9ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.6Anthropic
56.5±16.1
40.722.9ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.

Что измеряет этот рейтинг

Какая AI-модель лучше подходит для математики?

Рейтинг охватывает базовую математику, олимпиады, сложные доказательства и работу с инструментами. Разные задачи требуют разных способностей.

Доступные данные покрывают 4/4 измерений и показывают 13 столбцов бенчмарков.

Четыре измерения способности

Четыре измерения заданы схемой категории. Доступные данные могут покрывать только часть из них. Измерение без свидетельств не считается подтверждённой способностью.

Базовая математика

Сейчас это измерение поддерживают 2 столбцов бенчмарков.

  • MATH-500
  • AA Math Index

Олимпиадная математика

Сейчас это измерение поддерживают 6 столбцов бенчмарков.

  • AIME
  • HMMT Feb 2026
  • AIME26
  • HMMT Nov 2025
  • HMMT Feb 2025
  • AIME 2025

Продвинутые доказательства

Сейчас это измерение поддерживают 4 столбцов бенчмарков.

  • FrontierMath v2 (Tiers 1-3)
  • FrontierMath v2 (Tier 4)
  • FrontierMath (legacy)
  • IMOAnswerBench

Прикладная математика и инструменты

Сейчас это измерение поддерживают 1 столбцов бенчмарков.

  • MMAnswerBench

Математические задачи для сравнения

  • Базовые задачи по арифметике, алгебре и школьной математике.
  • Олимпиадные задачи и доказательства с корректными шагами.
  • Прикладные расчёты с формулами и проверкой результата инструмента.

Как выбрать модель по этому рейтингу

  1. Шаг 1

    Сначала проверьте статус

    Только Rated-модели получают место. Estimated и Provisional не имеют формальной позиции.

  2. Шаг 2

    Затем изучите интервал и свидетельства

    Если оценки близки, не смотрите только на место. Проверьте неопределённость, измерения и число бенчмарков.

  3. Шаг 3

    В конце проверьте реальную задачу

    Рейтинг не заменяет ваш тест. Вместе проверяйте качество, скорость, цену, контекст и ограничения провайдера.

Выбирайте модель по типу задачи. Пересчитывайте важные значения и проверяйте каждый шаг доказательства.

Что означают статусы

Rated

Rated означает, что правила по свидетельствам и пересечениям выполнены. Модель может получить формальный ранг.

Estimated

Estimated означает, что полезные свидетельства есть, но их недостаточно для формального ранга.

Provisional

Provisional означает мало свидетельств или недостаточное покрытие аспектов и семейств бенчмарков для статуса Estimated. Это только ранний сигнал.

Бенчмарки и источники свидетельств

Названия источников и группы бенчмарков взяты из доступных данных оценки. Один источник может дать несколько бенчмарков.

  • Artificial Analysis

    AA Math Index, AIME и MATH-500

  • BenchLM

    AIME 2025, AIME26, FrontierMath (legacy), FrontierMath v2 (Tier 4), FrontierMath v2 (Tiers 1-3), HMMT Feb 2025, HMMT Feb 2026, HMMT Nov 2025, IMOAnswerBench и MMAnswerBench

Как строится математический рейтинг

LMSpeed объединяет подходящие сторонние бенчмарки в четырёх фиксированных измерениях. Rated-модели получают формальный ранг, а Estimated и Provisional остаются видимыми без позиции.

Подробнее о методологии Category Score

Ограничения рейтинга

Category Score использует сторонние бенчмарки, которые сейчас включены в LMSpeed. Тесты могут отличаться данными, запросами и правилами оценки. Результат не вечный и не описывает каждую реальную задачу. Важный выбор проверяйте на своих данных.

Частые вопросы

Какая доступная модель имеет самый высокий формальный ранг?

Сейчас формального первого места нет. На странице есть Estimated моделей 89 и Provisional моделей 11. У них нет формального ранга, поэтому их нельзя называть победителями.

Можно ли сравнивать оценки разных категорий?

Нет. Каждая категория использует свои измерения и свидетельства. Category Score сравним только внутри одной таблицы. Для другой задачи откройте её категорию.

Полезны ли Estimated и Provisional модели?

Они помогают найти кандидатов, но свидетельств пока недостаточно для формального ранга. Сначала изучите покрытие и неопределённость, затем проверьте модель на реальной задаче.

Как часто обновляется рейтинг?

Рейтинг обновляется после публикации нового завершённого запуска. Дата и версия методики указаны выше. LMSpeed не обещает фиксированное ежедневное или еженедельное обновление.

Модель на первом месте всегда лучше для меня?

Нет. Результат также зависит от скорости, цены, длины контекста, инструментов, региона и ограничений провайдера. Сначала сократите список, затем проведите свой тест.

Математический рейтинг описывает общее рассуждение?

Нет. Он описывает только математические задачи. Для логики, причинности и проверки свидетельств смотрите рейтинг рассуждения. Реальная работа также может требовать инструментов.