Рейтинг Category Score V3

LMSpeed Лучшие модели по следованию инструкциям

Сравните соблюдение ограничений, структурированный вывод, обобщение новых инструкций и длинные многоходовые диалоги по всем доступным бенчмаркам.

Методология 3.0Методология

Текущий вывод

Сейчас ни одна модель не соответствует правилам формального рейтинга. В таблице есть Estimated моделей 15 и Provisional моделей 77. Это полезные сигналы, но не формальные места.

Рейтинг меняется вместе с данными и методикой. Дата запуска указана выше.

Доступные данные рейтинга

Показано моделей
92
Моделей с формальным рангом
0
Столбцов бенчмарков
3
Измерений со свидетельствами
2/4

Как читать полосы бенчмарков

Каждая полоса сравнивает модели только внутри одного столбца бенчмарка. Длина рассчитана относительно показанных моделей, не является Category Score и несопоставима между столбцами.

МестоМодельОценка LMSpeedСоблюдение ограниченийОбобщение новых инструкцийСтатусПокрытиеОбновлено
IFEvalМоделей: undefinedAA-IFBenchМоделей: undefinedIFBenchМоделей: undefined
Estimated-модели — без места15
Qwen3.5-27BQwen
57.1±11.9
95.075.6EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.7 PlusQwen
56.8±11.9
94.678.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.7 MaxQwen
56.8±11.9
94.380.5EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.6 PlusQwen
55.7±11.9
94.375.2EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.5-122B-A10BQwen
54.2±11.9
93.475.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K2.5MoonshotAI
54±11.9
93.970.2EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.5
53.7±11.9
92.678.8EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-5Z.ai
52.4±11.9
92.672.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
O1OpenAI
51.5±11.9
92.270.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.5-35B-A3BQwen
51.5±11.9
91.972.5EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.5Anthropic
45.7±11.9
90.943.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4.1 MiniOpenAI
42.4±11.9
88.538.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4.1OpenAI
42.1±11.9
87.443.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek V3
39.7±11.9
86.134.8EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4.1 NanoOpenAI
37.1±11.9
83.232.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Provisional-модели — без места77
MiniMax M3MiniMax
57.8±16.0
82.9ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.8 MaxQwen
57.7±16.0
82.8ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Inkling SmallThinking Machines
57.4±16.0
82.2ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Grok 4.3SpaceXAI
57±16.0
81.3ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiMo-V2.5-ProXiaomi
56.3±16.0
79.9ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
InklingThinking Machines
56.3±16.0
79.8ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.8 27BQwen
56.1±16.0
79.5ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
O3 MiniOpenAI
55.6±16.3
93.9ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.2 CodexOpenAI
55.3±16.0
77.6ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3.1 ProGoogle
55.1±16.0
77.1ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Muse Glimmer 30BMeta
55.1±16.0
77.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.6 Max PreviewQwen
54.9±16.0
76.6ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek V4 Pro 0813DeepSeek
54.9±16.0
76.5ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-5.1Z.ai
54.8±16.0
76.3ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3.5 FlashGoogle
54.8±16.0
76.3ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K2.6MoonshotAI
54.7±16.0
76.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.4 NanoOpenAI
54.6±16.0
75.9ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.5OpenAI
54.6±16.0
75.9ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiniMax M2.7MiniMax
54.6±16.0
75.7ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.3 CodexOpenAI
54.4±16.0
75.4ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.2OpenAI
54.4±16.0
75.4ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Ling-3.0-flashInclusionai
54.1±16.0
74.5ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.4OpenAI
53.9±16.0
73.9ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Command ACohere
53.9±16.0
73.9ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.4 MiniOpenAI
53.6±16.0
73.3ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-5.2Z.ai
53.6±16.0
73.3ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-5 TurboZ.ai
53.6±16.0
73.2ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5OpenAI
53.6±16.0
73.1ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.1OpenAI
53.5±16.0
72.9ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.6 SolOpenAI
53.4±16.0
72.7ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
O3OpenAI
53±16.0
71.4ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.6 TerraOpenAI
52.9±16.0
71.2ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3 ProGoogle
52.6±16.0
70.4ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.1 Codex MaxOpenAI
52.5±16.0
70.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.1 CodexOpenAI
52.5±16.0
70.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
gpt-oss-120bOpenAI
52.1±16.0
69.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiMo-V2-Pro
52.1±16.0
68.8ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Mistral Medium 3.5Mistral
52.1±16.0
68.8ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-4.7Z.ai
51.8±16.0
67.9ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.6 27BQwen
51.7±16.0
67.6ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Step 3.7 FlashStepFun
51.6±16.0
67.3ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
gpt-oss-20bOpenAI
50.8±16.0
65.1ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.6 35B A3BQwen
50.6±16.0
64.4ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Fable 5Anthropic
50.3±16.0
63.5ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K2.7 CodeMoonshotAI
50.2±16.0
63.1ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Hy3 previewTencent
50.2±16.0
63.1ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.8Anthropic
49.9±16.0
62.2ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-5V TurboZ.ai
49.6±16.0
61.1ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.7 MaxAnthropic
48.8±16.0
58.6ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Ling 2.6 FlashinclusionAI
48.5±16.0
57.4ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Trinity Large ThinkingArcee AI
48.2±16.0
56.3ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3 FlashGoogle
47.8±16.0
55.1ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiMo-V2-Omni
47.3±16.0
53.5ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek V3.2DeepSeek
46±16.0
49.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 2.5 ProGoogle
45.9±16.0
48.7ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Sonnet 4Anthropic
45±16.0
45.4ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.6Anthropic
44.7±16.0
44.6ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3 MaxQwen
44.6±16.0
44.1ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.7Anthropic
44.5±16.0
43.6ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Llama 4 MaverickMeta
44.3±16.0
43.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K2MoonshotAI
43.8±16.0
41.5ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Sonnet 4.6Anthropic
43.7±16.0
41.2ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiMo-V2-Flash
43.3±16.0
39.9ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek R1DeepSeek
43.3±16.0
39.6ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Llama 4 ScoutMeta
43.2±16.0
39.5ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Mistral Medium 3Mistral
43.2±16.0
39.3ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 2.5 FlashGoogle
43.1±16.0
39.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Llama 3.1Meta
43.1±16.0
39.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek V3.1DeepSeek
42.7±16.0
37.8ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-4.5 AirZ.ai
42.6±16.0
37.6ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-4.6Z.ai
42.4±16.0
36.7ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Mistral Large 3
42.2±16.0
36.2ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude 3 HaikuAnthropic
42.2±16.0
36.1ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4oOpenAI
41.6±16.0
34.3ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-4o MiniOpenAI
40.5±16.0
31.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Phi 4Microsoft
37.8±16.0
23.5ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
DeepSeek R1 Distill QwenDeepSeek
37.5±16.0
22.9ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.

Что измеряет этот рейтинг

Какая AI-модель лучше выполняет точные требования?

Рейтинг охватывает ограничения, структурированный вывод, новые инструкции и длинные диалоги. Текущий запуск может покрывать только часть измерений.

Доступные данные покрывают 2/4 измерений и показывают 3 столбцов бенчмарков.

Четыре измерения способности

Четыре измерения заданы схемой категории. Доступные данные могут покрывать только часть из них. Измерение без свидетельств не считается подтверждённой способностью.

Соблюдение ограничений

Сейчас это измерение поддерживают 1 столбцов бенчмарков.

  • IFEval

Структурированный вывод

В доступных данных нет подходящих свидетельств для этого измерения. Оно не влияет на Category Score.

Обобщение новых инструкций

Сейчас это измерение поддерживают 2 столбцов бенчмарков.

  • AA-IFBench
  • IFBench

Многоходовые и длинные инструкции

В доступных данных нет подходящих свидетельств для этого измерения. Оно не влияет на Category Score.

Задачи на следование инструкциям

  • JSON и фиксированный формат с точными полями и синтаксисом.
  • Строгие процессы с несколькими ограничениями и правилами безопасности.
  • Многоходовые помощники, которые помнят требования в длинном разговоре.

Как выбрать модель по этому рейтингу

  1. Шаг 1

    Сначала проверьте статус

    Только Rated-модели получают место. Estimated и Provisional не имеют формальной позиции.

  2. Шаг 2

    Затем изучите интервал и свидетельства

    Если оценки близки, не смотрите только на место. Проверьте неопределённость, измерения и число бенчмарков.

  3. Шаг 3

    В конце проверьте реальную задачу

    Рейтинг не заменяет ваш тест. Вместе проверяйте качество, скорость, цену, контекст и ограничения провайдера.

Проверьте модель на своих форматах и правилах. Также смотрите повторы, длинный контекст, скорость и цену.

Что означают статусы

Rated

Rated означает, что правила по свидетельствам и пересечениям выполнены. Модель может получить формальный ранг.

Estimated

Estimated означает, что полезные свидетельства есть, но их недостаточно для формального ранга.

Provisional

Provisional означает мало свидетельств или недостаточное покрытие аспектов и семейств бенчмарков для статуса Estimated. Это только ранний сигнал.

Бенчмарки и источники свидетельств

Названия источников и группы бенчмарков взяты из доступных данных оценки. Один источник может дать несколько бенчмарков.

  • BenchLM

    AA-IFBench, IFBench и IFEval

Как строится рейтинг следования инструкциям

LMSpeed объединяет подходящие сторонние бенчмарки в четырёх фиксированных измерениях. Rated-модели получают формальный ранг, а Estimated и Provisional остаются видимыми без позиции.

Подробнее о методологии Category Score

Ограничения рейтинга

Category Score использует сторонние бенчмарки, которые сейчас включены в LMSpeed. Тесты могут отличаться данными, запросами и правилами оценки. Результат не вечный и не описывает каждую реальную задачу. Важный выбор проверяйте на своих данных.

Частые вопросы

Какая доступная модель имеет самый высокий формальный ранг?

Сейчас формального первого места нет. На странице есть Estimated моделей 15 и Provisional моделей 77. У них нет формального ранга, поэтому их нельзя называть победителями.

Можно ли сравнивать оценки разных категорий?

Нет. Каждая категория использует свои измерения и свидетельства. Category Score сравним только внутри одной таблицы. Для другой задачи откройте её категорию.

Полезны ли Estimated и Provisional модели?

Они помогают найти кандидатов, но свидетельств пока недостаточно для формального ранга. Сначала изучите покрытие и неопределённость, затем проверьте модель на реальной задаче.

Как часто обновляется рейтинг?

Рейтинг обновляется после публикации нового завершённого запуска. Дата и версия методики указаны выше. LMSpeed не обещает фиксированное ежедневное или еженедельное обновление.

Модель на первом месте всегда лучше для меня?

Нет. Результат также зависит от скорости, цены, длины контекста, инструментов, региона и ограничений провайдера. Сначала сократите список, затем проведите свой тест.

Высокая оценка следования инструкциям отменяет проверку результата?

Нет. Она описывает только текущие бенчмарки. В рабочем процессе всё равно нужны проверки формата, содержания и безопасности, а также обработка неверного результата.