Рейтинг Category Score V3

LMSpeed Лучшие мультиязычные модели

Сравните понимание разных языков, генерацию, перенос рассуждений и устойчивость для малоресурсных языков с балансом по четырём измерениям.

Методология 3.0Методология

Текущий вывод

Сейчас ни одна модель не соответствует правилам формального рейтинга. В таблице есть Estimated моделей 7 и Provisional моделей 10. Это полезные сигналы, но не формальные места.

Рейтинг меняется вместе с данными и методикой. Дата запуска указана выше.

Доступные данные рейтинга

Показано моделей
17
Моделей с формальным рангом
0
Столбцов бенчмарков
4
Измерений со свидетельствами
2/4

Как читать полосы бенчмарков

Каждая полоса сравнивает модели только внутри одного столбца бенчмарка. Длина рассчитана относительно показанных моделей, не является Category Score и несопоставима между столбцами.

МестоМодельОценка LMSpeedМежъязыковое пониманиеПеренос рассужденийСтатусПокрытиеОбновлено
NOVA-63Моделей: undefinedAA Global-MMLU-LiteМоделей: undefinedINCLUDEМоделей: undefinedMMLU-ProXМоделей: undefined
Estimated-модели — без места7
Qwen3.7 MaxQwen
58.1±11.7
59.086.287.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.5
54.6±12.2
59.184.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.6 PlusQwen
52.2±12.2
57.984.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.5Anthropic
51.7±12.2
56.785.7EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.7 PlusQwen
51.1±11.7
58.883.085.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K2.5MoonshotAI
44.2±12.2
56.082.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GLM-5Z.ai
43.8±12.2
55.183.1EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Provisional-модели — без места10
Claude Opus 5Anthropic
64.3±17.1
89.8ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3.1 ProGoogle
59.7±17.3
93.2ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.8Anthropic
55±17.1
87.6ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.6Anthropic
54±17.3
92.2ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3 ProGoogle
54±17.3
92.2ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.5-27BQwen
45.4±16.4
82.2ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.5-122B-A10BQwen
45.4±16.4
82.2ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.5-35B-A3BQwen
41.6±16.4
81.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3
36.7±16.4
79.4ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
gpt-oss-120bOpenAI
31.5±17.3
82.8ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.

Что измеряет этот рейтинг

Какая AI-модель лучше подходит для нескольких языков?

Рейтинг охватывает понимание языков, генерацию, перенос рассуждения и малоресурсные языки. Текущий запуск может покрывать только часть этих измерений.

Доступные данные покрывают 2/4 измерений и показывают 4 столбцов бенчмарков.

Четыре измерения способности

Четыре измерения заданы схемой категории. Доступные данные могут покрывать только часть из них. Измерение без свидетельств не считается подтверждённой способностью.

Межъязыковое понимание

Сейчас это измерение поддерживают 3 столбцов бенчмарков.

  • NOVA-63
  • AA Global-MMLU-Lite
  • INCLUDE

Многоязычная генерация

В доступных данных нет подходящих свидетельств для этого измерения. Оно не влияет на Category Score.

Перенос рассуждений

Сейчас это измерение поддерживают 1 столбцов бенчмарков.

  • MMLU-ProX

Устойчивость для малоресурсных языков

В доступных данных нет подходящих свидетельств для этого измерения. Оно не влияет на Category Score.

Мультиязычные задачи для сравнения

  • Перевод и локализация с сохранением смысла, тона и терминов.
  • Поддержка на разных языках с пониманием разных формулировок.
  • Поиск материалов на одном языке и ответ на другом.

Как выбрать модель по этому рейтингу

  1. Шаг 1

    Сначала проверьте статус

    Только Rated-модели получают место. Estimated и Provisional не имеют формальной позиции.

  2. Шаг 2

    Затем изучите интервал и свидетельства

    Если оценки близки, не смотрите только на место. Проверьте неопределённость, измерения и число бенчмарков.

  3. Шаг 3

    В конце проверьте реальную задачу

    Рейтинг не заменяет ваш тест. Вместе проверяйте качество, скорость, цену, контекст и ограничения провайдера.

Проверяйте точный целевой язык. Учитывайте диалекты, письмо, культуру и профессиональные термины.

Что означают статусы

Rated

Rated означает, что правила по свидетельствам и пересечениям выполнены. Модель может получить формальный ранг.

Estimated

Estimated означает, что полезные свидетельства есть, но их недостаточно для формального ранга.

Provisional

Provisional означает мало свидетельств или недостаточное покрытие аспектов и семейств бенчмарков для статуса Estimated. Это только ранний сигнал.

Бенчмарки и источники свидетельств

Названия источников и группы бенчмарков взяты из доступных данных оценки. Один источник может дать несколько бенчмарков.

  • BenchLM

    AA Global-MMLU-Lite, INCLUDE, MMLU-ProX и NOVA-63

Как строится мультиязычный рейтинг

LMSpeed объединяет подходящие сторонние бенчмарки в четырёх фиксированных измерениях. Rated-модели получают формальный ранг, а Estimated и Provisional остаются видимыми без позиции.

Подробнее о методологии Category Score

Ограничения рейтинга

Category Score использует сторонние бенчмарки, которые сейчас включены в LMSpeed. Тесты могут отличаться данными, запросами и правилами оценки. Результат не вечный и не описывает каждую реальную задачу. Важный выбор проверяйте на своих данных.

Частые вопросы

Какая доступная модель имеет самый высокий формальный ранг?

Сейчас формального первого места нет. На странице есть Estimated моделей 7 и Provisional моделей 10. У них нет формального ранга, поэтому их нельзя называть победителями.

Можно ли сравнивать оценки разных категорий?

Нет. Каждая категория использует свои измерения и свидетельства. Category Score сравним только внутри одной таблицы. Для другой задачи откройте её категорию.

Полезны ли Estimated и Provisional модели?

Они помогают найти кандидатов, но свидетельств пока недостаточно для формального ранга. Сначала изучите покрытие и неопределённость, затем проверьте модель на реальной задаче.

Как часто обновляется рейтинг?

Рейтинг обновляется после публикации нового завершённого запуска. Дата и версия методики указаны выше. LMSpeed не обещает фиксированное ежедневное или еженедельное обновление.

Модель на первом месте всегда лучше для меня?

Нет. Результат также зависит от скорости, цены, длины контекста, инструментов, региона и ограничений провайдера. Сначала сократите список, затем проведите свой тест.

Высокая мультиязычная оценка означает поддержку всех языков?

Нет. Оценка отражает только свидетельства текущего запуска. Каждый язык, диалект, тип письма и профессиональную область нужно проверять отдельно.