Рейтинг Category Score V3

LMSpeed Лучшие мультимодальные модели

Сравните модели по восприятию, OCR, документам и пространству, визуальному рассуждению, видео и действиям в одном рейтинге.

Методология 3.0Методология

Текущий вывод

Среди доступных моделей самый высокий формальный ранг у Qwen3.8 Max. Глобальная позиция 1. Category Score равен 64.7, а 80% интервал неопределённости равен ±6.3. Формальный ранг получили 10 доступных моделей. Вывод относится только к этому запуску.

Открыть данные Qwen3.8 MaxРейтинг меняется вместе с данными и методикой. Дата запуска указана выше.

Доступные данные рейтинга

Показано моделей
47
Моделей с формальным рангом
10
Столбцов бенчмарков
10
Измерений со свидетельствами
4/4

Как читать полосы бенчмарков

Каждая полоса сравнивает модели только внутри одного столбца бенчмарка. Длина рассчитана относительно показанных моделей, не является Category Score и несопоставима между столбцами.

МестоМодельОценка LMSpeedВосприятие и OCRДокументы и пространственное пониманиеВизуальное рассуждениеВидео и действия в средеСтатусПокрытиеОбновлено
V*Моделей: undefinedSimpleVQAМоделей: undefinedCharXivМоделей: undefinedMMMU-ProМоделей: undefinedMathVisionМоделей: undefinedERQAМоделей: undefinedMedXpertQA (MM)Моделей: undefinedBenchLM Multimodal Grounded scoreМоделей: undefinedScreenSpot ProМоделей: undefinedVideoMMMUМоделей: undefined
Модели с формальным рейтингом10
1Qwen3.8 MaxQwen
64.7±6.3
75.093.582.395.277.880.484.588.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
2Gemini 3.1 ProGoogle
55.4±6.6
72.480.283.969.481.384.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
3Qwen3.7 PlusQwen
55.1±6.3
81.785.979.090.369.871.079.085.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
4GPT-5.4OpenAI
52.9±6.6
61.182.881.265.477.185.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
5Qwen3.6 PlusQwen
50.7±6.5
96.981.578.888.068.284.0RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
6Qwen3.5
50.2±6.5
95.880.879.088.665.684.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
7Gemini 3 ProGoogle
49.9±6.5
88.081.481.086.672.787.6RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
8Qwen3.6 27BQwen
46.3±6.5
94.756.178.475.862.584.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
9Qwen3.6 35B A3BQwen
44.1±7.0
58.978.075.383.7RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
10Claude Opus 4.5Anthropic
32.4±6.5
67.068.570.674.345.784.4RatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Estimated-модели — без места18
Kimi K3MoonshotAI
65±11.3
91.381.694.3EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.8Anthropic
59.6±12.0
89.987.9EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.8 27BQwen
57.7±11.3
90.290.065.5EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3.5 FlashGoogle
56.3±11.9
84.283.6EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K2.6MoonshotAI
53.5±9.0
96.980.479.487.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Kimi K2.5MoonshotAI
52.7±12.0
78.586.6EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiMo-V2.5Xiaomi
49.1±11.9
81.077.9EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.5-27BQwen
49±12.1
93.786.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.6Anthropic
48.4±11.1
77.351.664.883.1EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.5-122B-A10BQwen
47.7±9.4
93.277.286.2EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
MiniMax M3MiniMax
46.9±12.0
78.184.6EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Muse Glimmer 30BMeta
46.4±9.4
78.874.075.4EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Inkling SmallThinking Machines
45.9±11.9
81.374.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Qwen3.5-35B-A3BQwen
45.8±12.1
92.783.9EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
InklingThinking Machines
45.8±11.9
82.073.5EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.2OpenAI
42.3±9.0
75.982.179.583.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Grok 4.20SpaceXAI
40.2±8.9
57.460.975.254.165.8EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Command ACohere
29.1±11.9
52.763.0EstimatedИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Provisional-модели — без места19
GPT-5.4 ProOpenAI
73±16.1
94.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 4.7 MaxAnthropic
60.7±16.1
91.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.6 SolOpenAI
59.5±16.1
83.0ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Step 3.7 FlashStepFun
59±14.5
95.379.2ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3.7 FlashGoogle
57.2±16.1
88.7ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Muse Spark 1.1Meta
56.8±16.1
88.4ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Sonnet 5Anthropic
56.6±16.1
88.3ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Opus 5Anthropic
56.4±17.3
85.9ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.5OpenAI
55.7±16.1
81.2ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.6 TerraOpenAI
54.7±16.1
80.7ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3.6 FlashGoogle
51.1±17.3
72.7ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.6 LunaOpenAI
50.3±16.1
78.4ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Grok 4.3SpaceXAI
49.8±16.1
78.1ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.4 MiniOpenAI
47.1±16.1
76.6ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3.5 Flash-LiteGoogle
46.9±17.3
62.3ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Fable 5Anthropic
46.3±17.3
60.8ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Claude Sonnet 4.6Anthropic
45.7±16.1
77.4ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
Gemini 3.1 Flash LiteGoogle
42.6±16.1
73.2ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.
GPT-5.4 NanoOpenAI
31.2±16.1
66.1ProvisionalИзмерения: undefined/4 · семейств: undefined28 авг. 2026 г.

Что измеряет этот рейтинг

Какая AI-модель лучше подходит для изображений и документов?

Рейтинг охватывает восприятие, OCR, документы, пространство, визуальное рассуждение, видео и действия. Поддерживаемые входы могут отличаться.

Доступные данные покрывают 4/4 измерений и показывают 10 столбцов бенчмарков.

Четыре измерения способности

Четыре измерения заданы схемой категории. Доступные данные могут покрывать только часть из них. Измерение без свидетельств не считается подтверждённой способностью.

Восприятие и OCR

Сейчас это измерение поддерживают 2 столбцов бенчмарков.

  • V*
  • SimpleVQA

Документы и пространственное понимание

Сейчас это измерение поддерживают 1 столбцов бенчмарков.

  • CharXiv

Визуальное рассуждение

Сейчас это измерение поддерживают 5 столбцов бенчмарков.

  • MMMU-Pro
  • MathVision
  • ERQA
  • MedXpertQA (MM)
  • BenchLM Multimodal Grounded score

Видео и действия в среде

Сейчас это измерение поддерживают 2 столбцов бенчмарков.

  • ScreenSpot Pro
  • VideoMMMU

Мультимодальные задачи для сравнения

  • Извлечение из документов с текстом, таблицами, макетом и связями страниц.
  • Вопросы по изображениям с визуальными деталями и текстовым рассуждением.
  • Видео и визуальные агенты, которые понимают процесс и используют зрение для действий.

Как выбрать модель по этому рейтингу

  1. Шаг 1

    Сначала проверьте статус

    Только Rated-модели получают место. Estimated и Provisional не имеют формальной позиции.

  2. Шаг 2

    Затем изучите интервал и свидетельства

    Если оценки близки, не смотрите только на место. Проверьте неопределённость, измерения и число бенчмарков.

  3. Шаг 3

    В конце проверьте реальную задачу

    Рейтинг не заменяет ваш тест. Вместе проверяйте качество, скорость, цену, контекст и ограничения провайдера.

Сначала проверьте файлы и типы входа. Также учтите языки OCR, лимиты, скорость, цену и приватность.

Что означают статусы

Rated

Rated означает, что правила по свидетельствам и пересечениям выполнены. Модель может получить формальный ранг.

Estimated

Estimated означает, что полезные свидетельства есть, но их недостаточно для формального ранга.

Provisional

Provisional означает мало свидетельств или недостаточное покрытие аспектов и семейств бенчмарков для статуса Estimated. Это только ранний сигнал.

Бенчмарки и источники свидетельств

Названия источников и группы бенчмарков взяты из доступных данных оценки. Один источник может дать несколько бенчмарков.

  • BenchLM

    BenchLM Multimodal Grounded score, CharXiv, ERQA, MathVision, MedXpertQA (MM), MMMU-Pro, ScreenSpot Pro, SimpleVQA, V* и VideoMMMU

Как строится мультимодальный рейтинг

LMSpeed объединяет подходящие сторонние бенчмарки в четырёх фиксированных измерениях. Rated-модели получают формальный ранг, а Estimated и Provisional остаются видимыми без позиции.

Подробнее о методологии Category Score

Ограничения рейтинга

Category Score использует сторонние бенчмарки, которые сейчас включены в LMSpeed. Тесты могут отличаться данными, запросами и правилами оценки. Результат не вечный и не описывает каждую реальную задачу. Важный выбор проверяйте на своих данных.

Частые вопросы

Какая доступная модель имеет самый высокий формальный ранг?

Среди доступных моделей самый высокий формальный ранг у Qwen3.8 Max. Глобальная позиция 1, а Category Score равен 64.7. Правила формального рейтинга выполняют 10 доступных моделей. Результат относится только к дате и версии методики на странице.

Можно ли сравнивать оценки разных категорий?

Нет. Каждая категория использует свои измерения и свидетельства. Category Score сравним только внутри одной таблицы. Для другой задачи откройте её категорию.

Полезны ли Estimated и Provisional модели?

Они помогают найти кандидатов, но свидетельств пока недостаточно для формального ранга. Сначала изучите покрытие и неопределённость, затем проверьте модель на реальной задаче.

Как часто обновляется рейтинг?

Рейтинг обновляется после публикации нового завершённого запуска. Дата и версия методики указаны выше. LMSpeed не обещает фиксированное ежедневное или еженедельное обновление.

Модель на первом месте всегда лучше для меня?

Нет. Результат также зависит от скорости, цены, длины контекста, инструментов, региона и ограничений провайдера. Сначала сократите список, затем проведите свой тест.

Высокая мультимодальная оценка означает поддержку всех форматов?

Нет. Оценка бенчмарка и функции продукта различаются. Проверьте форматы, размер файлов, видео, языки OCR и API провайдера.