Рейтинг Category Score V3
LMSpeed Лучшие мультимодальные модели
Сравните модели по восприятию, OCR, документам и пространству, визуальному рассуждению, видео и действиям в одном рейтинге.
Методология 3.0Методология
Текущий вывод
Среди доступных моделей самый высокий формальный ранг у Qwen3.8 Max. Глобальная позиция 1. Category Score равен 64.7, а 80% интервал неопределённости равен ±6.3. Формальный ранг получили 10 доступных моделей. Вывод относится только к этому запуску.
Доступные данные рейтинга
- Показано моделей
- 47
- Моделей с формальным рангом
- 10
- Столбцов бенчмарков
- 10
- Измерений со свидетельствами
- 4/4
Как читать полосы бенчмарков
Каждая полоса сравнивает модели только внутри одного столбца бенчмарка. Длина рассчитана относительно показанных моделей, не является Category Score и несопоставима между столбцами.
| Место | Модель | Оценка LMSpeed | Восприятие и OCR | Документы и пространственное понимание | Визуальное рассуждение | Видео и действия в среде | Статус | Покрытие | Обновлено | ||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| V*Моделей: undefined | SimpleVQAМоделей: undefined | CharXivМоделей: undefined | MMMU-ProМоделей: undefined | MathVisionМоделей: undefined | ERQAМоделей: undefined | MedXpertQA (MM)Моделей: undefined | BenchLM Multimodal Grounded scoreМоделей: undefined | ScreenSpot ProМоделей: undefined | VideoMMMUМоделей: undefined | ||||||
| Модели с формальным рейтингом10 | |||||||||||||||
| 1 | Qwen3.8 MaxQwen | 64.7±6.3 | — | 75.0 | 93.5 | 82.3 | 95.2 | 77.8 | 80.4 | — | 84.5 | 88.7 | Rated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| 2 | Gemini 3.1 ProGoogle | 55.4±6.6 | — | 72.4 | 80.2 | 83.9 | — | 69.4 | 81.3 | — | 84.4 | — | Rated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| 3 | Qwen3.7 PlusQwen | 55.1±6.3 | — | 81.7 | 85.9 | 79.0 | 90.3 | 69.8 | 71.0 | — | 79.0 | 85.4 | Rated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| 4 | GPT-5.4OpenAI | 52.9±6.6 | — | 61.1 | 82.8 | 81.2 | — | 65.4 | 77.1 | — | 85.4 | — | Rated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| 5 | Qwen3.6 PlusQwen | 50.7±6.5 | 96.9 | — | 81.5 | 78.8 | 88.0 | — | — | — | 68.2 | 84.0 | Rated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| 6 | Qwen3.5 | 50.2±6.5 | 95.8 | — | 80.8 | 79.0 | 88.6 | — | — | — | 65.6 | 84.7 | Rated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| 7 | Gemini 3 ProGoogle | 49.9±6.5 | 88.0 | — | 81.4 | 81.0 | 86.6 | — | — | — | 72.7 | 87.6 | Rated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| 8 | Qwen3.6 27BQwen | 46.3±6.5 | 94.7 | 56.1 | 78.4 | 75.8 | — | 62.5 | — | — | — | 84.4 | Rated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| 9 | Qwen3.6 35B A3BQwen | 44.1±7.0 | — | 58.9 | 78.0 | 75.3 | — | — | — | — | — | 83.7 | Rated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| 10 | Claude Opus 4.5Anthropic | 32.4±6.5 | 67.0 | — | 68.5 | 70.6 | 74.3 | — | — | — | 45.7 | 84.4 | Rated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| Estimated-модели — без места18 | |||||||||||||||
| — | Kimi K3MoonshotAI | 65±11.3 | — | — | 91.3 | 81.6 | 94.3 | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude Opus 4.8Anthropic | 59.6±12.0 | — | — | 89.9 | — | — | — | — | — | 87.9 | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3.8 27BQwen | 57.7±11.3 | — | — | 90.2 | — | 90.0 | 65.5 | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Gemini 3.5 FlashGoogle | 56.3±11.9 | — | — | 84.2 | 83.6 | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Kimi K2.6MoonshotAI | 53.5±9.0 | 96.9 | — | 80.4 | 79.4 | 87.4 | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Kimi K2.5MoonshotAI | 52.7±12.0 | — | — | — | 78.5 | — | — | — | — | — | 86.6 | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | MiMo-V2.5Xiaomi | 49.1±11.9 | — | — | 81.0 | 77.9 | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3.5-27BQwen | 49±12.1 | 93.7 | — | — | — | 86.0 | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude Opus 4.6Anthropic | 48.4±11.1 | — | — | — | 77.3 | — | 51.6 | 64.8 | — | 83.1 | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3.5-122B-A10BQwen | 47.7±9.4 | 93.2 | — | 77.2 | — | 86.2 | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | MiniMax M3MiniMax | 46.9±12.0 | — | — | — | 78.1 | — | — | — | — | — | 84.6 | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Muse Glimmer 30BMeta | 46.4±9.4 | — | — | 78.8 | 74.0 | — | — | — | — | 75.4 | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Inkling SmallThinking Machines | 45.9±11.9 | — | — | 81.3 | 74.0 | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Qwen3.5-35B-A3BQwen | 45.8±12.1 | 92.7 | — | — | — | 83.9 | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | InklingThinking Machines | 45.8±11.9 | — | — | 82.0 | 73.5 | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-5.2OpenAI | 42.3±9.0 | 75.9 | — | 82.1 | 79.5 | 83.0 | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Grok 4.20SpaceXAI | 40.2±8.9 | — | 57.4 | 60.9 | 75.2 | — | 54.1 | 65.8 | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Command ACohere | 29.1±11.9 | — | — | 52.7 | 63.0 | — | — | — | — | — | — | Estimated | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| Provisional-модели — без места19 | |||||||||||||||
| — | GPT-5.4 ProOpenAI | 73±16.1 | — | — | — | 94.0 | — | — | — | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude Opus 4.7 MaxAnthropic | 60.7±16.1 | — | — | 91.0 | — | — | — | — | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-5.6 SolOpenAI | 59.5±16.1 | — | — | — | 83.0 | — | — | — | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Step 3.7 FlashStepFun | 59±14.5 | 95.3 | 79.2 | — | — | — | — | — | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Gemini 3.7 FlashGoogle | 57.2±16.1 | — | — | 88.7 | — | — | — | — | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Muse Spark 1.1Meta | 56.8±16.1 | — | — | 88.4 | — | — | — | — | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude Sonnet 5Anthropic | 56.6±16.1 | — | — | 88.3 | — | — | — | — | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude Opus 5Anthropic | 56.4±17.3 | — | — | — | — | — | — | — | 85.9 | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-5.5OpenAI | 55.7±16.1 | — | — | — | 81.2 | — | — | — | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-5.6 TerraOpenAI | 54.7±16.1 | — | — | — | 80.7 | — | — | — | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Gemini 3.6 FlashGoogle | 51.1±17.3 | — | — | — | — | — | — | — | 72.7 | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-5.6 LunaOpenAI | 50.3±16.1 | — | — | — | 78.4 | — | — | — | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Grok 4.3SpaceXAI | 49.8±16.1 | — | — | — | 78.1 | — | — | — | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-5.4 MiniOpenAI | 47.1±16.1 | — | — | — | 76.6 | — | — | — | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Gemini 3.5 Flash-LiteGoogle | 46.9±17.3 | — | — | — | — | — | — | — | 62.3 | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude Fable 5Anthropic | 46.3±17.3 | — | — | — | — | — | — | — | 60.8 | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Claude Sonnet 4.6Anthropic | 45.7±16.1 | — | — | 77.4 | — | — | — | — | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | Gemini 3.1 Flash LiteGoogle | 42.6±16.1 | — | — | 73.2 | — | — | — | — | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
| — | GPT-5.4 NanoOpenAI | 31.2±16.1 | — | — | — | 66.1 | — | — | — | — | — | — | Provisional | Измерения: undefined/4 · семейств: undefined | 28 авг. 2026 г. |
Что измеряет этот рейтинг
Какая AI-модель лучше подходит для изображений и документов?
Рейтинг охватывает восприятие, OCR, документы, пространство, визуальное рассуждение, видео и действия. Поддерживаемые входы могут отличаться.
Четыре измерения способности
Четыре измерения заданы схемой категории. Доступные данные могут покрывать только часть из них. Измерение без свидетельств не считается подтверждённой способностью.
Восприятие и OCR
Сейчас это измерение поддерживают 2 столбцов бенчмарков.
- V*
- SimpleVQA
Документы и пространственное понимание
Сейчас это измерение поддерживают 1 столбцов бенчмарков.
- CharXiv
Визуальное рассуждение
Сейчас это измерение поддерживают 5 столбцов бенчмарков.
- MMMU-Pro
- MathVision
- ERQA
- MedXpertQA (MM)
- BenchLM Multimodal Grounded score
Видео и действия в среде
Сейчас это измерение поддерживают 2 столбцов бенчмарков.
- ScreenSpot Pro
- VideoMMMU
Мультимодальные задачи для сравнения
- Извлечение из документов с текстом, таблицами, макетом и связями страниц.
- Вопросы по изображениям с визуальными деталями и текстовым рассуждением.
- Видео и визуальные агенты, которые понимают процесс и используют зрение для действий.
Как выбрать модель по этому рейтингу
- Шаг 1
Сначала проверьте статус
Только Rated-модели получают место. Estimated и Provisional не имеют формальной позиции.
- Шаг 2
Затем изучите интервал и свидетельства
Если оценки близки, не смотрите только на место. Проверьте неопределённость, измерения и число бенчмарков.
- Шаг 3
В конце проверьте реальную задачу
Рейтинг не заменяет ваш тест. Вместе проверяйте качество, скорость, цену, контекст и ограничения провайдера.
Сначала проверьте файлы и типы входа. Также учтите языки OCR, лимиты, скорость, цену и приватность.
Что означают статусы
Rated
Rated означает, что правила по свидетельствам и пересечениям выполнены. Модель может получить формальный ранг.
Estimated
Estimated означает, что полезные свидетельства есть, но их недостаточно для формального ранга.
Provisional
Provisional означает мало свидетельств или недостаточное покрытие аспектов и семейств бенчмарков для статуса Estimated. Это только ранний сигнал.
Бенчмарки и источники свидетельств
Названия источников и группы бенчмарков взяты из доступных данных оценки. Один источник может дать несколько бенчмарков.
BenchLM
BenchLM Multimodal Grounded score, CharXiv, ERQA, MathVision, MedXpertQA (MM), MMMU-Pro, ScreenSpot Pro, SimpleVQA, V* и VideoMMMU
Как строится мультимодальный рейтинг
LMSpeed объединяет подходящие сторонние бенчмарки в четырёх фиксированных измерениях. Rated-модели получают формальный ранг, а Estimated и Provisional остаются видимыми без позиции.
Подробнее о методологии Category ScoreОграничения рейтинга
Category Score использует сторонние бенчмарки, которые сейчас включены в LMSpeed. Тесты могут отличаться данными, запросами и правилами оценки. Результат не вечный и не описывает каждую реальную задачу. Важный выбор проверяйте на своих данных.
Частые вопросы
Какая доступная модель имеет самый высокий формальный ранг?
Среди доступных моделей самый высокий формальный ранг у Qwen3.8 Max. Глобальная позиция 1, а Category Score равен 64.7. Правила формального рейтинга выполняют 10 доступных моделей. Результат относится только к дате и версии методики на странице.
Можно ли сравнивать оценки разных категорий?
Нет. Каждая категория использует свои измерения и свидетельства. Category Score сравним только внутри одной таблицы. Для другой задачи откройте её категорию.
Полезны ли Estimated и Provisional модели?
Они помогают найти кандидатов, но свидетельств пока недостаточно для формального ранга. Сначала изучите покрытие и неопределённость, затем проверьте модель на реальной задаче.
Как часто обновляется рейтинг?
Рейтинг обновляется после публикации нового завершённого запуска. Дата и версия методики указаны выше. LMSpeed не обещает фиксированное ежедневное или еженедельное обновление.
Модель на первом месте всегда лучше для меня?
Нет. Результат также зависит от скорости, цены, длины контекста, инструментов, региона и ограничений провайдера. Сначала сократите список, затем проведите свой тест.
Высокая мультимодальная оценка означает поддержку всех форматов?
Нет. Оценка бенчмарка и функции продукта различаются. Проверьте форматы, размер файлов, видео, языки OCR и API провайдера.
