Библиотека моделей
LMSpeed — это каталог AI-моделей для сравнения цен API, скорости вывода, задержки первого токена, охвата провайдеров и данных бенчмарков. Сначала сузьте выбор модели и провайдера, затем проверьте endpoint для своей задачи.
Цена, скорость, задержка и доступность могут меняться. Считайте эту таблицу текущим сигналом и проверьте свой endpoint перед запуском.
| Модель | Контекст | Ввод | Вывод | Провайдеры | Агенты | Кодинг | Рассуждения | Знания | Математика | Мультиязычность | Мультимодальность | Следование инструкциям | Пропускная способность | Задержка | Дата выпуска | |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| GLM 5.3Z.ai | Контекст1.0M | Ввод$1.40/M | Вывод$4.40/M | Провайдеры +5 | — | 63.6±16.0P | 61.4±13.9P | — | — | — | — | — | Пропускная способность 533 t/s | Задержка 46.16с | Дата выпуска2026-08-18 |
|
| Qwen3.8 27BQwen | Контекст1M | Ввод$0.500/M | Вывод$3.00/M | Провайдеры— | 57.2±11.9E | 54±10.6E | 51.2±13.9P | 41.5±16.1P | — | — | 57.7±11.3E | 56.1±16.0P | Пропускная способность — | Задержка — | Дата выпуска2026-08-14 |
|
| Gemini 3.7 FlashGoogle | Контекст1.0M | Ввод$0.750/M | Вывод$3.75/M | Провайдеры +7 | 57.2±8.6 | 58.5±11.9E | 59.4±10.8E | 57.3±14.0P | — | — | 57.2±16.1P | — | Пропускная способность — | Задержка — | Дата выпуска2026-08-13 |
|
| Qwen3 Reranker 8BQwen | Контекст41.0K | Ввод— | Вывод— | Провайдеры | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2026-08-13 |
|
| Qwen3.8 2.4T A95BQwen | Контекст1.0M | Ввод$2.00/M | Вывод$6.00/M | Провайдеры— | — | 60.3±16.0P | 62.7±13.9P | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2026-08-12 |
|
| Grok 4.6SpaceXAI | Контекст500K | Ввод$2.00/M | Вывод$6.00/M | Провайдеры +16 | 62.8±8.6 | 58.8±11.9E | 59.4±10.8E | 58.4±14.0P | — | — | — | — | Пропускная способность 109 t/s | Задержка 10.11с | Дата выпуска2026-08-12 |
|
| DeepSeek V4 Pro 0813DeepSeek | Контекст1.0M | Ввод— | Вывод— | Провайдеры— | 57.5±7.7 | 57.1±6.1 | 61±8.3 | 58.4±18.0P | 58.9±12.2E | — | — | 54.9±16.0P | Пропускная способность — | Задержка — | Дата выпуска2026-08-12 |
|
| Nemotron 3.5 LightningNVIDIA | Контекст262.1K | Ввод$0.070/M | Вывод$0.220/M | Провайдеры +4 | — | 46.4±16.0P | 49±13.9P | — | — | — | — | — | Пропускная способность 301 t/s | Задержка 27.18с | Дата выпуска2026-08-11 |
|
| Solar Pro 4Upstage | Контекст524.3K | Ввод$0.300/M | Вывод$1.20/M | Провайдеры | — | 54.9±16.0P | 58.1±13.9P | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2026-08-10 |
|
| Muse Glimmer 30BMeta | Контекст131.1K | Ввод— | Вывод— | Провайдеры— | 47.7±10.2E | 46.6±6.9 | 56.1±10.8E | 43.3±16.0P | 46.1±16.3P | — | 46.4±9.4E | 55.1±16.0P | Пропускная способность — | Задержка — | Дата выпуска2026-08-09 |
|
| Ling 3.0 TinyinclusionAI | Контекст262.1K | Ввод— | Вывод— | Провайдеры | — | 40.2±16.0P | 48.4±13.9P | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2026-08-06 |
|
| Muse Spark 1.2Meta | Контекст1.0M | Ввод$1.25/M | Вывод$4.25/M | Провайдеры +2 | 56.9±9.3E | 57.7±11.9E | 61.3±10.8E | 55.4±14.0P | — | — | — | — | Пропускная способность 69 t/s | Задержка 22.53с | Дата выпуска2026-08-05 |
|
| Qwen3.8 MaxQwen | Контекст1M | Ввод$2.00/M | Вывод$6.00/M | Провайдеры +24 | 66.4±10.9E | 66.2±11.2E | 64.5±10.1E | 52.7±14.0P | — | — | 64.7±6.3 | 57.7±16.0P | Пропускная способность 325 t/s | Задержка 4.71с | Дата выпуска2026-08-03 |
|
| Inkling SmallThinking Machines | Контекст1.0M | Ввод$0.300/M | Вывод$1.20/M | Провайдеры | 55.7±10.9E | 52.7±6.9 | 50.9±8.7 | 52.3±14.0P | 52.5±14.4P | — | 45.9±11.9E | 57.4±16.0P | Пропускная способность — | Задержка — | Дата выпуска2026-07-30 |
|
| DeepSeek V4 Flash 0731DeepSeek | Контекст1.3M | Ввод— | Вывод— | Провайдеры | 52.1±8.4 | 53±6.3 | 59.4±8.3 | 47.5±18.0P | 57.9±12.2E | — | — | — | Пропускная способность 74 t/s | Задержка 2.70с | Дата выпуска2026-07-31 |
|
| Qwen3.7 FlashQwen | Контекст1M | Ввод— | Вывод— | Провайдеры +4 | — | — | — | — | — | — | — | — | Пропускная способность 388 t/s | Задержка 11.58с | Дата выпуска2026-07-27 |
|
| Claude Opus 5Anthropic | Контекст1M | Ввод$5.00/M | Вывод$25.00/M | Провайдеры +83 | 66.1±8.2 | 67.8±6.6 | 60.3±8.7 | 67.2±14.0P | — | 64.3±17.1P | 57.9±17.3P | — | Пропускная способность 320 t/s | Задержка 4.96с | Дата выпуска2026-07-24 |
|
| Ling-3.0-flashInclusionai | Контекст262.1K | Ввод$0.075/M | Вывод$0.220/M | Провайдеры +10 | 47.8±10.2E | 50.2±9.3E | 52.7±10.8E | 38.2±14.0P | 46.7±11.5E | — | — | 54.1±16.0P | Пропускная способность — | Задержка — | Дата выпуска2026-07-23 |
|
| Laguna S 2.1Poolside | Контекст1.0M | Ввод— | Вывод— | Провайдеры +12 | 53.5±16.0P | 54.1±9.3E | — | — | — | — | — | — | Пропускная способность 41 t/s | Задержка 1.46с | Дата выпуска2026-07-21 |
|
| Gemini 3.5 Flash-LiteGoogle | Контекст1.0M | Ввод$0.300/M | Вывод$2.50/M | Провайдеры +38 | 43.6±8.8 | 47.2±9.3E | 53.1±10.8E | 51.4±14.0P | — | — | 45.8±17.3P | — | Пропускная способность — | Задержка — | Дата выпуска2026-07-21 |
|
| Gemini 3.6 FlashGoogle | Контекст1.0M | Ввод$0.750/M | Вывод$3.75/M | Провайдеры +65 | 53.3±8.6 | 55.7±11.9E | 59.7±10.8E | 57.3±14.0P | — | — | 50.6±17.3P | — | Пропускная способность 737 t/s | Задержка 2.34с | Дата выпуска2026-07-21 |
|
| InklingThinking Machines | Контекст1.0M | Ввод$1.00/M | Вывод$4.05/M | Провайдеры +12 | 50.9±8.3 | 49.8±6.9 | 55.4±10.8E | 53.1±14.0P | 65.4±16.3P | — | 45.8±11.9E | 56.3±16.0P | Пропускная способность 25 t/s | Задержка 0.79с | Дата выпуска2026-07-17 |
|
| Nemotron 3 Embed 1BNVIDIA | Контекст32.8K | Ввод— | Вывод— | Провайдеры | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2026-07-16 |
|
| Muse Spark 1.1Meta | Контекст1.0M | Ввод$1.25/M | Вывод$4.25/M | Провайдеры +2 | 63.1±7.4 | 59.1±9.3E | 59.5±10.2E | 65.7±14.0P | — | — | 56.8±16.1P | — | Пропускная способность — | Задержка — | Дата выпуска2026-07-16 |
|
| Kimi K3MoonshotAI | Контекст1.0M | Ввод$3.00/M | Вывод$15.00/M | Провайдеры +83 | 68.3±7.3 | 57.4±11.9E | 59.3±10.8E | 61.4±14.0P | — | — | 65±11.3E | — | Пропускная способность 161 t/s | Задержка 27.59с | Дата выпуска2026-07-16 |
|
| KAT-Coder-Pro V2.5Kwaipilot | Контекст256K | Ввод— | Вывод— | Провайдеры +2 | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2026-07-10 |
|
| Qwen3 Embedding 4BQwen | Контекст32.8K | Ввод— | Вывод— | Провайдеры | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2025-10-28 |
|
| Qwen3 Embedding 8BQwen | Контекст32.8K | Ввод— | Вывод— | Провайдеры | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2025-10-28 |
|
| Mistral Embed 2312Mistral | Контекст8.2K | Ввод— | Вывод— | Провайдеры | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2025-10-31 |
|
| FLUX.2 FlexBlack Forest Labs | Контекст67.3K | Ввод— | Вывод— | Провайдеры | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2025-11-25 |
|
| FLUX.2 Klein 4BBlack Forest Labs | Контекст41.0K | Ввод— | Вывод— | Провайдеры | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2026-01-14 |
|
| Llama Nemotron Embed VL 1B V2NVIDIA | Контекст131.1K | Ввод— | Вывод— | Провайдеры | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2026-02-25 |
|
| Gemini Embedding 2 PreviewGoogle | Контекст8.2K | Ввод— | Вывод— | Провайдеры | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2026-04-17 |
|
| Gemini 3.1 Flash TTS PreviewGoogle | Контекст32.8K | Ввод— | Вывод— | Провайдеры +7 | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2026-04-24 |
|
| Qwen3 ASR FlashQwen | Контекст0 | Ввод— | Вывод— | Провайдеры | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2026-05-14 |
|
| MAI-Image-2.5Microsoft | Контекст4.1K | Ввод— | Вывод— | Провайдеры | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2026-06-02 |
|
| Llama Nemotron Rerank VL 1B V2NVIDIA | Контекст10.2K | Ввод— | Вывод— | Провайдеры— | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2026-06-09 |
|
| GPT-5.6 Sol ProOpenAI | Контекст1.1M | Ввод— | Вывод— | Провайдеры +2 | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2026-07-09 |
|
| GPT-5.6 Terra ProOpenAI | Контекст1.1M | Ввод— | Вывод— | Провайдеры +2 | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2026-07-09 |
|
| GPT-5.6 Luna ProOpenAI | Контекст1.1M | Ввод— | Вывод— | Провайдеры +3 | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2026-07-09 |
|
| GPT-3.5 Turbo 16kOpenAI | Контекст16.4K | Ввод— | Вывод— | Провайдеры +1 | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2023-08-28 |
|
| GPT-4 Turbo PreviewOpenAI | Контекст128K | Ввод— | Вывод— | Провайдеры | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2024-01-25 |
|
| GPT-3.5 Turbo (older v0613)OpenAI | Контекст4.1K | Ввод— | Вывод— | Провайдеры +1 | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2024-01-25 |
|
| Llama 3 8B InstructMeta | Контекст8.2K | Ввод— | Вывод— | Провайдеры +1 | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска— |
|
| GPT-4o (2024-05-13)OpenAI | Контекст128K | Ввод$5.00/M | Вывод$15.00/M | Провайдеры | — | 43.4±13.9P | 42.7±11.1E | — | 46±11.8E | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2024-05-13 |
|
| GPT-4o-mini (2024-07-18)OpenAI | Контекст128K | Ввод— | Вывод— | Провайдеры | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2024-07-18 |
|
| Llama 3.1 70B InstructMeta | Контекст131.1K | Ввод— | Вывод— | Провайдеры +1 | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2024-07-23 |
|
| Llama 3.1 8B InstructMeta | Контекст131.1K | Ввод— | Вывод— | Провайдеры +2 | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2024-07-23 |
|
| GPT-4o (2024-08-06)OpenAI | Контекст128K | Ввод$2.50/M | Вывод$10.00/M | Провайдеры | — | 44.3±13.9P | 39.1±13.9P | — | 46.2±11.8E | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2024-08-06 |
|
| Hermes 3 70B InstructNous | Контекст131.1K | Ввод$0.700/M | Вывод$0.700/M | Провайдеры— | — | 36.5±13.9P | 37.7±11.1E | — | 39.6±11.8E | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2024-08-18 |
|
| Llama 3.2 11B Vision InstructMeta | Контекст131.1K | Ввод— | Вывод— | Провайдеры +4 | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2024-09-25 |
|
| Llama 3.2 1B InstructMeta | Контекст60K | Ввод— | Вывод— | Провайдеры +4 | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2024-09-25 |
|
| Llama 3.2 3B InstructMeta | Контекст131.1K | Ввод— | Вывод— | Провайдеры +8 | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2024-09-25 |
|
| Mistral Large 2407Mistralai | Контекст131.1K | Ввод$2.00/M | Вывод$6.00/M | Провайдеры | — | 40.3±13.9P | 41.1±11.1E | — | 44.5±11.8E | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2024-11-19 |
|
| GPT-4o (2024-11-20)OpenAI | Контекст128K | Ввод— | Вывод— | Провайдеры | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2024-11-20 |
|
| Llama 3.3 70B InstructMeta | Контекст131.1K | Ввод— | Вывод— | Провайдеры +6 | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2024-12-06 |
|
| DeepSeek V3DeepSeek | Контекст163.8K | Ввод— | Вывод— | Провайдеры +15 | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2024-12-26 |
|
| R1 Distill Llama 70BDeepSeek | Контекст8.2K | Ввод$0.700/M | Вывод$1.10/M | Провайдеры | — | 42.6±13.9P | 45.3±11.1E | — | 55±11.8E | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2025-01-23 |
|
| Qwen2.5 VL 72B InstructQwen | Контекст128K | Ввод— | Вывод— | Провайдеры | — | — | — | — | — | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2025-02-01 |
|
| o3 Mini HighOpenAI | Контекст200K | Ввод$1.10/M | Вывод$4.40/M | Провайдеры | — | 53.3±13.9P | 51±11.1E | — | 61.3±11.8E | — | — | — | Пропускная способность — | Задержка — | Дата выпуска2025-02-12 |
|
Как читать оценки категорий
Агенты, кодирование, рассуждение и другие столбцы — это оценки наблюдаемой способности 0–100 относительно допустимых моделей запуска Category Score V3.
Это не вероятность успеха, не IQ и не среднее восьми категорий. Читайте их вместе с 80% интервалом, измеренными аспектами, семействами бенчмарков и доказательствами на странице модели.
Что показывает этот каталог
В каждой строке собрана информация для сравнения LLM API. Поля остаются пустыми, если у LMSpeed нет текущих данных по модели или провайдеру.
- Цена API
- Сравнивайте цену входных и выходных токенов за миллион, когда данные доступны.
- Скорость и задержка
- Используйте пропускную способность и задержку первого токена для сравнения ответа.
- Охват провайдеров
- Откройте модель, чтобы увидеть перечисленных провайдеров и текущие данные.
- Данные о возможностях
- Используйте столбцы возможностей, когда текущие оценки модели доступны.
Как использовать каталог моделей
Сначала выберите главный критерий для вашей задачи, затем сравните текущие строки и проверьте endpoint.
- Найдите модель.Ищите по названию модели, slug или описанию.
- Отсортируйте нужную метрику.Сортируйте по цене, пропускной способности, задержке, числу провайдеров или данным о возможностях.
- Сравните провайдеров.Откройте страницу модели, чтобы просмотреть варианты провайдеров и текущие данные.
- Проверьте свой endpoint.Запустите тест скорости перед использованием endpoint в production.
Frequently Asked Questions
How does LMSpeed benchmark AI models?
LMSpeed runs standardized five-round API speed tests on each model, measuring output throughput (tokens per second), first-token latency, and total response time across multiple providers.
Which AI model has the lowest API latency?
Latency varies by provider and model. Use the LMSpeed model directory to sort by latency and find the model with the fastest first-token response time. Check the latency leaderboard for monthly rankings.
How to compare LLM API pricing across providers?
LMSpeed lists input and output token prices per million for each model across available providers. Sort by price to find a lower-cost option, or filter by provider to compare rates side by side.
What is an AI model directory?
An AI model directory is a searchable list of models and their comparison data. On LMSpeed, it brings together API price, throughput, first-token latency, provider coverage, and capability data when available.
How do I choose a model and provider?
Start with the metric that matters most for your workload. Then open a model page to compare provider data. Run your own speed test before you use an endpoint in production.
Can model price and speed change?
Yes. Price, availability, throughput, and latency can change by model, provider, and time. Use current page values as a comparison signal and confirm with your own endpoint test.
