Библиотека моделей

LMSpeed — это каталог AI-моделей для сравнения цен API, скорости вывода, задержки первого токена, охвата провайдеров и данных бенчмарков. Сначала сузьте выбор модели и провайдера, затем проверьте endpoint для своей задачи.

Цена, скорость, задержка и доступность могут меняться. Считайте эту таблицу текущим сигналом и проверьте свой endpoint перед запуском.

МодельКонтекстВводВыводПровайдерыАгентыКодингРассужденияЗнанияМатематикаМультиязычностьМультимодальностьСледование инструкциямПропускная способностьЗадержкаДата выпуска
DeepSeek V3КонтекстВвод$0.360/MВывод$0.890/MПровайдеры
+151
34.6±11.8E
37.4±11.2E
44.4±8.7
41.1±16.0P
49.5±9.3E
39.7±11.9E
Пропускная способность
49 t/s
Задержка
3.39с
Дата выпуска
  • 34.6
  • 37.4
  • 44.4
  • 41.1
  • 49.5
  • 39.7
Qwen3Контекст262.1KВвод$0.200/MВывод$0.800/MПровайдеры
+126
45.6±13.9P
47.6±11.1E
36.9±16.3P
58.3±11.8E
36.7±16.4P
Пропускная способность
100 t/s
Задержка
12.55с
Дата выпуска2025-07-21
  • 45.6
  • 47.6
  • 36.9
  • 58.3
  • 36.7
Qwen3 VLКонтекстВводВыводПровайдеры
+17
Пропускная способность
206 t/s
Задержка
6.63с
Дата выпуска
Devstral 2КонтекстВводВыводПровайдеры
+4
46.1±13.9P
45.3±11.1E
43.2±16.1P
Пропускная способность
71 t/s
Задержка
1.34с
Дата выпуска
  • 46.1
  • 45.3
  • 43.2
Ministral 3КонтекстВвод$0.200/MВывод$0.200/MПровайдеры
+2
31.2±13.9P
36.5±11.1E
40.5±16.1P
Пропускная способность
208 t/s
Задержка
2.84с
Дата выпуска
  • 31.2
  • 36.5
  • 40.5
Mistral Large 3КонтекстВвод$0.500/MВывод$1.50/MПровайдеры
+7
39.3±11.8E
47.9±13.9P
44.5±8.7
41.6±16.0P
43.5±16.1P
42.2±16.0P
Пропускная способность
29 t/s
Задержка
3.00с
Дата выпуска
  • 39.3
  • 47.9
  • 44.5
  • 41.6
  • 43.5
  • 42.2
Qwen3 CoderQwenКонтекст262.1KВводВыводПровайдеры
+61
Пропускная способность
243 t/s
Задержка
5.28с
Дата выпуска2025-07-23
Qwen3 EmbeddingКонтекстВводВыводПровайдеры
+42
Пропускная способность
Задержка
Дата выпуска
Qwen3 NextКонтекстВводВыводПровайдеры
+7
Пропускная способность
Задержка
Дата выпуска
DeepSeek CoderКонтекстВводВыводПровайдеры
+8
Пропускная способность
Задержка
Дата выпуска
Qwen ImageКонтекстВводВыводПровайдеры
+34
Пропускная способность
Задержка
Дата выпуска
Phi 4MicrosoftКонтекст16.4KВвод$0.125/MВывод$0.500/MПровайдеры
+17
28.4±16.0P
39.1±13.9P
39.1±8.7
37.5±16.0P
46.9±11.8E
37.8±16.0P
Пропускная способность
43 t/s
Задержка
1.32с
Дата выпуска2025-01-10
  • 28.4
  • 39.1
  • 39.1
  • 37.5
  • 46.9
  • 37.8
Intern-S1КонтекстВводВыводПровайдеры
+4
Пропускная способность
Задержка
Дата выпуска
MiniMax M1MiniMaxКонтекст1MВвод$0.550/MВывод$2.20/MПровайдеры
+31
51.2±13.9P
49.4±11.1E
58.9±11.8E
Пропускная способность
Задержка
Дата выпуска2025-06-17
  • 51.2
  • 49.4
  • 58.9
MAI-DS-R1КонтекстВводВыводПровайдеры
+10
Пропускная способность
Задержка
Дата выпуска
DeepSeek VL2КонтекстВводВыводПровайдеры
+8
Пропускная способность
126 t/s
Задержка
0.75с
Дата выпуска
GLM-4КонтекстВводВыводПровайдеры
+57
Пропускная способность
61 t/s
Задержка
0.87с
Дата выпуска
GPT-OSSКонтекст131.1KВводВыводПровайдеры
+137
Пропускная способность
378 t/s
Задержка
3.05с
Дата выпуска2025-08-05
GPT-4oOpenAIКонтекст128KВвод$2.50/MВывод$10.00/MПровайдеры
+132
39±16.0P
46±13.9P
39.9±8.7
49±16.0P
42.2±9.3E
41.6±16.0P
Пропускная способность
82 t/s
Задержка
3.44с
Дата выпуска2024-11-20
  • 39
  • 46
  • 39.9
  • 49
  • 42.2
  • 41.6
MiniMax M2.5MiniMaxКонтекст204.8KВвод$0.300/MВывод$1.20/MПровайдеры
+187
50.2±11.8E
54.7±13.9P
Пропускная способность
61 t/s
Задержка
9.68с
Дата выпуска2026-02-12
  • 50.2
  • 54.7
GPT-5.4 MiniOpenAIКонтекст400KВвод$0.750/MВывод$4.50/MПровайдеры
+238
51±8.1
57.6±11.8E
55.6±10.8E
46.6±14.0P
49.7±16.1P
47.1±16.1P
53.6±16.0P
Пропускная способность
134 t/s
Задержка
3.54с
Дата выпуска2026-03-17
  • 51
  • 57.6
  • 55.6
  • 46.6
  • 49.7
  • 47.1
  • 53.6
MiniMax Hailuo 2.3КонтекстВводВыводПровайдеры
+16
Пропускная способность
Задержка
Дата выпуска
GLM-5Z.aiКонтекст204.8KВвод$1.00/MВывод$3.20/MПровайдеры
+187
41.1±5.6
51.5±8.1
48.9±8.1
43.3±16.3P
51.1±9.1E
43.8±12.2E
52.4±11.9E
Пропускная способность
51 t/s
Задержка
21.59с
Дата выпуска2026-02-11
  • 41.1
  • 51.5
  • 48.9
  • 43.3
  • 51.1
  • 43.8
  • 52.4
GPT-4o MiniOpenAIКонтекст128KВвод$0.150/MВывод$0.600/MПровайдеры
+121
30.8±16.0P
37.3±13.9P
40.2±11.1E
53.4±16.0P
46.1±11.8E
40.5±16.0P
Пропускная способность
84 t/s
Задержка
4.10с
Дата выпуска2024-07-18
  • 30.8
  • 37.3
  • 40.2
  • 53.4
  • 46.1
  • 40.5
Claude Sonnet 4.5AnthropicКонтекст1MВвод$3.00/MВывод$15.00/MПровайдеры
+174
46.6±8.7
51.8±11.2E
45.6±8.9E
54.1±16.1P
42.5±12.3E
Пропускная способность
41 t/s
Задержка
4.57с
Дата выпуска2025-09-29
  • 46.6
  • 51.8
  • 45.6
  • 54.1
  • 42.5
GPT-5.1OpenAIКонтекст400KВвод$1.25/MВывод$10.00/MПровайдеры
+153
47.7±9.3E
49.1±11.2E
54±8.7
53±16.0P
54±16.1P
53.5±16.0P
Пропускная способность
142 t/s
Задержка
2.78с
Дата выпуска2025-11-13
  • 47.7
  • 49.1
  • 54
  • 53
  • 54
  • 53.5
GLM-4.6VZ.aiКонтекст131.1KВвод$0.300/MВывод$0.900/MПровайдеры
+61
40±13.9P
49.8±11.1E
52.2±16.1P
Пропускная способность
40 t/s
Задержка
27.37с
Дата выпуска2025-12-08
  • 40
  • 49.8
  • 52.2
Gemini 2.5 ProGoogleКонтекст1.0MВвод$1.25/MВывод$10.00/MПровайдеры
+171
43.6±9.3E
39.1±8.9
54.2±8.7
35±14.0P
56.1±9.3E
45.9±16.0P
Пропускная способность
88 t/s
Задержка
16.94с
Дата выпуска2025-06-17
  • 43.6
  • 39.1
  • 54.2
  • 35
  • 56.1
  • 45.9
O1OpenAIКонтекст200KВвод$15.00/MВывод$60.00/MПровайдеры
+75
45.6±16.0P
50.6±13.9P
50.8±8.7
62.5±17.4P
52.6±9.3E
51.5±11.9E
Пропускная способность
Задержка
Дата выпуска2024-12-17
  • 45.6
  • 50.6
  • 50.8
  • 62.5
  • 52.6
  • 51.5
O1 MiniOpenAIКонтекстВводВыводПровайдеры
+60
47.4±13.9P
44.6±11.1E
54.9±11.8E
Пропускная способность
32 t/s
Задержка
13.84с
Дата выпуска
  • 47.4
  • 44.6
  • 54.9
GPT-4.1OpenAIКонтекст1.0MВвод$2.00/MВывод$8.00/MПровайдеры
+109
40±11.8E
38.3±11.2E
48.6±8.7
57±17.4P
49±9.3E
42.1±11.9E
Пропускная способность
85 t/s
Задержка
1.92с
Дата выпуска2025-04-14
  • 40
  • 38.3
  • 48.6
  • 57
  • 49
  • 42.1
O3OpenAIКонтекст200KВвод$2.00/MВывод$8.00/MПровайдеры
+85
49.3±16.0P
55.3±13.9P
54.4±8.7
47.7±16.0P
58.8±9.3E
53±16.0P
Пропускная способность
134 t/s
Задержка
2.82с
Дата выпуска2025-04-16
  • 49.3
  • 55.3
  • 54.4
  • 47.7
  • 58.8
  • 53
Kimi K2MoonshotAIКонтекст131.1KВвод$0.570/MВывод$2.30/MПровайдеры
+87
45.3±16.0P
48.2±13.9P
48.6±8.7
44.5±16.0P
53.7±9.3E
43.8±16.0P
Пропускная способность
29 t/s
Задержка
2.21с
Дата выпуска2025-09-04
  • 45.3
  • 48.2
  • 48.6
  • 44.5
  • 53.7
  • 43.8
Claude Opus 4.6AnthropicКонтекст1MВвод$5.00/MВывод$25.00/MПровайдеры
+228
54.9±5.7
59±8.0
53.4±8.7
53.7±13.7P
56.5±16.1P
54±17.3P
48.4±11.1E
44.7±16.0P
Пропускная способность
45 t/s
Задержка
5.30с
Дата выпуска2026-02-04
  • 54.9
  • 59
  • 53.4
  • 53.7
  • 56.5
  • 54
  • 48.4
  • 44.7
Gemini 3 ProGoogleКонтекстВвод$2.00/MВывод$12.00/MПровайдеры
+139
49±9.3E
55.6±11.2E
54.1±6.4
56.1±14.0P
55.7±16.1P
54±17.3P
49.9±6.5
52.6±16.0P
Пропускная способность
73 t/s
Задержка
10.59с
Дата выпуска
  • 49
  • 55.6
  • 54.1
  • 56.1
  • 55.7
  • 54
  • 49.9
  • 52.6
Phi 4 Mini InstructКонтекст131.1KВводВыводПровайдеры
+28
27.8±13.9P
34.3±11.1E
42±11.8E
Пропускная способность
Задержка
Дата выпуска2025-10-17
  • 27.8
  • 34.3
  • 42
GPT-5 MiniOpenAIКонтекст400KВвод$0.250/MВывод$2.00/MПровайдеры
+111
49.5±11.2E
53.5±11.1E
52.2±16.1P
Пропускная способность
90 t/s
Задержка
7.03с
Дата выпуска2025-08-07
  • 49.5
  • 53.5
  • 52.2
GPT-5.1 Codex MaxOpenAIКонтекст400KВводВыводПровайдеры
+126
49.9±16.0P
50.8±11.8E
54.4±10.8E
50±16.0P
52.5±16.0P
Пропускная способность
56 t/s
Задержка
6.29с
Дата выпуска2025-12-04
  • 49.9
  • 50.8
  • 54.4
  • 50
  • 52.5
Gemini 1.5 ProGoogleКонтекстВводВыводПровайдеры
+21
40.1±13.9P
39.6±11.1E
54.2±16.0P
43.7±11.8E
Пропускная способность
18 t/s
Задержка
2.58с
Дата выпуска
  • 40.1
  • 39.6
  • 54.2
  • 43.7
GPT-4.1 MiniOpenAIКонтекст1.0MВвод$0.400/MВывод$1.60/MПровайдеры
+112
40.3±11.8E
39±11.2E
45.4±8.7
49.3±17.4P
49.9±9.3E
42.4±11.9E
Пропускная способность
93 t/s
Задержка
2.69с
Дата выпуска2025-04-14
  • 40.3
  • 39
  • 45.4
  • 49.3
  • 49.9
  • 42.4
Grok Imagine VideoSpaceXAIКонтекст0ВводВыводПровайдеры
+21
Пропускная способность
Задержка
Дата выпуска2026-05-18
Claude Opus 4AnthropicКонтекст200KВвод$15.00/MВывод$75.00/MПровайдеры
+91
51.1±13.9P
51.7±11.1E
54.4±11.8E
Пропускная способность
25 t/s
Задержка
12.05с
Дата выпуска2025-05-22
  • 51.1
  • 51.7
  • 54.4
Gemini 2.5 Flash ImageGoogleКонтекст32.8KВводВыводПровайдеры
+93
Пропускная способность
Задержка
Дата выпуска2025-10-07
GPT-5.4OpenAIКонтекст1.1MВвод$2.50/MВывод$15.00/MПровайдеры
+292
57.2±5.1
62.5±10.3E
56.2±8.7
59.9±15.1P
57.6±16.1P
52.9±6.6
53.9±16.0P
Пропускная способность
49 t/s
Задержка
4.45с
Дата выпуска2026-03-05
  • 57.2
  • 62.5
  • 56.2
  • 59.9
  • 57.6
  • 52.9
  • 53.9
GPT Audio MiniOpenAIКонтекст128KВводВыводПровайдеры
+16
Пропускная способность
Задержка
Дата выпуска2026-01-19
GLM-4.7Z.aiКонтекст204.8KВвод$0.600/MВывод$2.20/MПровайдеры
+152
46.7±8.6
53.1±10.5E
54.4±8.7
34.7±14.0P
48.8±12.3E
51.8±16.0P
Пропускная способность
95 t/s
Задержка
19.09с
Дата выпуска2025-12-22
  • 46.7
  • 53.1
  • 54.4
  • 34.7
  • 48.8
  • 51.8
Claude Opus 4.5AnthropicКонтекст200KВвод$5.00/MВывод$25.00/MПровайдеры
+166
48.5±5.3
55.7±8.1
60.7±8.1
57.6±11.6E
49.9±9.1E
51.7±12.2E
32.4±6.5
45.7±11.9E
Пропускная способность
54 t/s
Задержка
3.12с
Дата выпуска2025-11-24
  • 48.5
  • 55.7
  • 60.7
  • 57.6
  • 49.9
  • 51.7
  • 32.4
  • 45.7
GLM-4.6Z.aiКонтекст204.8KВвод$0.550/MВывод$2.20/MПровайдеры
+102
48.4±16.0P
41.9±11.2E
42.9±8.7
43.6±16.0P
44.8±16.1P
42.4±16.0P
Пропускная способность
53 t/s
Задержка
16.68с
Дата выпуска2025-09-30
  • 48.4
  • 41.9
  • 42.9
  • 43.6
  • 44.8
  • 42.4
Gemini 2.5 Flash LiteGoogleКонтекст1.0MВвод$0.100/MВывод$0.400/MПровайдеры
+128
36.3±13.9P
42.8±11.1E
53.3±11.8E
Пропускная способность
277 t/s
Задержка
1.41с
Дата выпуска2025-09-25
  • 36.3
  • 42.8
  • 53.3
DeepSeek R1DeepSeekКонтекст64KВвод$1.35/MВывод$3.00/MПровайдеры
+149
41.2±16.0P
49.7±13.9P
50.2±8.7
44.7±16.0P
57±11.8E
43.3±16.0P
Пропускная способность
52 t/s
Задержка
10.36с
Дата выпуска2025-05-28
  • 41.2
  • 49.7
  • 50.2
  • 44.7
  • 57
  • 43.3
Devstral SmallMistral AIКонтекстВводВыводПровайдеры
+7
38.7±13.9P
39.5±11.1E
43.4±11.8E
Пропускная способность
Задержка
Дата выпуска
  • 38.7
  • 39.5
  • 43.4
GPT-3.5 Turbo InstructOpenAIКонтекст4.1KВводВыводПровайдеры
+44
Пропускная способность
Задержка
Дата выпуска2023-09-28
GPT-3.5 TurboOpenAIКонтекст16.4KВвод$0.500/MВывод$1.50/MПровайдеры
+98
48.8±18.4P
33.4±11.8E
37.8±16.0P
Пропускная способность
115 t/s
Задержка
2.21с
Дата выпуска2024-01-25
  • 48.8
  • 33.4
  • 37.8
Gemini 3.1 Flash LiteGoogleКонтекст1.0MВводВыводПровайдеры
+128
44.5±16.1P
27.5±16.1P
42.6±16.1P
Пропускная способность
191 t/s
Задержка
6.58с
Дата выпуска2026-05-07
  • 44.5
  • 27.5
  • 42.6
O3 ProOpenAIКонтекст200KВвод$20.00/MВывод$80.00/MПровайдеры
+61
54.1±16.0P
60.1±16.0P
Пропускная способность
Задержка
Дата выпуска2025-06-10
  • 54.1
  • 60.1
GPT-4 TurboOpenAIКонтекст128KВвод$10.00/MВывод$30.00/MПровайдеры
+73
43.3±13.9P
43.2±11.8E
53.6±16.0P
45.8±11.8E
Пропускная способность
50 t/s
Задержка
0.97с
Дата выпуска2024-04-09
  • 43.3
  • 43.2
  • 53.6
  • 45.8
GPT-5.1 Codex MiniOpenAIКонтекст400KВвод$0.250/MВывод$2.00/MПровайдеры
+125
56.6±13.9P
53.2±11.1E
53.4±16.1P
Пропускная способность
136 t/s
Задержка
4.28с
Дата выпуска2025-11-13
  • 56.6
  • 53.2
  • 53.4
Claude Opus 4.1AnthropicКонтекст200KВвод$15.00/MВывод$75.00/MПровайдеры
+100
46.5±16.2P
47.1±16.1P
59±16.0P
Пропускная способность
22 t/s
Задержка
3.56с
Дата выпуска2025-08-05
  • 46.5
  • 47.1
  • 59
Qwen3 Omni FlashКонтекстВводВыводПровайдеры
+38
Пропускная способность
62 t/s
Задержка
5.13с
Дата выпуска
DeepSeek ReasonerDeepSeekКонтекстВводВыводПровайдеры
+85
Пропускная способность
28 t/s
Задержка
6.40с
Дата выпуска

Как читать оценки категорий

Агенты, кодирование, рассуждение и другие столбцы — это оценки наблюдаемой способности 0–100 относительно допустимых моделей запуска Category Score V3.

Это не вероятность успеха, не IQ и не среднее восьми категорий. Читайте их вместе с 80% интервалом, измеренными аспектами, семействами бенчмарков и доказательствами на странице модели.

Открыть полную методологию оценки

Что показывает этот каталог

В каждой строке собрана информация для сравнения LLM API. Поля остаются пустыми, если у LMSpeed нет текущих данных по модели или провайдеру.

Цена API
Сравнивайте цену входных и выходных токенов за миллион, когда данные доступны.
Скорость и задержка
Используйте пропускную способность и задержку первого токена для сравнения ответа.
Охват провайдеров
Откройте модель, чтобы увидеть перечисленных провайдеров и текущие данные.
Данные о возможностях
Используйте столбцы возможностей, когда текущие оценки модели доступны.

Как использовать каталог моделей

Сначала выберите главный критерий для вашей задачи, затем сравните текущие строки и проверьте endpoint.

  1. Найдите модель.Ищите по названию модели, slug или описанию.
  2. Отсортируйте нужную метрику.Сортируйте по цене, пропускной способности, задержке, числу провайдеров или данным о возможностях.
  3. Сравните провайдеров.Откройте страницу модели, чтобы просмотреть варианты провайдеров и текущие данные.
  4. Проверьте свой endpoint.Запустите тест скорости перед использованием endpoint в production.

Frequently Asked Questions

How does LMSpeed benchmark AI models?

LMSpeed runs standardized five-round API speed tests on each model, measuring output throughput (tokens per second), first-token latency, and total response time across multiple providers.

Which AI model has the lowest API latency?

Latency varies by provider and model. Use the LMSpeed model directory to sort by latency and find the model with the fastest first-token response time. Check the latency leaderboard for monthly rankings.

How to compare LLM API pricing across providers?

LMSpeed lists input and output token prices per million for each model across available providers. Sort by price to find a lower-cost option, or filter by provider to compare rates side by side.

What is an AI model directory?

An AI model directory is a searchable list of models and their comparison data. On LMSpeed, it brings together API price, throughput, first-token latency, provider coverage, and capability data when available.

How do I choose a model and provider?

Start with the metric that matters most for your workload. Then open a model page to compare provider data. Run your own speed test before you use an endpoint in production.

Can model price and speed change?

Yes. Price, availability, throughput, and latency can change by model, provider, and time. Use current page values as a comparison signal and confirm with your own endpoint test.