模型上下文输入价输出价服务商Agents编程推理知识数学多语言多模态指令遵循吞吐延迟发布日期
DeepSeek V3上下文输入价$0.360/M输出价$0.890/M服务商
+151
34.7±11.8E
37.4±11.2E
44.4±8.7
41.1±16.0P
49.5±9.3E
39.7±11.9E
吞吐
49 t/s
延迟
3.39s
发布日期
  • 34.7
  • 37.4
  • 44.4
  • 41.1
  • 49.5
  • 39.7
Qwen3上下文262.1K输入价$0.200/M输出价$0.800/M服务商
+126
45.6±13.9P
47.6±11.1E
36.9±16.3P
58.3±11.8E
36.7±16.4P
吞吐
100 t/s
延迟
12.55s
发布日期2025-07-21
  • 45.6
  • 47.6
  • 36.9
  • 58.3
  • 36.7
Qwen3 VL上下文输入价输出价服务商
+17
吞吐
206 t/s
延迟
6.63s
发布日期
Devstral 2上下文输入价输出价服务商
+4
46.1±13.9P
45.2±11.1E
43.2±16.1P
吞吐
71 t/s
延迟
1.34s
发布日期
  • 46.1
  • 45.2
  • 43.2
Ministral 3上下文输入价$0.200/M输出价$0.200/M服务商
+2
31.3±13.9P
36.5±11.1E
40.5±16.1P
吞吐
208 t/s
延迟
2.84s
发布日期
  • 31.3
  • 36.5
  • 40.5
Mistral Large 3上下文输入价$0.500/M输出价$1.50/M服务商
+7
39.3±11.8E
47.9±13.9P
44.5±8.7
41.6±16.0P
43.5±16.1P
42.2±16.0P
吞吐
29 t/s
延迟
3.00s
发布日期
  • 39.3
  • 47.9
  • 44.5
  • 41.6
  • 43.5
  • 42.2
Qwen3 CoderQwen上下文262.1K输入价输出价服务商
+61
吞吐
243 t/s
延迟
5.28s
发布日期2025-07-23
Qwen3 Embedding上下文输入价输出价服务商
+42
吞吐
延迟
发布日期
Qwen3 Next上下文输入价输出价服务商
+7
吞吐
延迟
发布日期
DeepSeek Coder上下文输入价输出价服务商
+8
吞吐
延迟
发布日期
Qwen Image上下文输入价输出价服务商
+34
吞吐
延迟
发布日期
Phi 4Microsoft上下文16.4K输入价$0.125/M输出价$0.500/M服务商
+17
28.4±16.0P
39.1±13.9P
39.1±8.7
37.5±16.0P
46.9±11.8E
37.8±16.0P
吞吐
43 t/s
延迟
1.32s
发布日期2025-01-10
  • 28.4
  • 39.1
  • 39.1
  • 37.5
  • 46.9
  • 37.8
Intern-S1上下文输入价输出价服务商
+4
吞吐
延迟
发布日期
MiniMax M1MiniMax上下文1M输入价$0.550/M输出价$2.20/M服务商
+31
51.2±13.9P
49.3±11.1E
58.9±11.8E
吞吐
延迟
发布日期2025-06-17
  • 51.2
  • 49.3
  • 58.9
MAI-DS-R1上下文输入价输出价服务商
+10
吞吐
延迟
发布日期
DeepSeek VL2上下文输入价输出价服务商
+8
吞吐
126 t/s
延迟
0.75s
发布日期
GLM-4上下文输入价输出价服务商
+57
吞吐
61 t/s
延迟
0.87s
发布日期
GPT-OSS上下文131.1K输入价输出价服务商
+137
吞吐
374 t/s
延迟
3.23s
发布日期2025-08-05
GPT-4oOpenAI上下文128K输入价$2.50/M输出价$10.00/M服务商
+133
39±16.0P
46±13.9P
39.9±8.7
49±16.0P
42.2±9.3E
41.6±16.0P
吞吐
82 t/s
延迟
3.44s
发布日期2024-11-20
  • 39
  • 46
  • 39.9
  • 49
  • 42.2
  • 41.6
MiniMax M2.5MiniMax上下文204.8K输入价$0.300/M输出价$1.20/M服务商
+187
50.2±11.8E
54.7±13.9P
吞吐
61 t/s
延迟
9.68s
发布日期2026-02-12
  • 50.2
  • 54.7
GPT-5.4 MiniOpenAI上下文400K输入价$0.750/M输出价$4.50/M服务商
+240
51±8.1
57.5±11.8E
55.7±10.8E
46.1±14.0P
49.7±16.1P
47.1±16.1P
53.6±16.0P
吞吐
134 t/s
延迟
3.54s
发布日期2026-03-17
  • 51
  • 57.5
  • 55.7
  • 46.1
  • 49.7
  • 47.1
  • 53.6
MiniMax Hailuo 2.3上下文输入价输出价服务商
+16
吞吐
延迟
发布日期
GLM-5Z.ai上下文204.8K输入价$1.00/M输出价$3.20/M服务商
+187
41.1±5.6
51.5±8.1
48.9±8.1
43.3±16.3P
51.1±9.1E
43.8±12.2E
52.4±11.9E
吞吐
51 t/s
延迟
21.59s
发布日期2026-02-11
  • 41.1
  • 51.5
  • 48.9
  • 43.3
  • 51.1
  • 43.8
  • 52.4
GPT-4o MiniOpenAI上下文128K输入价$0.150/M输出价$0.600/M服务商
+121
31±16.0P
37.3±13.9P
40.2±11.1E
53.4±16.0P
46.1±11.8E
40.5±16.0P
吞吐
84 t/s
延迟
4.10s
发布日期2024-07-18
  • 31
  • 37.3
  • 40.2
  • 53.4
  • 46.1
  • 40.5
Claude Sonnet 4.5Anthropic上下文1M输入价$3.00/M输出价$15.00/M服务商
+174
46.6±8.7
51.8±11.2E
45.6±8.9E
54.5±16.1P
42.5±12.3E
吞吐
41 t/s
延迟
4.57s
发布日期2025-09-29
  • 46.6
  • 51.8
  • 45.6
  • 54.5
  • 42.5
GPT-5.1OpenAI上下文400K输入价$1.25/M输出价$10.00/M服务商
+153
47.7±9.3E
49.1±11.2E
54±8.7
53±16.0P
54±16.1P
53.5±16.0P
吞吐
142 t/s
延迟
2.78s
发布日期2025-11-13
  • 47.7
  • 49.1
  • 54
  • 53
  • 54
  • 53.5
GLM-4.6VZ.ai上下文131.1K输入价$0.300/M输出价$0.900/M服务商
+61
40±13.9P
49.7±11.1E
52.2±16.1P
吞吐
40 t/s
延迟
27.37s
发布日期2025-12-08
  • 40
  • 49.7
  • 52.2
Gemini 2.5 ProGoogle上下文1.0M输入价$1.25/M输出价$10.00/M服务商
+172
43.7±9.3E
39.1±8.9
54.2±8.7
35.6±14.0P
56.1±9.3E
45.9±16.0P
吞吐
88 t/s
延迟
16.94s
发布日期2025-06-17
  • 43.7
  • 39.1
  • 54.2
  • 35.6
  • 56.1
  • 45.9
O1OpenAI上下文200K输入价$15.00/M输出价$60.00/M服务商
+75
45.6±16.0P
50.6±13.9P
50.7±8.7
62.5±17.4P
52.6±9.3E
51.5±11.9E
吞吐
延迟
发布日期2024-12-17
  • 45.6
  • 50.6
  • 50.7
  • 62.5
  • 52.6
  • 51.5
O1 MiniOpenAI上下文输入价输出价服务商
+60
47.4±13.9P
44.6±11.1E
54.9±11.8E
吞吐
32 t/s
延迟
13.84s
发布日期
  • 47.4
  • 44.6
  • 54.9
GPT-4.1OpenAI上下文1.0M输入价$2.00/M输出价$8.00/M服务商
+109
40±11.8E
38.3±11.2E
48.5±8.7
57±17.4P
49±9.3E
42.1±11.9E
吞吐
85 t/s
延迟
1.92s
发布日期2025-04-14
  • 40
  • 38.3
  • 48.5
  • 57
  • 49
  • 42.1
O3OpenAI上下文200K输入价$2.00/M输出价$8.00/M服务商
+85
49.3±16.0P
55.3±13.9P
54.4±8.7
47.7±16.0P
58.8±9.3E
53±16.0P
吞吐
134 t/s
延迟
2.82s
发布日期2025-04-16
  • 49.3
  • 55.3
  • 54.4
  • 47.7
  • 58.8
  • 53
Kimi K2MoonshotAI上下文131.1K输入价$0.570/M输出价$2.30/M服务商
+87
45.3±16.0P
48.2±13.9P
48.6±8.7
44.5±16.0P
53.7±9.3E
43.8±16.0P
吞吐
29 t/s
延迟
2.21s
发布日期2025-09-04
  • 45.3
  • 48.2
  • 48.6
  • 44.5
  • 53.7
  • 43.8
Claude Opus 4.6Anthropic上下文1M输入价$5.00/M输出价$25.00/M服务商
+229
54.9±5.7
59±8.0
53.4±8.7
53.7±13.7P
56.5±16.1P
54±17.3P
48.4±11.1E
44.7±16.0P
吞吐
45 t/s
延迟
5.30s
发布日期2026-02-04
  • 54.9
  • 59
  • 53.4
  • 53.7
  • 56.5
  • 54
  • 48.4
  • 44.7
Gemini 3 ProGoogle上下文输入价$2.00/M输出价$12.00/M服务商
+139
49±9.3E
55.5±11.2E
54.1±6.4
55.6±14.0P
55.7±16.1P
54±17.3P
49.9±6.5
52.6±16.0P
吞吐
73 t/s
延迟
10.59s
发布日期
  • 49
  • 55.5
  • 54.1
  • 55.6
  • 55.7
  • 54
  • 49.9
  • 52.6
Phi 4 Mini Instruct上下文131.1K输入价输出价服务商
+28
27.8±13.9P
34.2±11.1E
42±11.8E
吞吐
延迟
发布日期2025-10-17
  • 27.8
  • 34.2
  • 42
GPT-5 MiniOpenAI上下文400K输入价$0.250/M输出价$2.00/M服务商
+111
49.5±11.2E
53.5±11.1E
52.2±16.1P
吞吐
90 t/s
延迟
7.03s
发布日期2025-08-07
  • 49.5
  • 53.5
  • 52.2
GPT-5.1 Codex MaxOpenAI上下文400K输入价输出价服务商
+126
49.9±16.0P
50.8±11.8E
54.4±10.8E
50±16.0P
52.5±16.0P
吞吐
56 t/s
延迟
6.29s
发布日期2025-12-04
  • 49.9
  • 50.8
  • 54.4
  • 50
  • 52.5
Gemini 1.5 ProGoogle上下文输入价输出价服务商
+21
40.1±13.9P
39.6±11.1E
54.2±16.0P
43.7±11.8E
吞吐
18 t/s
延迟
2.58s
发布日期
  • 40.1
  • 39.6
  • 54.2
  • 43.7
GPT-4.1 MiniOpenAI上下文1.0M输入价$0.400/M输出价$1.60/M服务商
+112
40.4±11.8E
39±11.2E
45.4±8.7
49.3±17.4P
49.9±9.3E
42.4±11.9E
吞吐
93 t/s
延迟
2.69s
发布日期2025-04-14
  • 40.4
  • 39
  • 45.4
  • 49.3
  • 49.9
  • 42.4
Grok Imagine VideoSpaceXAI上下文0输入价输出价服务商
+22
吞吐
延迟
发布日期2026-05-18
Claude Opus 4Anthropic上下文200K输入价$15.00/M输出价$75.00/M服务商
+91
51.1±13.9P
51.7±11.1E
54.4±11.8E
吞吐
25 t/s
延迟
12.05s
发布日期2025-05-22
  • 51.1
  • 51.7
  • 54.4
Gemini 2.5 Flash ImageGoogle上下文32.8K输入价输出价服务商
+93
吞吐
延迟
发布日期2025-10-07
GPT-5.4OpenAI上下文1.1M输入价$2.50/M输出价$15.00/M服务商
+294
57.2±5.1
62.5±10.3E
56.2±8.7
59.9±15.1P
57.6±16.1P
52.9±6.6
53.9±16.0P
吞吐
49 t/s
延迟
4.45s
发布日期2026-03-05
  • 57.2
  • 62.5
  • 56.2
  • 59.9
  • 57.6
  • 52.9
  • 53.9
GPT Audio MiniOpenAI上下文128K输入价输出价服务商
+16
吞吐
延迟
发布日期2026-01-19
GLM-4.7Z.ai上下文204.8K输入价$0.600/M输出价$2.20/M服务商
+152
46.7±8.6
53±10.5E
54.4±8.7
35.3±14.0P
48.8±12.3E
51.8±16.0P
吞吐
95 t/s
延迟
19.09s
发布日期2025-12-22
  • 46.7
  • 53
  • 54.4
  • 35.3
  • 48.8
  • 51.8
Claude Opus 4.5Anthropic上下文200K输入价$5.00/M输出价$25.00/M服务商
+166
48.6±5.3
55.7±8.1
60.7±8.1
57.6±11.6E
49.9±9.1E
51.7±12.2E
32.4±6.5
45.7±11.9E
吞吐
54 t/s
延迟
3.12s
发布日期2025-11-24
  • 48.6
  • 55.7
  • 60.7
  • 57.6
  • 49.9
  • 51.7
  • 32.4
  • 45.7
GLM-4.6Z.ai上下文204.8K输入价$0.550/M输出价$2.20/M服务商
+102
48.4±16.0P
41.9±11.2E
42.8±8.7
43.6±16.0P
44.8±16.1P
42.4±16.0P
吞吐
53 t/s
延迟
16.68s
发布日期2025-09-30
  • 48.4
  • 41.9
  • 42.8
  • 43.6
  • 44.8
  • 42.4
Gemini 2.5 Flash LiteGoogle上下文1.0M输入价$0.100/M输出价$0.400/M服务商
+128
36.3±13.9P
42.8±11.1E
53.3±11.8E
吞吐
277 t/s
延迟
1.41s
发布日期2025-09-25
  • 36.3
  • 42.8
  • 53.3
DeepSeek R1DeepSeek上下文64K输入价$1.35/M输出价$3.00/M服务商
+149
41.2±16.0P
49.7±13.9P
50.2±8.7
44.7±16.0P
57±11.8E
43.3±16.0P
吞吐
52 t/s
延迟
10.36s
发布日期2025-05-28
  • 41.2
  • 49.7
  • 50.2
  • 44.7
  • 57
  • 43.3
Devstral SmallMistral AI上下文输入价输出价服务商
+7
38.7±13.9P
39.4±11.1E
43.4±11.8E
吞吐
延迟
发布日期
  • 38.7
  • 39.4
  • 43.4
GPT-3.5 Turbo InstructOpenAI上下文4.1K输入价输出价服务商
+44
吞吐
延迟
发布日期2023-09-28
GPT-3.5 TurboOpenAI上下文16.4K输入价$0.500/M输出价$1.50/M服务商
+98
48.8±18.4P
33.3±11.8E
37.8±16.0P
吞吐
115 t/s
延迟
2.21s
发布日期2024-01-25
  • 48.8
  • 33.3
  • 37.8
Gemini 3.1 Flash LiteGoogle上下文1.0M输入价输出价服务商
+128
44.5±16.1P
27.5±16.1P
42.6±16.1P
吞吐
191 t/s
延迟
6.58s
发布日期2026-05-07
  • 44.5
  • 27.5
  • 42.6
O3 ProOpenAI上下文200K输入价$20.00/M输出价$80.00/M服务商
+61
54.1±16.0P
60.1±16.0P
吞吐
延迟
发布日期2025-06-10
  • 54.1
  • 60.1
GPT-4 TurboOpenAI上下文128K输入价$10.00/M输出价$30.00/M服务商
+73
43.3±13.9P
43.2±11.8E
53.6±16.0P
45.8±11.8E
吞吐
50 t/s
延迟
0.97s
发布日期2024-04-09
  • 43.3
  • 43.2
  • 53.6
  • 45.8
GPT-5.1 Codex MiniOpenAI上下文400K输入价$0.250/M输出价$2.00/M服务商
+125
56.6±13.9P
53.2±11.1E
53.4±16.1P
吞吐
136 t/s
延迟
4.28s
发布日期2025-11-13
  • 56.6
  • 53.2
  • 53.4
Claude Opus 4.1Anthropic上下文200K输入价$15.00/M输出价$75.00/M服务商
+100
46.5±16.2P
47.1±16.1P
59±16.0P
吞吐
22 t/s
延迟
3.56s
发布日期2025-08-05
  • 46.5
  • 47.1
  • 59
Qwen3 Omni Flash上下文输入价输出价服务商
+38
吞吐
62 t/s
延迟
5.13s
发布日期
DeepSeek ReasonerDeepSeek上下文输入价输出价服务商
+85
吞吐
28 t/s
延迟
6.40s
发布日期

如何阅读分类能力分

Agent、Coding、Reasoning 等能力列,是在某次 Category Score V3 运行中,相对于合格模型群的 0–100 实测能力估计。

它们不是成功率、IQ,也不是八个分类的平均分。请结合模型详情页中的 80% 区间、实测维度、benchmark family 和具体证据阅读。

查看完整评分方法论

这个目录展示什么

每一行都提供对比 LLM API 所需的信息。如果 LMSpeed 没有模型或服务商的当前数据,对应字段会留空。

API 价格
有数据时可以对比每百万 token 的输入和输出价格。
速度和延迟
用吞吐量和首字延迟对比响应表现。
服务商覆盖
打开模型页可以查看已列出的服务商和当前信息。
能力数据
有当前评分时可以查看模型能力列。

怎么使用模型目录

先确定你的重点,再对比当前数据,最后测试接口。

  1. 找到模型.按模型名、slug 或描述搜索。
  2. 按关键指标排序.可以按价格、吞吐量、延迟、服务商数量或能力数据排序。
  3. 对比服务商.打开模型页,查看服务商选项和当前数据。
  4. 测试你的接口.在生产环境使用接口前,先跑一次速度测试。

常见问题

LMSpeed 怎么评测大模型?

LMSpeed 对每个模型跑标准化的五轮 API 速度测试,测量输出吞吐量(每秒 token 数)、首字延迟和总响应时间,覆盖多个服务商。

哪个大模型的 API 延迟最低?

延迟因服务商和模型不同而不同。在 LMSpeed 模型目录中按延迟排序,找到首字响应最快的模型。也可以查看延迟排行榜看月度排名。

怎么对比大模型 API 价格?

LMSpeed 列出每个模型在可用服务商的输入和输出价格(每百万 token)。按价格排序可以找较低价格的选项,也可以按服务商筛选对比。

什么是 AI 模型目录?

AI 模型目录是一个可搜索的模型清单,里面有对比数据。LMSpeed 在有数据时展示 API 价格、吞吐量、首字延迟、服务商覆盖和能力数据。

怎么选择模型和服务商?

先看最重要的指标。再打开模型页对比服务商数据。生产环境使用前,请测试你自己的接口。

模型价格和速度会变化吗?

会。价格、可用性、吞吐量和延迟会随模型、服务商和时间变化。页面数据只能用作对比信号。请用自己的接口确认。