模型上下文输入价输出价服务商Agents编程推理知识数学多语言多模态指令遵循吞吐延迟发布日期
Qwen3上下文262.1K输入价$0.200/M输出价$0.800/M服务商
+126
45.7±13.9P
47.6±11.1E
36.9±16.3P
58.3±11.8E
36.7±16.4P
吞吐
100 t/s
延迟
12.55s
发布日期2025-07-21
  • 45.7
  • 47.6
  • 36.9
  • 58.3
  • 36.7
Qwen3 VL上下文输入价输出价服务商
+17
吞吐
206 t/s
延迟
6.63s
发布日期
Qwen3 CoderQwen上下文262.1K输入价输出价服务商
+61
吞吐
243 t/s
延迟
5.28s
发布日期2025-07-23
Qwen3 Embedding上下文输入价输出价服务商
+42
吞吐
延迟
发布日期
Qwen3 Next上下文输入价输出价服务商
+7
吞吐
延迟
发布日期
Qwen Image上下文输入价输出价服务商
+34
吞吐
延迟
发布日期
Qwen3 Omni Flash上下文输入价输出价服务商
+38
吞吐
62 t/s
延迟
5.13s
发布日期
Qwen3 S2S Flash Realtime上下文输入价输出价服务商
+13
吞吐
延迟
发布日期
Qwen3.5 Plus Image上下文输入价输出价服务商
+1
吞吐
延迟
发布日期
Qwen3 TTS Flash Realtime上下文输入价输出价服务商
+14
吞吐
延迟
发布日期
Qwen PlusQwen上下文1M输入价输出价服务商
+34
吞吐
39 t/s
延迟
0.83s
发布日期2025-09-08
Qwen3 Coder PlusQwen上下文1M输入价输出价服务商
+72
吞吐
45 t/s
延迟
1.35s
发布日期2025-09-23
Qwen3 MaxQwen上下文262.1K输入价$1.20/M输出价$6.00/M服务商
+92
47.5±11.8E
45.1±11.2E
48.9±8.7
40.6±16.0P
51.4±16.1P
44.6±16.0P
吞吐
38 t/s
延迟
7.37s
发布日期2025-09-23
  • 47.5
  • 45.1
  • 48.9
  • 40.6
  • 51.4
  • 44.6
Qwen3.5 PlusAlibaba上下文1M输入价输出价服务商
+114
44.3±16.2P
46.6±16.1P
48.8±16.1P
吞吐
51 t/s
延迟
13.81s
发布日期2026-04-27
  • 44.3
  • 46.6
  • 48.8
Qwen3 TTS Flash上下文输入价输出价服务商
+29
吞吐
延迟
发布日期
Qwen3.1Alibaba上下文输入价输出价服务商
+11
吞吐
151 t/s
延迟
4.42s
发布日期
Qwen3 Coder FlashQwen上下文1M输入价输出价服务商
+29
吞吐
延迟
发布日期2025-09-17
Qwen3.6 PlusQwen上下文1M输入价$0.500/M输出价$3.00/M服务商
+126
49.3±5.5
51.3±8.2
56.6±8.1
52±11.6E
52.2±9.1E
52.2±12.2E
50.7±6.5
55.7±11.9E
吞吐
49 t/s
延迟
24.59s
发布日期2026-04-02
  • 49.3
  • 51.3
  • 56.6
  • 52
  • 52.2
  • 52.2
  • 50.7
  • 55.7
Qwen3.0Alibaba上下文输入价输出价服务商
+12
吞吐
165 t/s
延迟
1.77s
发布日期
Qwen3 Max ThinkingQwen上下文262.1K输入价$1.20/M输出价$6.00/M服务商
+6
51.9±13.9P
55.1±11.1E
51.7±16.1P
吞吐
延迟
发布日期2026-02-09
  • 51.9
  • 55.1
  • 51.7
Qwen3.5 Flash上下文1M输入价输出价服务商
+72
42.7±16.1P
吞吐
115 t/s
延迟
7.92s
发布日期2026-02-25
  • 42.7
Qwen3.5 Plus Thinking上下文输入价输出价服务商
+7
吞吐
延迟
发布日期
Qwen3.5 Max上下文输入价输出价服务商
+6
吞吐
31 t/s
延迟
29.33s
发布日期
Qwen3 Coder NextQwen上下文262.1K输入价$0.350/M输出价$1.20/M服务商
+20
46.9±16.0P
48.7±13.9P
吞吐
147 t/s
延迟
0.97s
发布日期2026-02-04
  • 46.9
  • 48.7
Qwen3.6 Plus Thinking上下文输入价输出价服务商
+9
吞吐
延迟
发布日期
Qwen3.5 Omni Plus上下文输入价$0.400/M输出价$4.80/M服务商
+20
52.7±16.0P
52.6±13.9P
吞吐
36 t/s
延迟
2.15s
发布日期
  • 52.7
  • 52.6
Qwen3.5 Omni Flash上下文输入价$0.100/M输出价$0.800/M服务商
+20
41.5±16.0P
47.8±13.9P
吞吐
延迟
发布日期
  • 41.5
  • 47.8
Qwen3.5 Plus Image Edit上下文输入价输出价服务商
+1
吞吐
延迟
发布日期
DeepSeek V3.2DeepSeek上下文163.8K输入价$0.280/M输出价$0.420/M服务商
+180
39.1±6.9
51.2±8.6
51±8.7
39.8±16.0P
49±16.1P
46±16.0P
吞吐
46 t/s
延迟
5.33s
发布日期2025-12-01
  • 39.1
  • 51.2
  • 51
  • 39.8
  • 49
  • 46
Qwen3.5上下文262.1K输入价$0.030/M输出价$0.150/M服务商
+104
44.7±5.2
40.5±8.9
52.3±8.1
53.1±11.6E
41.4±11.5E
54.6±12.2E
50.2±6.5
53.7±11.9E
吞吐
51 t/s
延迟
10.34s
发布日期2026-03-10
  • 44.7
  • 40.5
  • 52.3
  • 53.1
  • 41.4
  • 54.6
  • 50.2
  • 53.7
FreeOpenrouter上下文200K输入价输出价服务商
+16
吞吐
24 t/s
延迟
25.61s
发布日期2026-02-01
DeepSeek R1 Distill Qwen 1.5BDeepSeek上下文输入价输出价服务商
+21
25.7±13.9P
29.7±11.1E
45.5±11.8E
吞吐
126 t/s
延迟
4.28s
发布日期
  • 25.7
  • 29.7
  • 45.5
DeepSeek R1 Distill QwenDeepSeek上下文128K输入价输出价服务商
+51
40.2±13.9P
39.1±8.9
54.4±16.0P
55.7±11.8E
37.5±16.0P
吞吐
50 t/s
延迟
19.88s
发布日期2025-01-29
  • 40.2
  • 39.1
  • 54.4
  • 55.7
  • 37.5
Qwen1.8BAlibaba上下文输入价输出价服务商
+14
吞吐
延迟
发布日期
Qwen1.8B Long ContextAlibaba上下文输入价输出价服务商
+14
吞吐
延迟
发布日期
Qwen3.6 FlashQwen上下文1M输入价输出价服务商
+19
吞吐
106 t/s
延迟
8.21s
发布日期2026-04-27
Qwen3 InstantAlibaba上下文输入价输出价服务商
吞吐
延迟
发布日期
Qwen3.7 MaxQwen上下文1M输入价$2.50/M输出价$7.50/M服务商
+59
56.9±5.8
57±6.0
59.6±8.7
55.8±12.2E
62.2±12.2E
58.1±11.7E
56.8±11.9E
吞吐
111 t/s
延迟
22.62s
发布日期2026-05-21
  • 56.9
  • 57
  • 59.6
  • 55.8
  • 62.2
  • 58.1
  • 56.8
Qwen3.7 PlusQwen上下文1M输入价$0.400/M输出价$1.60/M服务商
+54
53.6±5.7
52.9±6.0
57.4±8.7
48.6±12.2E
55.2±12.2E
51.1±11.7E
55.1±6.3
56.8±11.9E
吞吐
80 t/s
延迟
28.78s
发布日期2026-06-03
  • 53.6
  • 52.9
  • 57.4
  • 48.6
  • 55.2
  • 51.1
  • 55.1
  • 56.8
Nex n2 ProNex AGI上下文262.1K输入价$0.500/M输出价$2.50/M服务商
+9
53.6±16.0P
58.7±13.9P
吞吐
83 t/s
延迟
1.16s
发布日期2026-06-08
  • 53.6
  • 58.7
Qwen3.6 35B A3BQwen上下文262.1K输入价$0.375/M输出价$2.25/M服务商
+5
46±5.9
37.7±6.0
52.4±8.7
39.1±12.2E
34.6±11.5E
44.1±7.0
50.6±16.0P
吞吐
延迟
发布日期2026-04-27
  • 46
  • 37.7
  • 52.4
  • 39.1
  • 34.6
  • 44.1
  • 50.6
Qwen3.6 Max PreviewQwen上下文262.1K输入价$1.30/M输出价$7.80/M服务商
+15
53.7±11.8E
51.6±8.9
55.5±10.8E
55.1±16.3P
50.6±16.1P
54.9±16.0P
吞吐
延迟
发布日期2026-04-27
  • 53.7
  • 51.6
  • 55.5
  • 55.1
  • 50.6
  • 54.9
Qwen3.6 27BQwen上下文262.1K输入价$0.600/M输出价$3.60/M服务商
+3
55.5±6.6
46.9±6.0
54.4±8.7
37.3±11.6E
41.3±11.5E
46.3±6.5
51.7±16.0P
吞吐
延迟
发布日期2026-04-27
  • 55.5
  • 46.9
  • 54.4
  • 37.3
  • 41.3
  • 46.3
  • 51.7
Qwen3.5-9BQwen上下文262.1K输入价$0.170/M输出价$0.250/M服务商
43.2±16.0P
52±13.9P
吞吐
延迟
发布日期2026-03-10
  • 43.2
  • 52
Qwen3.5-35B-A3BQwen上下文262.1K输入价$0.250/M输出价$2.00/M服务商
42.8±8.7
42±11.2E
51.2±8.3
38±16.3P
41.6±16.4P
45.8±12.1E
51.5±11.9E
吞吐
延迟
发布日期2026-02-25
  • 42.8
  • 42
  • 51.2
  • 38
  • 41.6
  • 45.8
  • 51.5
Qwen3.5-27BQwen上下文262.1K输入价$0.300/M输出价$2.40/M服务商
45.8±8.7
48.9±11.2E
53.6±8.3
41.4±16.3P
45.4±16.4P
49±12.1E
57.1±11.9E
吞吐
延迟
发布日期2026-02-25
  • 45.8
  • 48.9
  • 53.6
  • 41.4
  • 45.4
  • 49
  • 57.1
Qwen3.5-122B-A10BQwen上下文262.1K输入价$0.400/M输出价$3.20/M服务商
48±10.6E
48.7±11.8E
53.1±8.3
43.7±16.3P
45.4±16.4P
47.7±9.4E
54.2±11.9E
吞吐
延迟
发布日期2026-02-25
  • 48
  • 48.7
  • 53.1
  • 43.7
  • 45.4
  • 47.7
  • 54.2
Qwen3.5 397B A17BQwen上下文262.1K输入价$0.600/M输出价$3.60/M服务商
53.7±16.0P
58.1±13.9P
吞吐
366 t/s
延迟
9.72s
发布日期2026-02-16
  • 53.7
  • 58.1
Qwen3 VL 32B InstructQwen上下文131.1K输入价$0.160/M输出价$0.640/M服务商
+2
45.5±13.9P
48.3±11.1E
49.1±16.1P
吞吐
延迟
发布日期2025-10-23
  • 45.5
  • 48.3
  • 49.1
Qwen3 VL 8B ThinkingQwen上下文131.1K输入价输出价服务商
吞吐
延迟
发布日期2025-10-14
Qwen3 VL 8B InstructQwen上下文262.1K输入价$0.180/M输出价$0.700/M服务商
+2
35.3±13.9P
40.6±11.1E
41.5±16.1P
吞吐
延迟
发布日期2025-10-14
  • 35.3
  • 40.6
  • 41.5
Qwen3 VL 30B A3B ThinkingQwen上下文262.1K输入价输出价服务商
+2
吞吐
延迟
发布日期2025-10-06
Qwen3 VL 30B A3B InstructQwen上下文262.1K输入价$0.200/M输出价$0.800/M服务商
+1
45.4±13.9P
47.3±11.1E
49.8±16.1P
吞吐
延迟
发布日期2025-10-06
  • 45.4
  • 47.3
  • 49.8
Qwen3 VL 235B A22B ThinkingQwen上下文131.1K输入价输出价服务商
+5
吞吐
延迟
发布日期2025-09-23
Qwen3 VL 235B A22B InstructQwen上下文262.1K输入价$0.400/M输出价$1.60/M服务商
+5
49.4±13.9P
50±11.1E
49.5±16.1P
吞吐
延迟
发布日期2025-09-23
  • 49.4
  • 50
  • 49.5
Qwen3 Next 80B A3B ThinkingQwen上下文262.1K输入价输出价服务商
+5
吞吐
延迟
发布日期2025-09-11
Qwen3 Next 80B A3B InstructQwen上下文262.1K输入价$0.150/M输出价$1.20/M服务商
+17
48.2±13.9P
50.4±11.1E
48.7±16.1P
吞吐
延迟
发布日期2025-09-11
  • 48.2
  • 50.4
  • 48.7
Qwen3 30B A3B Thinking 2507Qwen上下文81.9K输入价输出价服务商
+4
吞吐
延迟
发布日期2025-08-28
Qwen3 Coder 30B A3B InstructQwen上下文262.1K输入价$0.450/M输出价$2.25/M服务商
42.8±13.9P
42.7±11.1E
50.5±11.8E
吞吐
延迟
发布日期2025-07-31
  • 42.8
  • 42.7
  • 50.5
Qwen3 30B A3B Instruct 2507Qwen上下文262.1K输入价输出价服务商
+3
吞吐
延迟
发布日期2025-07-29

如何阅读分类能力分

Agent、Coding、Reasoning 等能力列,是在某次 Category Score V3 运行中,相对于合格模型群的 0–100 实测能力估计。

它们不是成功率、IQ,也不是八个分类的平均分。请结合模型详情页中的 80% 区间、实测维度、benchmark family 和具体证据阅读。

查看完整评分方法论

这个目录展示什么

每一行都提供对比 LLM API 所需的信息。如果 LMSpeed 没有模型或服务商的当前数据,对应字段会留空。

API 价格
有数据时可以对比每百万 token 的输入和输出价格。
速度和延迟
用吞吐量和首字延迟对比响应表现。
服务商覆盖
打开模型页可以查看已列出的服务商和当前信息。
能力数据
有当前评分时可以查看模型能力列。

怎么使用模型目录

先确定你的重点,再对比当前数据,最后测试接口。

  1. 找到模型.按模型名、slug 或描述搜索。
  2. 按关键指标排序.可以按价格、吞吐量、延迟、服务商数量或能力数据排序。
  3. 对比服务商.打开模型页,查看服务商选项和当前数据。
  4. 测试你的接口.在生产环境使用接口前,先跑一次速度测试。

常见问题

LMSpeed 怎么评测大模型?

LMSpeed 对每个模型跑标准化的五轮 API 速度测试,测量输出吞吐量(每秒 token 数)、首字延迟和总响应时间,覆盖多个服务商。

哪个大模型的 API 延迟最低?

延迟因服务商和模型不同而不同。在 LMSpeed 模型目录中按延迟排序,找到首字响应最快的模型。也可以查看延迟排行榜看月度排名。

怎么对比大模型 API 价格?

LMSpeed 列出每个模型在可用服务商的输入和输出价格(每百万 token)。按价格排序可以找较低价格的选项,也可以按服务商筛选对比。

什么是 AI 模型目录?

AI 模型目录是一个可搜索的模型清单,里面有对比数据。LMSpeed 在有数据时展示 API 价格、吞吐量、首字延迟、服务商覆盖和能力数据。

怎么选择模型和服务商?

先看最重要的指标。再打开模型页对比服务商数据。生产环境使用前,请测试你自己的接口。

模型价格和速度会变化吗?

会。价格、可用性、吞吐量和延迟会随模型、服务商和时间变化。页面数据只能用作对比信号。请用自己的接口确认。