模型上下文输入价输出价服务商Agents编程推理知识数学多语言多模态指令遵循吞吐延迟发布日期
Gemini 2.5 ProGoogle上下文1.0M输入价$1.25/M输出价$10.00/M服务商
+172
43.6±9.3E
39.1±8.9
54.2±8.7
35.6±14.0P
56.1±9.3E
45.9±16.0P
吞吐
88 t/s
延迟
16.94s
发布日期2025-06-17
  • 43.6
  • 39.1
  • 54.2
  • 35.6
  • 56.1
  • 45.9
Gemini 3 ProGoogle上下文输入价$2.00/M输出价$12.00/M服务商
+139
49±9.3E
55.5±11.2E
54.1±6.4
55.6±14.0P
55.7±16.1P
54±17.3P
49.9±6.5
52.6±16.0P
吞吐
73 t/s
延迟
10.59s
发布日期
  • 49
  • 55.5
  • 54.1
  • 55.6
  • 55.7
  • 54
  • 49.9
  • 52.6
Gemini 1.5 ProGoogle上下文输入价输出价服务商
+21
40.2±13.9P
39.6±11.1E
54.2±16.0P
43.7±11.8E
吞吐
18 t/s
延迟
2.58s
发布日期
  • 40.2
  • 39.6
  • 54.2
  • 43.7
Gemini 2.5 Flash ImageGoogle上下文32.8K输入价输出价服务商
+93
吞吐
延迟
发布日期2025-10-07
Gemini 2.5 Flash LiteGoogle上下文1.0M输入价$0.100/M输出价$0.400/M服务商
+128
36.5±13.9P
42.8±11.1E
53.3±11.8E
吞吐
277 t/s
延迟
1.41s
发布日期2025-09-25
  • 36.5
  • 42.8
  • 53.3
Gemini 3.1 Flash LiteGoogle上下文1.0M输入价输出价服务商
+128
44.5±16.1P
27.5±16.1P
42.6±16.1P
吞吐
191 t/s
延迟
6.58s
发布日期2026-05-07
  • 44.5
  • 27.5
  • 42.6
Gemini 1.5 Pro 001Google上下文输入价输出价服务商
+1
吞吐
延迟
发布日期
Gemini Flash LiteGoogle上下文输入价输出价服务商
+45
吞吐
延迟
发布日期
Gemini 3 FlashGoogle上下文1.0M输入价$0.500/M输出价$3.00/M服务商
+185
43±8.9
53.7±11.2E
52.2±8.7
50.6±16.0P
51.9±16.1P
47.8±16.0P
吞吐
162 t/s
延迟
7.48s
发布日期2025-12-17
  • 43
  • 53.7
  • 52.2
  • 50.6
  • 51.9
  • 47.8
Gemini 2.5 FlashGoogle上下文1.0M输入价$0.300/M输出价$2.50/M服务商
+170
36.3±16.0P
50.6±13.9P
48.9±8.7
40.8±16.0P
50.8±9.3E
43.1±16.0P
吞吐
155 t/s
延迟
8.55s
发布日期2025-06-17
  • 36.3
  • 50.6
  • 48.9
  • 40.8
  • 50.8
  • 43.1
Gemini 3.1 Flash ImageGoogle上下文131.1K输入价输出价服务商
+133
吞吐
延迟
发布日期2026-06-18
Gemini 2.5 Flash Native AudioGoogle上下文输入价输出价服务商
+7
吞吐
延迟
发布日期
Gemini 2.0 Flash 001Google上下文输入价输出价服务商
+24
吞吐
108 t/s
延迟
2.70s
发布日期
Gemini 3 Pro ImageGoogle上下文131.1K输入价输出价服务商
+113
吞吐
延迟
发布日期2026-06-18
Gemini FlashGoogle上下文1.0M输入价输出价服务商
+45
吞吐
延迟
发布日期2026-04-27
Gemini Embedding 001Google上下文20K输入价输出价服务商
+59
吞吐
延迟
发布日期2025-10-31
Gemini 2.0 FlashGoogle上下文输入价输出价服务商
+64
44.7±13.9P
46.5±11.1E
52.1±11.8E
吞吐
137 t/s
延迟
3.08s
发布日期
  • 44.7
  • 46.5
  • 52.1
Gemini 2.0 Flash Lite 001Google上下文输入价输出价服务商
+22
37.7±13.9P
43.3±11.1E
49.8±11.8E
吞吐
延迟
发布日期
  • 37.7
  • 43.3
  • 49.8
Gemini 2.0 Flash LiteGoogle上下文输入价输出价服务商
+40
37.4±13.9P
41.4±13.9P
50.1±11.8E
吞吐
182 t/s
延迟
1.49s
发布日期
  • 37.4
  • 41.4
  • 50.1
Gemini 2.0 ProGoogle上下文输入价输出价服务商
+12
43.9±13.9P
48.2±11.1E
52.1±11.8E
吞吐
67 t/s
延迟
8.47s
发布日期
  • 43.9
  • 48.2
  • 52.1
Gemini ProGoogle上下文1.0M输入价输出价服务商
+41
吞吐
延迟
发布日期2026-04-27
Gemini 1.5 FlashGoogle上下文输入价输出价服务商
+18
33.5±13.9P
37.2±11.1E
42.6±11.8E
吞吐
200 t/s
延迟
1.17s
发布日期
  • 33.5
  • 37.2
  • 42.6
Gemini 3.0 FlashGoogle上下文输入价输出价服务商
+4
吞吐
28 t/s
延迟
20.33s
发布日期
Gemini 1.5 Flash 002Google上下文输入价输出价服务商
+1
吞吐
155 t/s
延迟
1.62s
发布日期
Gemini 1.0 Pro VisionGoogle上下文输入价输出价服务商
吞吐
延迟
发布日期
Gemini Embedding 2Google上下文8.2K输入价输出价服务商
+36
吞吐
延迟
发布日期2026-05-20
Gemini 3.1 ProGoogle上下文1.0M输入价输出价服务商
+188
50.5±6.1
58.7±10.7E
58.2±8.7
57.8±15.1P
55.3±16.1P
59.7±17.3P
55.4±6.6
55.1±16.0P
吞吐
149 t/s
延迟
16.52s
发布日期2026-02-19
  • 50.5
  • 58.7
  • 58.2
  • 57.8
  • 55.3
  • 59.7
  • 55.4
  • 55.1
Gemini Live 2.5 FlashGoogle上下文输入价输出价服务商
吞吐
延迟
发布日期
Gemini Pro VisionGoogle上下文输入价输出价服务商
吞吐
延迟
发布日期
Gemini 2.0 Flash Live 001Google上下文输入价输出价服务商
+1
吞吐
延迟
发布日期
Gemini EmbeddingGoogle上下文输入价输出价服务商
+8
吞吐
延迟
发布日期
Gemini 3.1 FlashGoogle上下文输入价输出价服务商
+19
吞吐
延迟
发布日期
Gemini 2.5 Pro 1MGoogle上下文输入价输出价服务商
吞吐
延迟
发布日期
Gemini 2.5 Flash LiveGoogle上下文输入价输出价服务商
吞吐
延迟
发布日期
Gemini 3 Pro DeepSearchGoogle上下文输入价输出价服务商
+1
吞吐
延迟
发布日期
Gemini Robotics ER 1.5Google上下文输入价输出价服务商
+19
吞吐
延迟
发布日期
Gemini 3.0 ProGoogle上下文输入价输出价服务商
+1
吞吐
延迟
发布日期
Gemini 2.5 Flash DeepSearchGoogle上下文输入价输出价服务商
+2
吞吐
延迟
发布日期
Gemini 1.5 Pro 002Google上下文输入价输出价服务商
+2
吞吐
延迟
发布日期
Gemini 3.0 Pro ImageGoogle上下文输入价输出价服务商
吞吐
延迟
发布日期
Gemini 2.5 Pro DeepSearchGoogle上下文输入价输出价服务商
+2
吞吐
延迟
发布日期
Gemini 3.5 FlashGoogle上下文1.0M输入价$1.50/M输出价$9.00/M服务商
+107
60.6±5.6
55.8±8.9
53.4±8.4
53.9±14.0P
55.1±16.1P
56.3±11.9E
54.8±16.0P
吞吐
384 t/s
延迟
39.32s
发布日期2026-05-19
  • 60.6
  • 55.8
  • 53.4
  • 53.9
  • 55.1
  • 56.3
  • 54.8
Gemini 3.1 Flash Lite ImageGoogle上下文65.5K输入价输出价服务商
+32
吞吐
延迟
发布日期2026-06-30
Lyria 3 Pro PreviewGoogle上下文1.0M输入价输出价服务商
吞吐
延迟
发布日期2026-03-30
Lyria 3 Clip PreviewGoogle上下文1.0M输入价输出价服务商
吞吐
延迟
发布日期2026-03-30
Gemini 3.1 Flash Lite PreviewGoogle上下文1.0M输入价$0.250/M输出价$1.50/M服务商
+5
53.7±16.0P
53.1±13.9P
吞吐
延迟
发布日期2026-03-03
  • 53.7
  • 53.1
Nano Banana 2 (Gemini 3.1 Flash Image Preview)Google上下文65.5K输入价输出价服务商
+4
吞吐
延迟
发布日期2026-02-26
Gemini 3.1 Pro Preview Custom ToolsGoogle上下文1.0M输入价输出价服务商
+9
吞吐
延迟
发布日期2026-02-25
Gemini 3.1 Pro PreviewGoogle上下文1.0M输入价$2.00/M输出价$12.00/M服务商
+11
64.9±16.0P
63.7±13.9P
吞吐
延迟
发布日期2026-02-19
  • 64.9
  • 63.7
Gemini 3 Flash PreviewGoogle上下文1.0M输入价$0.500/M输出价$3.00/M服务商
+5
62.2±13.9P
60.2±11.1E
54.4±16.1P
吞吐
延迟
发布日期2025-12-17
  • 62.2
  • 60.2
  • 54.4
Nano Banana Pro (Gemini 3 Pro Image Preview)Google上下文65.5K输入价输出价服务商
+3
吞吐
延迟
发布日期2025-11-20
Gemini 2.5 Flash Lite Preview 09-2025Google上下文1.0M输入价$0.100/M输出价$0.400/M服务商
46.4±13.9P
47.8±11.1E
45.1±16.1P
吞吐
延迟
发布日期
  • 46.4
  • 47.8
  • 45.1
Gemini 2.5 Pro Preview 06-05Google上下文1.0M输入价$1.25/M输出价$10.00/M服务商
54±13.9P
55.4±11.1E
60.7±11.8E
吞吐
延迟
发布日期2025-06-05
  • 54
  • 55.4
  • 60.7
Gemini 2.5 Pro Preview 05-06Google上下文1.0M输入价输出价服务商
吞吐
延迟
发布日期2025-05-07
Gemini 3.1 Flash TTS PreviewGoogle上下文32.8K输入价输出价服务商
+7
吞吐
延迟
发布日期2026-04-24
Gemini Embedding 2 PreviewGoogle上下文8.2K输入价输出价服务商
吞吐
延迟
发布日期2026-04-17
Gemini 3.6 FlashGoogle上下文1.0M输入价$0.750/M输出价$3.75/M服务商
+65
53.2±8.6
55.6±11.9E
59.7±10.8E
57.5±14.0P
51.1±17.3P
吞吐
737 t/s
延迟
2.34s
发布日期2026-07-21
  • 53.2
  • 55.6
  • 59.7
  • 57.5
  • 51.1
Gemini 3.5 Flash-LiteGoogle上下文1.0M输入价$0.300/M输出价$2.50/M服务商
+38
42.9±8.8
47.2±9.3E
53.1±10.8E
51.8±14.0P
46.9±17.3P
吞吐
延迟
发布日期2026-07-21
  • 42.9
  • 47.2
  • 53.1
  • 51.8
  • 46.9
Gemini 3.7 FlashGoogle上下文1.0M输入价$0.750/M输出价$3.75/M服务商
+7
56.9±8.6
58.3±11.9E
59.3±10.8E
56.8±14.0P
57.2±16.1P
吞吐
延迟
发布日期2026-08-13
  • 56.9
  • 58.3
  • 59.3
  • 56.8
  • 57.2

如何阅读分类能力分

Agent、Coding、Reasoning 等能力列,是在某次 Category Score V3 运行中,相对于合格模型群的 0–100 实测能力估计。

它们不是成功率、IQ,也不是八个分类的平均分。请结合模型详情页中的 80% 区间、实测维度、benchmark family 和具体证据阅读。

查看完整评分方法论

这个目录展示什么

每一行都提供对比 LLM API 所需的信息。如果 LMSpeed 没有模型或服务商的当前数据,对应字段会留空。

API 价格
有数据时可以对比每百万 token 的输入和输出价格。
速度和延迟
用吞吐量和首字延迟对比响应表现。
服务商覆盖
打开模型页可以查看已列出的服务商和当前信息。
能力数据
有当前评分时可以查看模型能力列。

怎么使用模型目录

先确定你的重点,再对比当前数据,最后测试接口。

  1. 找到模型.按模型名、slug 或描述搜索。
  2. 按关键指标排序.可以按价格、吞吐量、延迟、服务商数量或能力数据排序。
  3. 对比服务商.打开模型页,查看服务商选项和当前数据。
  4. 测试你的接口.在生产环境使用接口前,先跑一次速度测试。

常见问题

LMSpeed 怎么评测大模型?

LMSpeed 对每个模型跑标准化的五轮 API 速度测试,测量输出吞吐量(每秒 token 数)、首字延迟和总响应时间,覆盖多个服务商。

哪个大模型的 API 延迟最低?

延迟因服务商和模型不同而不同。在 LMSpeed 模型目录中按延迟排序,找到首字响应最快的模型。也可以查看延迟排行榜看月度排名。

怎么对比大模型 API 价格?

LMSpeed 列出每个模型在可用服务商的输入和输出价格(每百万 token)。按价格排序可以找较低价格的选项,也可以按服务商筛选对比。

什么是 AI 模型目录?

AI 模型目录是一个可搜索的模型清单,里面有对比数据。LMSpeed 在有数据时展示 API 价格、吞吐量、首字延迟、服务商覆盖和能力数据。

怎么选择模型和服务商?

先看最重要的指标。再打开模型页对比服务商数据。生产环境使用前,请测试你自己的接口。

模型价格和速度会变化吗?

会。价格、可用性、吞吐量和延迟会随模型、服务商和时间变化。页面数据只能用作对比信号。请用自己的接口确认。