模型上下文输入价输出价服务商Agents编程推理知识数学多语言多模态指令遵循吞吐延迟发布日期
GLM 5.3Z.ai上下文1.0M输入价$1.40/M输出价$4.40/M服务商
+5
63.5±16.0P
61.4±13.9P
吞吐
533 t/s
延迟
46.16s
发布日期2026-08-18
  • 63.5
  • 61.4
Qwen3.8 27BQwen上下文1M输入价$0.500/M输出价$3.00/M服务商
57.2±11.9E
55.1±10.6E
52.5±13.9P
41.5±16.1P
57.7±11.3E
56.1±16.0P
吞吐
延迟
发布日期2026-08-14
  • 57.2
  • 55.1
  • 52.5
  • 41.5
  • 57.7
  • 56.1
Gemini 3.7 FlashGoogle上下文1.0M输入价$0.750/M输出价$3.75/M服务商
+7
57.2±8.6
58.5±11.9E
59.4±10.8E
57.3±14.0P
57.2±16.1P
吞吐
延迟
发布日期2026-08-13
  • 57.2
  • 58.5
  • 59.4
  • 57.3
  • 57.2
Qwen3 Reranker 8BQwen上下文41.0K输入价输出价服务商
吞吐
延迟
发布日期2026-08-13
Qwen3.8 2.4T A95BQwen上下文1.0M输入价$2.00/M输出价$6.00/M服务商
60.2±16.0P
62.6±13.9P
吞吐
延迟
发布日期2026-08-12
  • 60.2
  • 62.6
Grok 4.6SpaceXAI上下文500K输入价$2.00/M输出价$6.00/M服务商
+16
62.8±8.6
58.8±11.9E
59.4±10.8E
58.4±14.0P
吞吐
109 t/s
延迟
10.11s
发布日期2026-08-12
  • 62.8
  • 58.8
  • 59.4
  • 58.4
DeepSeek V4 Pro 0813DeepSeek上下文1.0M输入价输出价服务商
57.5±7.7
57.1±6.1
61±8.3
58.4±18.0P
58.9±12.2E
54.9±16.0P
吞吐
延迟
发布日期2026-08-12
  • 57.5
  • 57.1
  • 61
  • 58.4
  • 58.9
  • 54.9
Nemotron 3.5 LightningNVIDIA上下文262.1K输入价$0.070/M输出价$0.220/M服务商
+3
46.3±16.0P
49±13.9P
吞吐
213 t/s
延迟
21.68s
发布日期2026-08-11
  • 46.3
  • 49
Solar Pro 4Upstage上下文524.3K输入价$0.300/M输出价$1.20/M服务商
54.9±16.0P
58.1±13.9P
吞吐
延迟
发布日期2026-08-10
  • 54.9
  • 58.1
Muse Glimmer 30BMeta上下文131.1K输入价输出价服务商
47.7±10.2E
46.6±6.9
56.1±10.8E
43.3±16.0P
46.1±16.3P
46.4±9.4E
55.1±16.0P
吞吐
延迟
发布日期2026-08-09
  • 47.7
  • 46.6
  • 56.1
  • 43.3
  • 46.1
  • 46.4
  • 55.1
Ling 3.0 TinyinclusionAI上下文262.1K输入价输出价服务商
40.2±16.0P
48.3±13.9P
吞吐
延迟
发布日期2026-08-06
  • 40.2
  • 48.3
Muse Spark 1.2Meta上下文1.0M输入价$1.25/M输出价$4.25/M服务商
+2
56.9±9.3E
57.6±11.9E
61.3±10.8E
55.4±14.0P
吞吐
69 t/s
延迟
22.53s
发布日期2026-08-05
  • 56.9
  • 57.6
  • 61.3
  • 55.4
Qwen3.8 MaxQwen上下文1M输入价$2.00/M输出价$6.00/M服务商
+24
66.4±10.9E
66.2±11.2E
64.5±10.1E
52.7±14.0P
64.7±6.3
57.7±16.0P
吞吐
325 t/s
延迟
4.71s
发布日期2026-08-03
  • 66.4
  • 66.2
  • 64.5
  • 52.7
  • 64.7
  • 57.7
Inkling SmallThinking Machines上下文1.0M输入价$0.300/M输出价$1.20/M服务商
55.7±10.9E
52.7±6.9
50.9±8.7
52.3±14.0P
52.5±14.4P
45.9±11.9E
57.4±16.0P
吞吐
延迟
发布日期2026-07-30
  • 55.7
  • 52.7
  • 50.9
  • 52.3
  • 52.5
  • 45.9
  • 57.4
DeepSeek V4 Flash 0731DeepSeek上下文1.3M输入价输出价服务商
52.1±8.4
53±6.3
59.4±8.3
47.5±18.0P
57.9±12.2E
吞吐
74 t/s
延迟
2.70s
发布日期2026-07-31
  • 52.1
  • 53
  • 59.4
  • 47.5
  • 57.9
Qwen3.7 FlashQwen上下文1M输入价输出价服务商
+4
吞吐
388 t/s
延迟
11.58s
发布日期2026-07-27
Claude Opus 5Anthropic上下文1M输入价$5.00/M输出价$25.00/M服务商
+83
66.1±8.2
67.8±6.6
60.3±8.7
67.2±14.0P
64.3±17.1P
57.9±17.3P
吞吐
320 t/s
延迟
4.96s
发布日期2026-07-24
  • 66.1
  • 67.8
  • 60.3
  • 67.2
  • 64.3
  • 57.9
Ling-3.0-flashInclusionai上下文262.1K输入价$0.075/M输出价$0.220/M服务商
+10
47.8±10.2E
50.2±9.3E
52.7±10.8E
38.2±14.0P
46.7±11.5E
54.1±16.0P
吞吐
延迟
发布日期2026-07-23
  • 47.8
  • 50.2
  • 52.7
  • 38.2
  • 46.7
  • 54.1
Laguna S 2.1Poolside上下文1.0M输入价输出价服务商
+12
53.5±16.0P
54.1±9.3E
吞吐
41 t/s
延迟
1.46s
发布日期2026-07-21
  • 53.5
  • 54.1
Gemini 3.5 Flash-LiteGoogle上下文1.0M输入价$0.300/M输出价$2.50/M服务商
+38
43.6±8.8
47.2±9.3E
53.1±10.8E
51.4±14.0P
45.8±17.3P
吞吐
延迟
发布日期2026-07-21
  • 43.6
  • 47.2
  • 53.1
  • 51.4
  • 45.8
Gemini 3.6 FlashGoogle上下文1.0M输入价$0.750/M输出价$3.75/M服务商
+65
53.3±8.6
55.7±11.9E
59.7±10.8E
57.3±14.0P
50.6±17.3P
吞吐
737 t/s
延迟
2.34s
发布日期2026-07-21
  • 53.3
  • 55.7
  • 59.7
  • 57.3
  • 50.6
InklingThinking Machines上下文1.0M输入价$1.00/M输出价$4.05/M服务商
+12
50.9±8.3
49.8±6.9
55.4±10.8E
53.1±14.0P
65.4±16.3P
45.8±11.9E
56.3±16.0P
吞吐
25 t/s
延迟
0.79s
发布日期2026-07-17
  • 50.9
  • 49.8
  • 55.4
  • 53.1
  • 65.4
  • 45.8
  • 56.3
Nemotron 3 Embed 1BNVIDIA上下文32.8K输入价输出价服务商
吞吐
延迟
发布日期2026-07-16
Muse Spark 1.1Meta上下文1.0M输入价$1.25/M输出价$4.25/M服务商
+2
63.1±7.4
59.1±9.3E
59.5±10.2E
65.7±14.0P
56.8±16.1P
吞吐
延迟
发布日期2026-07-16
  • 63.1
  • 59.1
  • 59.5
  • 65.7
  • 56.8
Kimi K3MoonshotAI上下文1.0M输入价$3.00/M输出价$15.00/M服务商
+83
68.3±7.3
57.4±11.9E
59.3±10.8E
61.4±14.0P
65±11.3E
吞吐
161 t/s
延迟
27.59s
发布日期2026-07-16
  • 68.3
  • 57.4
  • 59.3
  • 61.4
  • 65
KAT-Coder-Pro V2.5Kwaipilot上下文256K输入价输出价服务商
+2
吞吐
延迟
发布日期2026-07-10
Qwen3 Embedding 4BQwen上下文32.8K输入价输出价服务商
吞吐
延迟
发布日期2025-10-28
Qwen3 Embedding 8BQwen上下文32.8K输入价输出价服务商
吞吐
延迟
发布日期2025-10-28
Mistral Embed 2312Mistral上下文8.2K输入价输出价服务商
吞吐
延迟
发布日期2025-10-31
FLUX.2 FlexBlack Forest Labs上下文67.3K输入价输出价服务商
吞吐
延迟
发布日期2025-11-25
FLUX.2 Klein 4BBlack Forest Labs上下文41.0K输入价输出价服务商
吞吐
延迟
发布日期2026-01-14
Llama Nemotron Embed VL 1B V2NVIDIA上下文131.1K输入价输出价服务商
吞吐
延迟
发布日期2026-02-25
Gemini Embedding 2 PreviewGoogle上下文8.2K输入价输出价服务商
吞吐
延迟
发布日期2026-04-17
Gemini 3.1 Flash TTS PreviewGoogle上下文32.8K输入价输出价服务商
+7
吞吐
延迟
发布日期2026-04-24
Qwen3 ASR FlashQwen上下文0输入价输出价服务商
吞吐
延迟
发布日期2026-05-14
MAI-Image-2.5Microsoft上下文4.1K输入价输出价服务商
吞吐
延迟
发布日期2026-06-02
Llama Nemotron Rerank VL 1B V2NVIDIA上下文10.2K输入价输出价服务商
吞吐
延迟
发布日期2026-06-09
GPT-5.6 Sol ProOpenAI上下文1.1M输入价输出价服务商
+2
吞吐
延迟
发布日期2026-07-09
GPT-5.6 Terra ProOpenAI上下文1.1M输入价输出价服务商
+2
吞吐
延迟
发布日期2026-07-09
GPT-5.6 Luna ProOpenAI上下文1.1M输入价输出价服务商
+3
吞吐
延迟
发布日期2026-07-09
GPT-3.5 Turbo 16kOpenAI上下文16.4K输入价输出价服务商
+1
吞吐
延迟
发布日期2023-08-28
GPT-4 Turbo PreviewOpenAI上下文128K输入价输出价服务商
吞吐
延迟
发布日期2024-01-25
GPT-3.5 Turbo (older v0613)OpenAI上下文4.1K输入价输出价服务商
+1
吞吐
延迟
发布日期2024-01-25
Llama 3 8B InstructMeta上下文8.2K输入价输出价服务商
+1
吞吐
延迟
发布日期
GPT-4o (2024-05-13)OpenAI上下文128K输入价$5.00/M输出价$15.00/M服务商
43.4±13.9P
42.7±11.1E
46±11.8E
吞吐
延迟
发布日期2024-05-13
  • 43.4
  • 42.7
  • 46
GPT-4o-mini (2024-07-18)OpenAI上下文128K输入价输出价服务商
吞吐
延迟
发布日期2024-07-18
Llama 3.1 70B InstructMeta上下文131.1K输入价输出价服务商
+1
吞吐
延迟
发布日期2024-07-23
Llama 3.1 8B InstructMeta上下文131.1K输入价输出价服务商
+2
吞吐
延迟
发布日期2024-07-23
GPT-4o (2024-08-06)OpenAI上下文128K输入价$2.50/M输出价$10.00/M服务商
44.3±13.9P
39.1±13.9P
46.2±11.8E
吞吐
延迟
发布日期2024-08-06
  • 44.3
  • 39.1
  • 46.2
Hermes 3 70B InstructNous上下文131.1K输入价$0.700/M输出价$0.700/M服务商
36.5±13.9P
37.7±11.1E
39.6±11.8E
吞吐
延迟
发布日期2024-08-18
  • 36.5
  • 37.7
  • 39.6
Llama 3.2 11B Vision InstructMeta上下文131.1K输入价输出价服务商
+4
吞吐
延迟
发布日期2024-09-25
Llama 3.2 1B InstructMeta上下文60K输入价输出价服务商
+4
吞吐
延迟
发布日期2024-09-25
Llama 3.2 3B InstructMeta上下文131.1K输入价输出价服务商
+8
吞吐
延迟
发布日期2024-09-25
Mistral Large 2407Mistralai上下文131.1K输入价$2.00/M输出价$6.00/M服务商
40.3±13.9P
41.1±11.1E
44.5±11.8E
吞吐
延迟
发布日期2024-11-19
  • 40.3
  • 41.1
  • 44.5
GPT-4o (2024-11-20)OpenAI上下文128K输入价输出价服务商
吞吐
延迟
发布日期2024-11-20
Llama 3.3 70B InstructMeta上下文131.1K输入价输出价服务商
+6
吞吐
延迟
发布日期2024-12-06
DeepSeek V3DeepSeek上下文163.8K输入价输出价服务商
+15
吞吐
延迟
发布日期2024-12-26
R1 Distill Llama 70BDeepSeek上下文8.2K输入价$0.700/M输出价$1.10/M服务商
42.6±13.9P
45.3±11.1E
55±11.8E
吞吐
延迟
发布日期2025-01-23
  • 42.6
  • 45.3
  • 55
Qwen2.5 VL 72B InstructQwen上下文128K输入价输出价服务商
吞吐
延迟
发布日期2025-02-01
o3 Mini HighOpenAI上下文200K输入价$1.10/M输出价$4.40/M服务商
53.3±13.9P
51±11.1E
61.3±11.8E
吞吐
延迟
发布日期2025-02-12
  • 53.3
  • 51
  • 61.3

如何阅读分类能力分

Agent、Coding、Reasoning 等能力列,是在某次 Category Score V3 运行中,相对于合格模型群的 0–100 实测能力估计。

它们不是成功率、IQ,也不是八个分类的平均分。请结合模型详情页中的 80% 区间、实测维度、benchmark family 和具体证据阅读。

查看完整评分方法论

这个目录展示什么

每一行都提供对比 LLM API 所需的信息。如果 LMSpeed 没有模型或服务商的当前数据,对应字段会留空。

API 价格
有数据时可以对比每百万 token 的输入和输出价格。
速度和延迟
用吞吐量和首字延迟对比响应表现。
服务商覆盖
打开模型页可以查看已列出的服务商和当前信息。
能力数据
有当前评分时可以查看模型能力列。

怎么使用模型目录

先确定你的重点,再对比当前数据,最后测试接口。

  1. 找到模型.按模型名、slug 或描述搜索。
  2. 按关键指标排序.可以按价格、吞吐量、延迟、服务商数量或能力数据排序。
  3. 对比服务商.打开模型页,查看服务商选项和当前数据。
  4. 测试你的接口.在生产环境使用接口前,先跑一次速度测试。

常见问题

LMSpeed 怎么评测大模型?

LMSpeed 对每个模型跑标准化的五轮 API 速度测试,测量输出吞吐量(每秒 token 数)、首字延迟和总响应时间,覆盖多个服务商。

哪个大模型的 API 延迟最低?

延迟因服务商和模型不同而不同。在 LMSpeed 模型目录中按延迟排序,找到首字响应最快的模型。也可以查看延迟排行榜看月度排名。

怎么对比大模型 API 价格?

LMSpeed 列出每个模型在可用服务商的输入和输出价格(每百万 token)。按价格排序可以找较低价格的选项,也可以按服务商筛选对比。

什么是 AI 模型目录?

AI 模型目录是一个可搜索的模型清单,里面有对比数据。LMSpeed 在有数据时展示 API 价格、吞吐量、首字延迟、服务商覆盖和能力数据。

怎么选择模型和服务商?

先看最重要的指标。再打开模型页对比服务商数据。生产环境使用前,请测试你自己的接口。

模型价格和速度会变化吗?

会。价格、可用性、吞吐量和延迟会随模型、服务商和时间变化。页面数据只能用作对比信号。请用自己的接口确认。