OpenAI
·Released on 2025年8月5日

gpt-oss-20b API 基准测试 价格和服务商数据

选择与 gpt-oss-20b 对比的模型

选择一个模型后会直接打开对应的对比页面。

分享到 X
LLM

gpt-oss-20b 页面汇总基准测试、API 价格和服务商数据,覆盖 5 家服务商,价格从 $0.0005/M 起。gpt-oss-20b 免费 API 额度来自 1 家服务商。

gpt-oss-20b is an open-weight 21B parameter model released by OpenAI under the Apache 2.0 license. It uses a Mixture-of-Experts (MoE) architecture with 3.6B active parameters per forward pass, optimiz...

质量
0.0
LMSpeed 评分
成本
#5of 180
$0.0005/ 1M · 8:1 in:out
$0.0000877 in · $0.0005 out

分类性能

基于独立 benchmark family 的实测能力估计,不确定性单独展示。

覆盖
6 / 8
方法论
V3.0
分类性能基于独立 benchmark family 的实测能力估计,不确定性单独展示。智能体37.6代码48综合推理44.2知识35.7数学53多语言-多模态-指令遵循50.8
#1数学53暂定评分1/4 实测维度
80% 区间: 36.869.1
foundational math53
aa_math_index · artificial_analysis_math_index
competition math仅先验
proof frontier仅先验
applied tool math仅先验
#2指令遵循50.8暂定评分1/4 实测维度
80% 区间: 34.866.8
constraint following仅先验
structured output仅先验
novel instruction generalization50.8
ifbench · aa_if_bench
long multiturn instruction仅先验
#3代码48估算2/4 实测维度
80% 区间: 36.859.3
code generation51.6
livecodebench · livecodebench / scicode · scicode
repository engineering44.5
react_native_bench · react_native_evals
debugging testing仅先验
tooling quality仅先验
#4综合推理44.2正式评分全站排名 #573/4 实测维度
80% 区间: 35.552.9
abstract logic仅先验
scientific causal48.1
critpt · critpt / gpqa · gpqa / hle · hle
multistep constraints47.5
mmlu_pro · mmlu_pro
evidence verification37
lcr · lcr
#5智能体37.6估算3/4 实测维度
80% 区间: 28.446.9
planning仅先验
tool use45.1
tau · tau2_bench
environment execution38
gdpval_aa · benchlm_agentic_gdpval_aa
recovery reliability29.8
apex_agents · apex_agents_aa
#6知识35.7暂定评分1/4 实测维度
80% 区间: 19.751.7
broad knowledge35.7
aa_omniscience · aa_omniscience_index
professional knowledge仅先验
factuality仅先验
retrieval open book仅先验
暂无数据:多语言多模态

技术规格

Input and output token limits for this model, plus how it ranks on long-context understanding.

INPUT
131.1Ktokens
157.3 pages of text
OUTPUT
131.1Ktokens
8K128K1M4M
131.1K

能力

Technical Details

输入
输出
总参数量
20B
发布日期
Aug 2025
知识截止
2024-06-30
Tokenizer
GPT
架构
text->text
内容审核
支持参数
frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p

排名

擅长

相对落后

详细分数

更新时间: 2026年8月22日

速度与延迟

2 个指标

输出速度157.9 tok/s#14 / 74首字延迟0.74 s#18 / 74
输出速度
Output speed
站内排名#14
分数157.9 tok/s
更新时间2026年8月22日
置信度4
首字延迟
Time to first token
站内排名#18
分数0.74 s
更新时间2026年8月22日
置信度4

价格

2 个指标

输入价格$0.070/M#5 / 180输出价格$0.200/M#3 / 180
输入价格
Input price
站内排名#5
分数$0.070/M
更新时间2026年8月22日
置信度4
输出价格
Output price
站内排名#3
分数$0.200/M
更新时间2026年8月22日
置信度4

智能体

V3.0

5 个指标 · 估算

分数37.680% 区间28.4–46.93/4 实测维度AA Agentic Index3.1#58 / 65APEX-Agents-AA0.7#23 / 23
维度与证据
规划拆解仅先验
工具调用45.1
1 个基准族 · 1 个指标
tau · tau2_bench · z -0.76 · q 1.00
环境与长程执行38
1 个基准族 · 1 个指标
gdpval_aa · benchlm_agentic_gdpval_aa · z -1.78 · q 1.00
恢复与完成可靠性29.8
1 个基准族 · 1 个指标
apex_agents · apex_agents_aa · z -3.00 · q 1.00
AA Agentic Index
站内排名#58
分数3.1
更新时间2026年8月14日
置信度1
APEX-Agents-AAV3 计分证据
站内排名#23
分数0.7
更新时间2026年8月14日
置信度1
Τ²-bench resultsV3 计分证据
站内排名#63
分数60.2
更新时间2026年8月14日
置信度1
GDPval-AA
站内排名#58
分数3.2
更新时间2026年8月14日
置信度1
GDPval-AAV3 计分证据
站内排名#58
分数565.0
更新时间2026年8月14日
置信度1

代码

V3.0

5 个指标 · 估算

分数4880% 区间36.8–59.32/4 实测维度LiveCodeBench65.2%#37 / 115SciCode34.0%#133 / 204
维度与证据
代码生成51.6
2 个基准族 · 2 个指标
livecodebench · livecodebench · z 0.86 · q 1.00
scicode · scicode · z -0.35 · q 1.00
仓库工程44.5
1 个基准族 · 1 个指标
react_native_bench · react_native_evals · z -0.75 · q 1.00
调试与测试仅先验
工具化开发与质量仅先验
LiveCodeBenchV3 计分证据
站内排名#37
分数65.2%
更新时间2026年8月22日
置信度4
SciCodeV3 计分证据
站内排名#133
分数34.0%
更新时间2026年8月22日
置信度4
React Native EvalsV3 计分证据
站内排名#12
分数71.0
更新时间2026年8月14日
置信度1
AA Coding Index
站内排名#63
分数20.7
更新时间2026年8月14日
置信度1
AA-SciCodeV3 计分证据
站内排名#90
分数34.4
更新时间2026年8月14日
置信度1

综合推理

V3.0

5 个指标 · 正式评分

分数44.2#5780% 区间35.5–52.93/4 实测维度MMLU-Pro71.8%#97 / 129GPQA61.1%#158 / 211
维度与证据
抽象逻辑仅先验
科学与因果推理48.1
3 个基准族 · 3 个指标
critpt · critpt · z -0.29 · q 1.00
gpqa · gpqa · z -0.39 · q 1.00
hle · hle · z -0.17 · q 1.00
多步约束47.5
1 个基准族 · 1 个指标
mmlu_pro · mmlu_pro · z -0.53 · q 1.00
证据整合与验证37
1 个基准族 · 1 个指标
lcr · lcr · z -2.09 · q 1.00
MMLU-ProV3 计分证据
站内排名#97
分数71.8%
更新时间2026年8月22日
置信度4
GPQAV3 计分证据
站内排名#158
分数61.1%
更新时间2026年8月22日
置信度4
HLEV3 计分证据
站内排名#152
分数5.3%
更新时间2026年8月22日
置信度4
AA-LCRV3 计分证据
站内排名#91
分数33.3
更新时间2026年8月14日
置信度1
CritPtV3 计分证据
站内排名#61
分数1.4
更新时间2026年8月14日
置信度1

知识

V3.0

5 个指标 · 暂定评分

分数35.780% 区间19.7–51.71/4 实测维度Artificial Analysis Intelligence Index15.2#93 / 111AA-GPQA Diamond68.8#86 / 108
维度与证据
广泛知识35.7
1 个基准族 · 1 个指标
aa_omniscience · aa_omniscience_index · z -2.00 · q 1.00
专业知识仅先验
事实性仅先验
检索与开放资料运用仅先验
Artificial Analysis Intelligence IndexV3 计分证据
站内排名#93
分数15.2
更新时间2026年8月14日
置信度1
AA-GPQA Diamond
站内排名#86
分数68.8
更新时间2026年8月14日
置信度1
AA-HLE
站内排名#81
分数11.0
更新时间2026年8月14日
置信度1
AA-Omniscience Accuracy
站内排名#95
分数16.0
更新时间2026年8月14日
置信度1
AA-Omniscience Hallucination Rate
站内排名#2
分数94.1
更新时间2026年8月14日
置信度1

数学

V3.0

0 个指标 · 暂定评分

分数5380% 区间36.8–69.11/4 实测维度
维度与证据
基础数学53
1 个基准族 · 1 个指标
aa_math_index · artificial_analysis_math_index · z 0.80 · q 1.00
竞赛数学仅先验
高阶证明仅先验
应用与工具辅助数学仅先验

多语言

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
跨语言理解仅先验
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验

多模态

V3.0

1 个指标 · 暂无数据

80% 区间30.8–69.20/4 实测维度Design Arena Website875.0#73 / 75
维度与证据
感知与 OCR仅先验
文档与空间理解仅先验
视觉推理仅先验
视频与落地行动仅先验
Design Arena Website
站内排名#73
分数875.0
更新时间2026年8月14日
置信度1

指令遵循

V3.0

1 个指标 · 暂定评分

分数50.880% 区间34.8–66.81/4 实测维度AA-IFBench65.1#45 / 84
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化50.8
1 个基准族 · 1 个指标
ifbench · aa_if_bench · z -0.16 · q 1.00
多轮与长指令仅先验
AA-IFBenchV3 计分证据
站内排名#45
分数65.1
更新时间2026年8月14日
置信度1

OpenRouter 端点

12 个端点

来自 OpenRouter 的第三方端点数据,和 LMSpeed 自测数据分开展示。部分 30 分钟实时性能字段需要配置 OpenRouter API key 后同步才会出现。

Provider endpoint输入输出1 天在线率30m 延迟30m 吞吐上下文 / 输出
Amazon Bedrock
amazon-bedrock/eu-west-1
$0.070/M$0.150/M100%undefined tokens / —
Novita
novita/fp4
$0.040/M$0.150/M100.0%undefined tokens / undefined tokens
CoreWeave
coreweave/fp4
$0.030/M$0.130/M100.0%undefined tokens / undefined tokens
Parasail
parasail/fp4
$0.030/M$0.150/M99.9%undefined tokens / undefined tokens
DeepInfra
deepinfra/bf16
$0.030/M$0.140/M99.9%undefined tokens / undefined tokens
Fireworks
fireworks
$0.070/M$0.300/M99.7%undefined tokens / —
Phala
phala
$0.040/M$0.150/M99.3%undefined tokens / undefined tokens
Together
together
$0.050/M$0.200/M99.3%undefined tokens / —
Amazon Bedrock
amazon-bedrock
$0.070/M$0.150/M99.2%undefined tokens / —
SiliconFlow
siliconflow/fp8
$0.040/M$0.180/M98.6%undefined tokens / undefined tokens
Groq
groq
$0.075/M$0.300/M98.0%undefined tokens / undefined tokens
Google
google-vertex/us-central1
$0.070/M$0.250/M84.4%undefined tokens / undefined tokens

价格对比

对比 gpt-oss-20b 在 4 家服务商的 API 价格。价格从 $0.0005/M 到 $0.255/M,其中 云AI 提供最低价 $0.0005/M。 1 家服务商提供免费 API 额度或免费套餐。

服务商健康度模型变体分组输入 ($/M)输出 ($/M)速度 (t/s)首字延迟检测
L1
100%
gpt-oss:20b
default
免费
免费
L1
99%
gpt-oss-20b
测试
$0.255/M
$1.02/M
L1
99%
gpt-oss-20b
测试
$0.255/M
$1.02/M
L1
100%
gpt-oss-20b
mix
-99%$0.0005/M
-99%$0.0026/M
L1
100%
gpt-oss-20b
测试
$0.137/M
$0.548/M

替代方案与相似模型

常见问题

gpt-oss-20b 包含哪些基准测试数据?
LMSpeed 会在数据可用时展示 gpt-oss-20b 的基准测试、API 价格、输出速度、首字延迟和 5 家服务商数据。
gpt-oss-20b API 价格是多少?
gpt-oss-20b5 家服务商有价格记录,价格从 $0.0005/M $0.255/M。最低价由 云AI 提供。
gpt-oss-20b API 价格表包含什么?
gpt-oss-20b API 价格表会对比 5 家服务商的输入价格、输出价格、免费额度、速度、首字延迟和近期健康数据。
哪家服务商的 gpt-oss-20b API 价格最低?
云AI 当前提供 gpt-oss-20b 的最低收录价格:$0.0005/M,共对比 5 家服务商。
gpt-oss-20b 的 API 免费吗?
是的,gpt-oss-20b 免费 API 可通过 LMSpeed 上的 1 家服务商使用,包括Moyanjdc API。这些服务商提供免费 API 额度或免费套餐,无需按 token 计费。
哪里可以使用 gpt-oss-20b 免费 API?
LMSpeed 当前收录了 1 家 gpt-oss-20b 免费 API 服务商,包括Moyanjdc API。免费额度和限制可能变化,使用前请查看每一行服务商数据。

别名

gpt-oss-20bgpt-oss:20b

排名基于社区提交的测试数据与定期健康探测,仅供参考,非官方数据。标准基准数据可能包含 BenchLM 等公开来源。

通过 API 获取 LMSpeed 数据

免费

免费的大模型价格、基准测试和服务商数据公开 API

  • 实时价格与可用性
  • 速度与延迟基准测试
  • 300+ 模型,600+ 服务商
  • 每天 1,000 次请求
查看 API 文档