OpenAI
·Released on 2025年8月5日

gpt-oss-120b API 基准测试 价格和服务商数据

选择与 gpt-oss-120b 对比的模型

选择一个模型后会直接打开对应的对比页面。

分享到 X
LLM

gpt-oss-120b 页面汇总基准测试、API 价格和服务商数据,覆盖 98 家服务商,价格从 $0.0030/request 起。

gpt-oss-120b is an open-weight, 117B-parameter Mixture-of-Experts (MoE) language model from OpenAI designed for high-reasoning, agentic, and general-purpose production use cases. It activates 5.1B par...

质量
0.0
LMSpeed 评分
成本
#22of 180
$0.0030/ 1M · 8:1 in:out
$0.0005 in · $0.0025 out

分类性能

基于独立 benchmark family 的实测能力估计,不确定性单独展示。

覆盖
7 / 8
方法论
V3.0
分类性能基于独立 benchmark family 的实测能力估计,不确定性单独展示。智能体35.9代码47.8综合推理49.2知识55.2数学53.7多语言31.5多模态-指令遵循52.1
#1知识55.2暂定评分1/4 实测维度
80% 区间: 41.269.2
broad knowledge55.2
aa_omniscience · artificial_analysis / benchlm_category_knowledge · benchlm_category_knowledge
professional knowledge仅先验
factuality仅先验
retrieval open book仅先验
#2数学53.7暂定评分1/4 实测维度
80% 区间: 37.669.8
foundational math53.7
aa_math_index · artificial_analysis_math_index
competition math仅先验
proof frontier仅先验
applied tool math仅先验
#3指令遵循52.1暂定评分1/4 实测维度
80% 区间: 36.168.1
constraint following仅先验
structured output仅先验
novel instruction generalization52.1
ifbench · aa_if_bench
long multiturn instruction仅先验
#4综合推理49.2正式评分全站排名 #423/4 实测维度
80% 区间: 40.657.9
abstract logic仅先验
scientific causal51.1
critpt · critpt / gpqa · gpqa / hle · hle
multistep constraints52.2
mmlu_pro · mmlu_pro
evidence verification44.5
lcr · lcr
#5代码47.8正式评分全站排名 #293/4 实测维度
80% 区间: 38.756.9
code generation56
livecodebench · livecodebench / scicode · scicode
repository engineering44.9
react_native_bench · react_native_evals
debugging testing仅先验
tooling quality42.4
terminalbench · terminal_bench_hard
#6智能体35.9正式评分全站排名 #554/4 实测维度
80% 区间: 29.941.9
planning39.5
deep_planning · gert_labs
tool use46.1
tau · tau2_bench
environment execution32.8
enterprise_ops_gym · aa_enterprise_ops_gym / gdpval_aa · benchlm_agentic_gdpval_aa / itbench · aa_itbench
recovery reliability25
apex_agents · apex_agents_aa / briefcase · aa_briefcase_elo / harvey_lab · aa_harvey_lab
#7多语言31.5暂定评分1/4 实测维度
80% 区间: 14.248.8
cross language understanding31.5
global_mmlu · aa_global_mmlu_lite
multilingual generation仅先验
reasoning transfer仅先验
low resource robustness仅先验
暂无数据:多模态

技术规格

Input and output token limits for this model, plus how it ranks on long-context understanding.

INPUT
131.1Ktokens
157.3 pages of text
OUTPUT
131.1Ktokens
8K128K1M4M
131.1K

能力

Technical Details

输入
输出
总参数量
120B
发布日期
Aug 2025
知识截止
2024-06-30
Tokenizer
GPT
架构
text->text
内容审核
支持参数
frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_atop_ktop_logprobstop_p

排名

擅长

表现尚可

相对落后

详细分数

更新时间: 2026年8月23日

速度与延迟

2 个指标

输出速度153.1 tok/s#15 / 74首字延迟0.56 s#9 / 74
输出速度
Output speed
站内排名#15
分数153.1 tok/s
更新时间2026年8月23日
置信度4
首字延迟
Time to first token
站内排名#9
分数0.56 s
更新时间2026年8月23日
置信度4

价格

2 个指标

输入价格$0.150/M#22 / 180输出价格$0.595/M#25 / 180
输入价格
Input price
站内排名#22
分数$0.150/M
更新时间2026年8月23日
置信度4
输出价格
Output price
站内排名#25
分数$0.595/M
更新时间2026年8月23日
置信度4

智能体

V3.0

10 个指标 · 正式评分

分数35.9#5580% 区间29.9–41.94/4 实测维度AA Agentic Index13.4#53 / 65APEX-Agents-AA3.1#21 / 23
维度与证据
规划拆解39.5
1 个基准族 · 1 个指标
deep_planning · gert_labs · z -1.38 · q 1.00
工具调用46.1
1 个基准族 · 1 个指标
tau · tau2_bench · z -0.63 · q 1.00
环境与长程执行32.8
3 个基准族 · 3 个指标
enterprise_ops_gym · aa_enterprise_ops_gym · z -2.64 · q 1.00
gdpval_aa · benchlm_agentic_gdpval_aa · z -1.09 · q 1.00
itbench · aa_itbench · z -3.00 · q 1.00
恢复与完成可靠性25
3 个基准族 · 3 个指标
apex_agents · apex_agents_aa · z -2.93 · q 1.00
briefcase · aa_briefcase_elo · z -1.93 · q 1.00
harvey_lab · aa_harvey_lab · z -3.00 · q 1.00
AA Agentic Index
站内排名#53
分数13.4
更新时间2026年8月19日
置信度1
APEX-Agents-AAV3 计分证据
站内排名#21
分数3.1
更新时间2026年8月19日
置信度1
Τ²-bench resultsV3 计分证据
站内排名#60
分数65.8
更新时间2026年8月19日
置信度1
GDPval-AA
站内排名#54
分数15.0
更新时间2026年8月19日
置信度1
GDPval-AAV3 计分证据
站内排名#54
分数800.0
更新时间2026年8月19日
置信度1
Gert LabsV3 计分证据
站内排名#46
分数29.6
更新时间2026年8月19日
置信度1
AA ITBenchV3 计分证据
站内排名#8
分数5.6
更新时间2026年8月19日
置信度1
AA EnterpriseOps-GymV3 计分证据
站内排名#12
分数25.5
更新时间2026年8月19日
置信度1
AA Harvey LABV3 计分证据
站内排名#14
分数13.9
更新时间2026年8月19日
置信度1
AA BriefcaseV3 计分证据
站内排名#15
分数8.0
更新时间2026年8月19日
置信度1

代码

V3.0

8 个指标 · 正式评分

分数47.8#2980% 区间38.7–56.93/4 实测维度LiveCodeBench70.7%#29 / 115SciCode36.0%#120 / 204
维度与证据
代码生成56
2 个基准族 · 2 个指标
livecodebench · livecodebench · z 1.34 · q 1.00
scicode · scicode · z 0.07 · q 1.00
仓库工程44.9
1 个基准族 · 1 个指标
react_native_bench · react_native_evals · z -0.69 · q 1.00
调试与测试仅先验
工具化开发与质量42.4
1 个基准族 · 1 个指标
terminalbench · terminal_bench_hard · z -1.22 · q 1.00
LiveCodeBenchV3 计分证据
站内排名#29
分数70.7%
更新时间2026年8月23日
置信度4
SciCodeV3 计分证据
站内排名#120
分数36.0%
更新时间2026年8月23日
置信度4
Coding score
站内排名#40
分数57.3
更新时间2026年8月19日
置信度1
React Native EvalsV3 计分证据
站内排名#9
分数71.6
更新时间2026年8月19日
置信度1
AA Coding Index
站内排名#56
分数30.4
更新时间2026年8月19日
置信度1
AA-SciCodeV3 计分证据
站内排名#75
分数38.9
更新时间2026年8月19日
置信度1
AA LiveCodeBenchV3 计分证据
站内排名#3
分数87.8
更新时间2026年8月19日
置信度1
Terminal-Bench HardV3 计分证据
站内排名#9
分数23.5
更新时间2026年8月19日
置信度1

综合推理

V3.0

5 个指标 · 正式评分

分数49.2#4280% 区间40.6–57.93/4 实测维度MMLU-Pro77.5%#77 / 129GPQA67.2%#143 / 211
维度与证据
抽象逻辑仅先验
科学与因果推理51.1
3 个基准族 · 3 个指标
critpt · critpt · z -0.39 · q 1.00
gpqa · gpqa · z 0.06 · q 1.00
hle · hle · z 0.27 · q 1.00
多步约束52.2
1 个基准族 · 1 个指标
mmlu_pro · mmlu_pro · z 0.09 · q 1.00
证据整合与验证44.5
1 个基准族 · 1 个指标
lcr · lcr · z -1.10 · q 1.00
MMLU-ProV3 计分证据
站内排名#77
分数77.5%
更新时间2026年8月23日
置信度4
GPQAV3 计分证据
站内排名#143
分数67.2%
更新时间2026年8月23日
置信度4
HLEV3 计分证据
站内排名#151
分数5.9%
更新时间2026年8月23日
置信度4
AA-LCRV3 计分证据
站内排名#79
分数51.0
更新时间2026年8月19日
置信度1
CritPtV3 计分证据
站内排名#65
分数1.1
更新时间2026年8月19日
置信度1

知识

V3.0

8 个指标 · 暂定评分

分数55.280% 区间41.2–69.21/4 实测维度Knowledge score64.0#43 / 69Artificial Analysis Intelligence Index24.1#80 / 111
维度与证据
广泛知识55.2
2 个基准族 · 2 个指标
aa_omniscience · artificial_analysis · z 0.95 · q 1.00
benchlm_category_knowledge · benchlm_category_knowledge · z -0.33 · q 1.00
专业知识仅先验
事实性仅先验
检索与开放资料运用仅先验
Knowledge scoreV3 计分证据
站内排名#43
分数64.0
更新时间2026年8月19日
置信度1
Artificial Analysis Intelligence IndexV3 计分证据
站内排名#80
分数24.1
更新时间2026年8月19日
置信度1
AA-GPQA Diamond
站内排名#75
分数78.2
更新时间2026年8月19日
置信度1
AA-HLE
站内排名#67
分数19.6
更新时间2026年8月19日
置信度1
AA-Omniscience Accuracy
站内排名#81
分数21.8
更新时间2026年8月17日
置信度1
AA-Omniscience Hallucination Rate
站内排名#17
分数90.8
更新时间2026年8月17日
置信度1
AA Openness Index
站内排名#4
分数38.9
更新时间2026年8月14日
置信度1
AA MMLU-Pro
站内排名#3
分数80.8
更新时间2026年8月14日
置信度1

数学

V3.0

1 个指标 · 暂定评分

分数53.780% 区间37.6–69.81/4 实测维度AA AIME 202593.4#2 / 2
维度与证据
基础数学53.7
1 个基准族 · 1 个指标
aa_math_index · artificial_analysis_math_index · z 0.90 · q 1.00
竞赛数学仅先验
高阶证明仅先验
应用与工具辅助数学仅先验
AA AIME 2025
站内排名#2
分数93.4
更新时间2026年8月14日
置信度1

多语言

V3.0

1 个指标 · 暂定评分

分数31.580% 区间14.2–48.81/4 实测维度AA Global-MMLU-Lite82.8#4 / 4
维度与证据
跨语言理解31.5
1 个基准族 · 1 个指标
global_mmlu · aa_global_mmlu_lite · z -3.00 · q 0.50
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验
AA Global-MMLU-LiteV3 计分证据
站内排名#4
分数82.8
更新时间2026年8月14日
置信度1

多模态

V3.0

1 个指标 · 暂无数据

80% 区间30.8–69.20/4 实测维度Design Arena Website979.0#71 / 75
维度与证据
感知与 OCR仅先验
文档与空间理解仅先验
视觉推理仅先验
视频与落地行动仅先验
Design Arena Website
站内排名#71
分数979.0
更新时间2026年8月19日
置信度1

指令遵循

V3.0

1 个指标 · 暂定评分

分数52.180% 区间36.1–68.11/4 实测维度AA-IFBench69.0#39 / 84
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化52.1
1 个基准族 · 1 个指标
ifbench · aa_if_bench · z 0.01 · q 1.00
多轮与长指令仅先验
AA-IFBenchV3 计分证据
站内排名#39
分数69.0
更新时间2026年8月14日
置信度1

OpenRouter 端点

20 个端点

来自 OpenRouter 的第三方端点数据,和 LMSpeed 自测数据分开展示。部分 30 分钟实时性能字段需要配置 OpenRouter API key 后同步才会出现。

Provider endpoint输入输出1 天在线率30m 延迟30m 吞吐上下文 / 输出
Amazon Bedrock
amazon-bedrock/eu-west-1
$0.150/M$0.600/M100%undefined tokens / —
Cerebras
cerebras/fp16
$0.350/M$0.750/M100.0%undefined tokens / undefined tokens
Groq
groq
$0.150/M$0.600/M100.0%undefined tokens / undefined tokens
DigitalOcean
digitalocean
$0.055/M$0.385/M99.9%undefined tokens / —
DeepInfra
deepinfra/turbo
$0.150/M$0.600/M99.8%undefined tokens / undefined tokens
Parasail
parasail/fp4
$0.100/M$0.750/M99.8%undefined tokens / undefined tokens
AkashML
akashml/bf16
$0.037/M$0.490/M99.7%undefined tokens / undefined tokens
BaseTen
baseten/fp4
$0.100/M$0.500/M99.6%undefined tokens / undefined tokens
SambaNova
sambanova
$0.140/M$0.950/M99.6%undefined tokens / undefined tokens
Phala
phala
$0.150/M$0.600/M99.6%undefined tokens / undefined tokens
Mara
mara
$0.150/M$0.750/M99.1%undefined tokens / undefined tokens
CoreWeave
coreweave/fp4
$0.030/M$0.170/M99.0%undefined tokens / undefined tokens
Nebius
nebius/fp4
$0.150/M$0.600/M98.6%undefined tokens / —
Amazon Bedrock
amazon-bedrock
$0.150/M$0.600/M98.4%undefined tokens / —
Mancer 2
mancer/fp8
$0.085/M$0.500/M98.0%undefined tokens / undefined tokens
Together
together
$0.150/M$0.600/M98.0%undefined tokens / —
DeepInfra
deepinfra/bf16
$0.037/M$0.170/M97.7%undefined tokens / undefined tokens
Novita
novita/fp4
$0.050/M$0.250/M97.6%undefined tokens / undefined tokens
SiliconFlow
siliconflow/fp8
$0.050/M$0.450/M89.8%undefined tokens / undefined tokens
Google
google-vertex/global
$0.090/M$0.360/M84.7%undefined tokens / undefined tokens

价格对比

对比 gpt-oss-120b 在 98 家服务商的 API 价格。价格从 $0.0030/request 到 $399.60/M,其中 Crond 提供最低价 $0.0030/request。

服务商健康度模型变体分组输入 ($/M)输出 ($/M)速度 (t/s)首字延迟检测
L1
100%
gpt-oss-120b
default
-75%$0.037/M
-71%$0.170/M
L1
99%
[极速0.04/次]GPT-OSS-120B
default
$0.037/request
-
L1
99%
gpt-oss-120b
default
-7%$0.140/M
-6%$0.561/M
L1
99%
gpt-oss-120b
default
-7%$0.140/M
-6%$0.561/M
L1
100%
gpt-oss-120b
mix
-97%$0.0041/M
-97%$0.016/M
L1
47%
gpt-oss-120b
default
$399.60/M
$1598.40/M
L1
100%
gpt-oss-120b
default
-50%$0.075/M
-49%$0.301/M
L1
0%
gpt-oss-120b-免费
免费玩耍
$0.0030/request
-

替代方案与相似模型

常见问题

gpt-oss-120b 包含哪些基准测试数据?
LMSpeed 会在数据可用时展示 gpt-oss-120b 的基准测试、API 价格、输出速度、首字延迟和 98 家服务商数据。
gpt-oss-120b API 价格是多少?
gpt-oss-120b98 家服务商有价格记录,价格从 $0.0030/request $399.60/M。最低价由 Crond 提供。
gpt-oss-120b API 价格表包含什么?
gpt-oss-120b API 价格表会对比 98 家服务商的输入价格、输出价格、免费额度、速度、首字延迟和近期健康数据。
哪家服务商的 gpt-oss-120b API 价格最低?
Crond 当前提供 gpt-oss-120b 的最低收录价格:$0.0030/request,共对比 98 家服务商。
gpt-oss-120b 的 API 免费吗?
gpt-oss-120b 目前在 LMSpeed 上没有免费 API 方案,98 家服务商均按 token 计费。

别名

[极速0.04/次]GPT-OSS-120Bgpt-oss-120bgpt-oss-120b-免费openai/gpt-oss-120b:free

排名基于社区提交的测试数据与定期健康探测,仅供参考,非官方数据。标准基准数据可能包含 BenchLM 等公开来源。

通过 API 获取 LMSpeed 数据

免费

免费的大模型价格、基准测试和服务商数据公开 API

  • 实时价格与可用性
  • 速度与延迟基准测试
  • 300+ 模型,600+ 服务商
  • 每天 1,000 次请求
查看 API 文档