OpenAI
·Released on 2026年3月5日

GPT-5.4 API 基准测试 价格和服务商数据

选择与 GPT-5.4 对比的模型

选择一个模型后会直接打开对应的对比页面。

分享到 X
LLM

GPT-5.4 页面汇总基准测试、API 价格和服务商数据,覆盖 582 家服务商,价格从 $0.0054/M 起。GPT-5.4 免费 API 额度来自 18 家服务商。页面同时展示实测速度和首字延迟。

OpenAI 的 GPT-5.4是语言模型,专为通用对话与文本生成任务优化。

质量
#41of 112
63.0
LMSpeed 评分
速度
49char/s
4.45 s
成本
#154of 186
$0.0054/ 1M · 8:1 in:out
$0.0009 in · $0.0045 out

分类性能

基于独立 benchmark family 的实测能力估计,不确定性单独展示。

覆盖
7 / 8
方法论
V3.0
分类性能基于独立 benchmark family 的实测能力估计,不确定性单独展示。智能体56.3代码62.2综合推理55.7知识58.5数学56.8多语言-多模态52.5指令遵循54
#1代码62.2估算2/4 实测维度
80% 区间: 51.972.5
code generation65.5
livecodebench · live_code_bench_pro / scicode · aa_sci_code
repository engineering59
react_native_bench · react_native_evals / swe_pro · swe_pro / vibecode · vibe_code_bench
debugging testing仅先验
tooling quality仅先验
#2知识58.5暂定评分1/4 实测维度
80% 区间: 43.573.6
broad knowledge仅先验
professional knowledge58.5
healthbench · health_bench_hard / medxpert · med_xpert_qa_text
factuality仅先验
retrieval open book仅先验
#3数学56.8暂定评分1/4 实测维度
80% 区间: 40.772.9
foundational math仅先验
competition math仅先验
proof frontier56.8
frontiermath · frontier_math_v2_tier4 / frontiermath · frontier_math_v2_tiers13
applied tool math仅先验
#4智能体56.3正式评分全站排名 #194/4 实测维度
80% 区间: 51.261.4
planning58.3
deep_planning · gert_labs
tool use59.8
mcp_atlas · mcp_atlas / tau · tau2_bench / toolathlon · toolathlon
environment execution54.5
browsecomp · browse_comp / deep_search_qa · deep_search_qa / gdpval_aa · benchlm_agentic_gdpval_aa / osworld · os_world_verified / terminalbench · benchlm_agentic_terminal_bench2
recovery reliability52.6
apex_agents · apex_agents_aa / claw_eval · claw_eval / cyber_gym · cyber_gym / exploit_gym · exploit_gym / jobbench · job_bench / researchclaw · research_claw_bench
#5综合推理55.7正式评分全站排名 #163/4 实测维度
80% 区间: 46.964.4
abstract logic50.7
arc_agi · arc_agi2
scientific causal59.1
critpt · critpt / gpqa · gpqa / hle · hle / hle · hle_no_tools
multistep constraints仅先验
evidence verification57.2
lcr · lcr
#6指令遵循54暂定评分1/4 实测维度
80% 区间: 38.070.0
constraint following仅先验
structured output仅先验
novel instruction generalization54
ifbench · aa_if_bench
long multiturn instruction仅先验
#7多模态52.5正式评分全站排名 #44/4 实测维度
80% 区间: 45.959.2
perception ocr46.7
simplevqa · simple_vqa
document spatial50.1
charxiv · charxiv
visual reasoning56.9
erqa · erqa / medxpert · med_xpert_qa_mm / mmmu_pro · mmmu_pro
video action56.5
screenspot · screen_spot_pro
暂无数据:多语言

技术规格

Input and output token limits for this model, plus how it ranks on long-context understanding.

INPUT
1.1Mtokens
1.3K pages of text
OUTPUT
128Ktokens
8K128K1M4M
1.1M

能力

Technical Details

输入
输出
发布日期
Mar 2026
官方文档
Tokenizer
GPT
架构
text+image+file->text
内容审核
支持参数
include_reasoningmax_completion_tokensmax_tokensreasoningreasoning_effortresponse_formatseedstructured_outputstool_choicetools

排名

擅长

表现尚可

相对落后

详细分数

更新时间: 2026年9月14日

综合

1 个指标

Overall score63.0#41 / 112
Overall score
站内排名#41
分数63.0
更新时间2026年9月14日
置信度4

价格

2 个指标

输入价格$2.50/M#154 / 186输出价格$15.00/M#159 / 186
输入价格
Input price
站内排名#154
分数$2.50/M
更新时间2026年9月14日
置信度4
输出价格
Output price
站内排名#159
分数$15.00/M
更新时间2026年9月14日
置信度4

智能体

V3.0

19 个指标 · 正式评分

分数56.3#1980% 区间51.2–61.44/4 实测维度Agentic score72.0#29 / 77Terminal-Bench 2.075.1#13 / 53
维度与证据
规划拆解58.3
1 个基准族 · 1 个指标
deep_planning · gert_labs · z 1.12 · q 1.00
工具调用59.8
3 个基准族 · 3 个指标
mcp_atlas · mcp_atlas · z -0.26 · q 1.00
tau · tau2_bench · z 1.50 · q 1.00
toolathlon · toolathlon · z 0.67 · q 1.00
环境与长程执行54.5
5 个基准族 · 5 个指标
browsecomp · browse_comp · z 0.11 · q 1.00
deep_search_qa · deep_search_qa · z -0.52 · q 1.00
gdpval_aa · benchlm_agentic_gdpval_aa · z 0.36 · q 1.00
osworld · os_world_verified · z 0.18 · q 1.00
terminalbench · benchlm_agentic_terminal_bench2 · z 0.79 · q 1.00
恢复与完成可靠性52.6
6 个基准族 · 6 个指标
apex_agents · apex_agents_aa · z 0.51 · q 1.00
claw_eval · claw_eval · z 0.11 · q 1.00
cyber_gym · cyber_gym · z 0.18 · q 1.00
exploit_gym · exploit_gym · z -0.84 · q 0.58
jobbench · job_bench · z 0.27 · q 1.00
researchclaw · research_claw_bench · z -0.89 · q 1.00
Agentic score
站内排名#29
分数72.0
更新时间2026年9月14日
置信度4
Terminal-Bench 2.0V3 计分证据
站内排名#13
分数75.1
更新时间2026年9月14日
置信度4
CyberGymV3 计分证据
站内排名#6
分数79.0
更新时间2026年9月14日
置信度4
BrowseCompV3 计分证据
站内排名#16
分数82.7
更新时间2026年9月14日
置信度4
OSWorld-VerifiedV3 计分证据
站内排名#11
分数75.0
更新时间2026年9月14日
置信度4
MCP AtlasV3 计分证据
站内排名#19
分数70.6
更新时间2026年9月14日
置信度4
ToolathlonV3 计分证据
站内排名#6
分数54.6
更新时间2026年9月14日
置信度4
Τ²-bench resultsV3 计分证据
站内排名#2
分数98.9
更新时间2026年9月14日
置信度4
Claw-EvalV3 计分证据
站内排名#13
分数60.3
更新时间2026年9月14日
置信度4
DeepSearchQAV3 计分证据
站内排名#12
分数73.6
更新时间2026年9月14日
置信度4
APEX-Agents-AAV3 计分证据
站内排名#7
分数33.3
更新时间2026年9月14日
置信度4
GDPval-AA
站内排名#26
分数40.3
更新时间2026年9月14日
置信度4
GDPval-AAV3 计分证据
站内排名#26
分数1307.0
更新时间2026年9月14日
置信度4
Gert LabsV3 计分证据
站内排名#4
分数64.9
更新时间2026年9月14日
置信度4
ResearchClawBenchV3 计分证据
站内排名#13
分数15.3
更新时间2026年9月14日
置信度4
JobBenchV3 计分证据
站内排名#7
分数38.9
更新时间2026年9月14日
置信度4
ExploitGymV3 计分证据
站内排名#6
分数6.0
更新时间2026年9月14日
置信度4
ApprenticeBench
站内排名#14
分数11.0
更新时间2026年9月14日
置信度4
AA Agentic Index
站内排名#14
分数44.2
更新时间2026年9月8日
置信度4

代码

V3.0

8 个指标 · 估算

分数62.280% 区间51.9–72.52/4 实测维度Coding score42.8#69 / 87LiveCodeBench Pro87.5#1 / 4
维度与证据
代码生成65.5
2 个基准族 · 2 个指标
livecodebench · live_code_bench_pro · z 1.29 · q 0.50
scicode · aa_sci_code · z 1.31 · q 1.00
仓库工程59
3 个基准族 · 3 个指标
react_native_bench · react_native_evals · z 0.98 · q 1.00
swe_pro · swe_pro · z 0.11 · q 1.00
vibecode · vibe_code_bench · z 1.43 · q 1.00
调试与测试仅先验
工具化开发与质量仅先验
Coding score
站内排名#69
分数42.8
更新时间2026年9月14日
置信度4
LiveCodeBench ProV3 计分证据
站内排名#1
分数87.5
更新时间2026年9月14日
置信度4
SWE-bench ProV3 计分证据
站内排名#21
分数57.7
更新时间2026年9月14日
置信度4
React Native EvalsV3 计分证据
站内排名#1
分数85.3
更新时间2026年9月14日
置信度4
Vibe Code BenchV3 计分证据
站内排名#3
分数67.4
更新时间2026年9月14日
置信度4
AA Coding Index
站内排名#21
分数71.0
更新时间2026年9月14日
置信度4
AA-SciCodeV3 计分证据
站内排名#10
分数56.6
更新时间2026年9月8日
置信度4
EEBench
站内排名#9
分数38.5
更新时间2026年8月20日
置信度3

综合推理

V3.0

7 个指标 · 正式评分

分数55.7#1680% 区间46.9–64.43/4 实测维度GPQA74.8%#122 / 218HLE11.3%#116 / 216
维度与证据
抽象逻辑50.7
1 个基准族 · 1 个指标
arc_agi · arc_agi2 · z 0.00 · q 1.00
科学与因果推理59.1
3 个基准族 · 4 个指标
critpt · critpt · z 0.87 · q 1.00
gpqa · gpqa · z 0.61 · q 1.00
hle · hle · z 0.60 · q 1.00
hle · hle_no_tools · z -0.33 · q 1.00
多步约束仅先验
证据整合与验证57.2
1 个基准族 · 1 个指标
lcr · lcr · z 0.62 · q 1.00
GPQAV3 计分证据
站内排名#122
分数74.8%
更新时间2026年9月14日
置信度4
HLEV3 计分证据
站内排名#116
分数11.3%
更新时间2026年9月14日
置信度4
AA-LCRV3 计分证据
站内排名#14
分数82.0
更新时间2026年9月14日
置信度4
CritPtV3 计分证据
站内排名#11
分数23.4
更新时间2026年9月14日
置信度4
Reasoning score
站内排名#51
分数57.2
更新时间2026年9月14日
置信度4
ARC-AGI-2V3 计分证据
站内排名#10
分数74.0
更新时间2026年9月14日
置信度4
ARC-AGI-3
站内排名#9
分数0.2
更新时间2026年9月14日
置信度4

知识

V3.0

12 个指标 · 暂定评分

分数58.580% 区间43.5–73.61/4 实测维度Knowledge score74.3#30 / 83HLE w/o tools39.8#15 / 22
维度与证据
广泛知识仅先验
专业知识58.5
2 个基准族 · 2 个指标
healthbench · health_bench_hard · z 0.66 · q 1.00
medxpert · med_xpert_qa_text · z 0.45 · q 0.50
事实性仅先验
检索与开放资料运用仅先验
Knowledge score
站内排名#30
分数74.3
更新时间2026年9月14日
置信度4
HLE w/o tools
站内排名#15
分数39.8
更新时间2026年9月14日
置信度4
GPQA-D
站内排名#9
分数92.8
更新时间2026年9月14日
置信度4
HealthBench HardV3 计分证据
站内排名#1
分数40.1
更新时间2026年9月14日
置信度4
MedXpertQA (Text)V3 计分证据
站内排名#2
分数59.6
更新时间2026年9月14日
置信度4
Artificial Analysis Intelligence Index
站内排名#29
分数39.0
更新时间2026年9月14日
置信度4
AA-GPQA Diamond
站内排名#21
分数92.0
更新时间2026年9月14日
置信度4
AA-HLE
站内排名#15
分数43.7
更新时间2026年9月14日
置信度4
AA-Omniscience Index
站内排名#28
分数5.8
更新时间2026年9月14日
置信度4
AA-Omniscience Accuracy
站内排名#15
分数50.8
更新时间2026年9月14日
置信度4
AA-Omniscience Hallucination Rate
站内排名#13
分数91.7
更新时间2026年9月14日
置信度4
HealthBench Professional
站内排名#7
分数48.1
更新时间2026年9月14日
置信度4

数学

V3.0

3 个指标 · 暂定评分

分数56.880% 区间40.7–72.91/4 实测维度Math score64.5#24 / 63FrontierMath v2 (Tiers 1-3)47.6#7 / 47
维度与证据
基础数学仅先验
竞赛数学仅先验
高阶证明56.8
1 个基准族 · 2 个指标
frontiermath · frontier_math_v2_tier4 · z 0.90 · q 1.00
frontiermath · frontier_math_v2_tiers13 · z 0.61 · q 1.00
应用与工具辅助数学仅先验
Math score
站内排名#24
分数64.5
更新时间2026年9月14日
置信度4
FrontierMath v2 (Tiers 1-3)V3 计分证据
站内排名#7
分数47.6
更新时间2026年9月14日
置信度4
FrontierMath v2 (Tier 4)V3 计分证据
站内排名#9
分数27.1
更新时间2026年9月14日
置信度4

多语言

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
跨语言理解仅先验
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验

多模态

V3.0

12 个指标 · 正式评分

分数52.5#480% 区间45.9–59.24/4 实测维度Multimodal Grounded score69.3#28 / 56MMMU-Pro81.2#7 / 31
维度与证据
感知与 OCR46.7
1 个基准族 · 1 个指标
simplevqa · simple_vqa · z -0.43 · q 1.00
文档与空间理解50.1
1 个基准族 · 1 个指标
charxiv · charxiv · z 0.17 · q 1.00
视觉推理56.9
3 个基准族 · 3 个指标
erqa · erqa · z -0.01 · q 1.00
medxpert · med_xpert_qa_mm · z 0.33 · q 0.75
mmmu_pro · mmmu_pro · z 0.69 · q 1.00
视频与落地行动56.5
1 个基准族 · 1 个指标
screenspot · screen_spot_pro · z 0.53 · q 1.00
Multimodal Grounded score
站内排名#28
分数69.3
更新时间2026年9月14日
置信度4
MMMU-ProV3 计分证据
站内排名#7
分数81.2
更新时间2026年9月14日
置信度4
OfficeQA Pro
站内排名#8
分数53.2
更新时间2026年9月14日
置信度4
MMMU-Pro w/ Python
站内排名#4
分数82.1
更新时间2026年9月14日
置信度4
CharXivV3 计分证据
站内排名#12
分数82.8
更新时间2026年9月14日
置信度4
ERQAV3 计分证据
站内排名#5
分数65.4
更新时间2026年9月14日
置信度4
SimpleVQAV3 计分证据
站内排名#5
分数61.1
更新时间2026年9月14日
置信度4
ScreenSpot ProV3 计分证据
站内排名#3
分数85.4
更新时间2026年9月14日
置信度4
ZeroBench
站内排名#1
分数41.0
更新时间2026年9月14日
置信度4
MedXpertQA (MM)V3 计分证据
站内排名#3
分数77.1
更新时间2026年9月14日
置信度4
AA-MMMU-Pro
站内排名#23
分数78.4
更新时间2026年9月14日
置信度4
Design Arena Website
站内排名#42
分数1232.0
更新时间2026年9月14日
置信度4

指令遵循

V3.0

2 个指标 · 暂定评分

分数5480% 区间38.0–70.01/4 实测维度AA-IFBench73.9#21 / 84Instruction Following score90.6#16 / 52
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化54
1 个基准族 · 1 个指标
ifbench · aa_if_bench · z 0.24 · q 1.00
多轮与长指令仅先验
AA-IFBenchV3 计分证据
站内排名#21
分数73.9
更新时间2026年9月14日
置信度4
Instruction Following score
站内排名#16
分数90.6
更新时间2026年9月14日
置信度4

OpenRouter 端点

7 个端点

来自 OpenRouter 的第三方端点数据,和 LMSpeed 自测数据分开展示。部分 30 分钟实时性能字段需要配置 OpenRouter API key 后同步才会出现。

Provider endpoint输入输出1 天在线率30m 延迟30m 吞吐上下文 / 输出
OpenAI
openai/fast
$5/M$30/M100%undefined tokens / undefined tokens
Azure
azure
$2.50/M$15/M100.0%undefined tokens / undefined tokens
OpenAI
openai
$2.50/M$15/M98.7%undefined tokens / undefined tokens
OpenAI
openai/flex
$1.25/M$7.50/M97.7%undefined tokens / undefined tokens
Azure
azure/eu
$2.75/M$16.50/Mundefined tokens / undefined tokens
Azure
azure/us
$2.75/M$16.50/Mundefined tokens / undefined tokens
Amazon Bedrock
amazon-bedrock/us-east-1
$2.75/M$16.50/Mundefined tokens / undefined tokens

价格对比

对比 GPT-5.4 在 564 家服务商的 API 价格。价格从 $0.0054/M 到 $7425.00/M,其中 熊猫 API 提供最低价 $0.0054/M。 18 家服务商提供免费 API 额度或免费套餐。

服务商健康度模型变体分组输入 ($/M)输出 ($/M)速度 (t/s)首字延迟检测
L1
100%
gpt-5.4
default
$2.50/M
Cache read$0.250/M
$15.00/M
86.2 t/s
6.12 s
L1
100%
gpt-5.4-openai-compact
default
$2.50/M
Cache read$0.250/M
$15.00/M
L1
100%
gpt-5.4
default
$2.68/M
Cache read$0.268/M
$16.06/M
71.2 t/s
1.63 s
L1
0%
gpt-5.4
default
$2.50/M
Cache read$0.250/M
$15.00/M
68.0 t/s
2.15 s
L1
100%
gpt-5.4
default
$0.073/request
-
59.9 t/s
2.48 s
L1
100%
gpt-5.4-openai-compact
default
$0.730/request
-
L1
0%
gpt-5.4
OpenAI
-86%$0.342/M
Cache read$0.034/M
-86%$2.05/M
53.1 t/s
5.11 s
L1
98%
gpt-5.4
default
-86%$0.342/M
Cache read$0.034/M
-86%$2.05/M
51.3 t/s
2.92 s
L1
98%
GPT-5.4
default
$10.27/M
-32%$10.27/M
L1
98%
gpt-5.4-openai-compact
default
$10.27/M
$61.64/M
L1
100%
gpt-5.4
default
-97%$0.084/M
Cache read$0.0084/M
-97%$0.503/M
51.0 t/s
2.53 s
L1
0%
gpt-5.4
default
$12.50/M
Cache read$1.25/M
$75.00/M
50.9 t/s
6.04 s
L1
0%
gpt-5.4-openai-compact
default
$12.50/M
Cache read$1.25/MCache write$1.25/MCache write 1h$2.00/M
$75.00/M
L1
99%
gpt-5.4
codex-mix
-18%$2.05/M
-18%$12.33/M
50.8 t/s
1.44 s
L1
99%
gpt-5.4-openai-compact
codex-mix
-97%$0.068/M
Cache read$0.0068/MCache write$0.085/MCache write 1h$0.137/M
-97%$0.411/M
L1
100%
gpt-5.4
default
$75.00/M
$450.00/M
50.1 t/s
1.42 s
L1
100%
gpt-5.4
公司
$75.00/M
$600.00/M
49.7 t/s
5.48 s
L1
99%
gpt-5.4
default
$35.71/M
Cache read$3.57/M
$214.29/M
46.3 t/s
3.29 s
L1
100%
gpt-5.4
default
-89%$0.274/M
Cache read$0.027/M
-89%$1.64/M
44.2 t/s
1.12 s
L1
99%
gpt-5.4
default
$2.50/M
Cache read$1.41/MCache write$2.34/MCache write 1h$3.75/M
$15.00/M
43.1 t/s
2.39 s
当前显示 20 个模型 ID,共 212 个。

替代方案与相似模型

常见问题

GPT-5.4 包含哪些基准测试数据?
LMSpeed 会在数据可用时展示 GPT-5.4 的基准测试、API 价格、输出速度、首字延迟和 582 家服务商数据。
GPT-5.4 API 价格是多少?
GPT-5.4 在 582 家服务商有价格记录,价格从 $0.0054/M$7425.00/M。最低价由 熊猫 API 提供。
GPT-5.4 API 价格表包含什么?
GPT-5.4 API 价格表会对比 582 家服务商的输入价格、输出价格、免费额度、速度、首字延迟和近期健康数据。
哪家服务商的 GPT-5.4 API 价格最低?
熊猫 API 当前提供 GPT-5.4 的最低收录价格:$0.0054/M,共对比 582 家服务商。
可以同时对比 GPT-5.4 API 价格和速度吗?
可以。LMSpeed 会在同一页展示 GPT-5.4 API 价格、输出速度、首字延迟和服务商健康数据,方便一起比较成本和性能。
GPT-5.4 的 API 免费吗?
是的,GPT-5.4 免费 API 可通过 LMSpeed 上的 18 家服务商使用,包括180txt API, DeadlySignal API, 兔子API, 兔子API, 兔子API。这些服务商提供免费 API 额度或免费套餐,无需按 token 计费。
哪里可以使用 GPT-5.4 免费 API?
LMSpeed 当前收录了 18 家 GPT-5.4 免费 API 服务商,包括180txt API, DeadlySignal API, 兔子API, 兔子API, 兔子API。免费额度和限制可能变化,使用前请查看每一行服务商数据。

别名

gpt-5.411/gpt-5.415/gpt-5.464/gpt-5.464/gpt-5.4-2026-03-05

排名基于社区提交的测试数据与定期健康探测,仅供参考,非官方数据。标准基准数据可能包含 BenchLM 等公开来源。

通过 API 获取 LMSpeed 数据

免费

免费的大模型价格、基准测试和服务商数据公开 API

  • 实时价格与可用性
  • 速度与延迟基准测试
  • 300+ 模型,600+ 服务商
  • 每天 1,000 次请求
查看 API 文档