Google
·Released on 2026年2月19日

Gemini 3.1 Pro API 基准测试 价格和服务商数据

选择与 Gemini 3.1 Pro 对比的模型

选择一个模型后会直接打开对应的对比页面。

分享到 X
LLM

Gemini 3.1 Pro 页面汇总基准测试、API 价格和服务商数据,覆盖 668 家服务商,价格从 $0.0050/request 起。Gemini 3.1 Pro 免费 API 额度来自 15 家服务商。页面同时展示实测速度和首字延迟。

Google 的 Gemini 3.1 Pro是Gemini 3.1 系列的语言模型,专为通用对话与文本生成任务优化。

质量
#27of 112
67.0
LMSpeed 评分
速度
149char/s
16.52 s
成本
$0.0050/ 1M · 8:1 in:out
$0.0008 in · $0.0042 out

分类性能

基于独立 benchmark family 的实测能力估计,不确定性单独展示。

覆盖
8 / 8
方法论
V3.0
分类性能基于独立 benchmark family 的实测能力估计,不确定性单独展示。智能体50.2代码57.2综合推理57.4知识57数学54.6多语言69.3多模态55.1指令遵循55.3
#1多语言69.3暂定评分1/4 实测维度
80% 区间: 52.286.3
cross language understanding69.3
global_mmlu · aa_global_mmlu_lite
multilingual generation仅先验
reasoning transfer仅先验
low resource robustness仅先验
#2综合推理57.4正式评分全站排名 #113/4 实测维度
80% 区间: 48.766.1
abstract logic51.7
arc_agi · arc_agi2
scientific causal63.3
critpt · critpt / gpqa · aa_gpqa_diamond / hle · aa_hle / hle · hle_no_tools
multistep constraints仅先验
evidence verification57.2
lcr · lcr
#3代码57.2估算2/4 实测维度
80% 区间: 46.567.9
code generation62.7
livecodebench · live_code_bench_pro / scicode · aa_sci_code
repository engineering51.7
react_native_bench · react_native_evals / vibecode · vibe_code_bench
debugging testing仅先验
tooling quality仅先验
#4知识57暂定评分1/4 实测维度
80% 区间: 42.072.1
broad knowledge仅先验
professional knowledge57
healthbench · health_bench_hard / medxpert · med_xpert_qa_text
factuality仅先验
retrieval open book仅先验
#5指令遵循55.3暂定评分1/4 实测维度
80% 区间: 39.371.3
constraint following仅先验
structured output仅先验
novel instruction generalization55.3
ifbench · aa_if_bench
long multiturn instruction仅先验
#6多模态55.1正式评分全站排名 #24/4 实测维度
80% 区间: 48.561.7
perception ocr53
simplevqa · simple_vqa
document spatial47.8
charxiv · charxiv
visual reasoning64.1
erqa · erqa / medxpert · med_xpert_qa_mm / mmmu_pro · mmmu_pro
video action55.5
screenspot · screen_spot_pro
#7数学54.6暂定评分1/4 实测维度
80% 区间: 38.670.7
foundational math仅先验
competition math仅先验
proof frontier54.6
frontiermath · frontier_math_v2_tier4 / frontiermath · frontier_math_v2_tiers13
applied tool math仅先验
#8智能体50.2正式评分全站排名 #384/4 实测维度
80% 区间: 44.056.3
planning54
deep_planning · gert_labs
tool use56
tau · tau2_bench
environment execution44.9
deep_search_qa · deep_search_qa / gdpval_aa · benchlm_agentic_gdpval_aa
recovery reliability45.9
apex_agents · apex_agents_aa / claw_eval · claw_eval / researchclaw · research_claw_bench

技术规格

Input and output token limits for this model, plus how it ranks on long-context understanding.

INPUT
1.0Mtokens
1.3K pages of text
OUTPUT
65.5Ktokens
8K128K1M4M
1.0M

能力

Technical Details

输入
输出
发布日期
Feb 2026
官方文档
Tokenizer
Gemini
架构
text+image+file+audio+video->text
内容审核
支持参数
include_reasoningmax_tokensreasoningresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p

排名

擅长

表现尚可

相对落后

详细分数

更新时间: 2026年9月12日

综合

1 个指标

Overall score67.0#27 / 112
Overall score
站内排名#27
分数67.0
更新时间2026年9月12日
置信度3

智能体

V3.0

12 个指标 · 正式评分

分数50.2#3880% 区间44.0–56.34/4 实测维度Agentic score72.8#28 / 77Claw-Eval57.8#16 / 27
维度与证据
规划拆解54
1 个基准族 · 1 个指标
deep_planning · gert_labs · z 0.55 · q 1.00
工具调用56
1 个基准族 · 1 个指标
tau · tau2_bench · z 0.70 · q 1.00
环境与长程执行44.9
2 个基准族 · 2 个指标
deep_search_qa · deep_search_qa · z -0.69 · q 1.00
gdpval_aa · benchlm_agentic_gdpval_aa · z -0.65 · q 1.00
恢复与完成可靠性45.9
3 个基准族 · 3 个指标
apex_agents · apex_agents_aa · z 0.44 · q 1.00
claw_eval · claw_eval · z -0.29 · q 1.00
researchclaw · research_claw_bench · z -1.64 · q 1.00
Agentic score
站内排名#28
分数72.8
更新时间2026年9月12日
置信度3
Claw-EvalV3 计分证据
站内排名#16
分数57.8
更新时间2026年9月12日
置信度3
DeepSearchQAV3 计分证据
站内排名#13
分数69.7
更新时间2026年9月12日
置信度3
Τ²-bench resultsV3 计分证据
站内排名#17
分数95.6
更新时间2026年9月12日
置信度3
AA Agentic Index
站内排名#55
分数10.3
更新时间2026年9月12日
置信度3
APEX-Agents-AAV3 计分证据
站内排名#9
分数32.0
更新时间2026年9月12日
置信度3
GDPval-AA
站内排名#54
分数20.2
更新时间2026年9月12日
置信度3
GDPval-AAV3 计分证据
站内排名#55
分数904.0
更新时间2026年9月12日
置信度3
Gert LabsV3 计分证据
站内排名#14
分数56.9
更新时间2026年9月12日
置信度3
ResearchClawBenchV3 计分证据
站内排名#17
分数13.3
更新时间2026年9月12日
置信度3
Terminal-Bench 2.1 (Vals)
站内排名#17
分数70.8
更新时间2026年9月12日
置信度3
AA AutomationBench
站内排名#21
分数37.5
更新时间2026年8月20日
置信度3

代码

V3.0

10 个指标 · 估算

分数57.280% 区间46.5–67.92/4 实测维度Coding score74.3#7 / 87LiveCodeBench Pro82.9#2 / 4
维度与证据
代码生成62.7
2 个基准族 · 2 个指标
livecodebench · live_code_bench_pro · z 0.54 · q 0.50
scicode · aa_sci_code · z 1.52 · q 1.00
仓库工程51.7
2 个基准族 · 2 个指标
react_native_bench · react_native_evals · z 0.10 · q 1.00
vibecode · vibe_code_bench · z 0.27 · q 1.00
调试与测试仅先验
工具化开发与质量仅先验
Coding score
站内排名#7
分数74.3
更新时间2026年9月12日
置信度3
LiveCodeBench ProV3 计分证据
站内排名#2
分数82.9
更新时间2026年9月12日
置信度3
React Native EvalsV3 计分证据
站内排名#6
分数78.9
更新时间2026年9月12日
置信度3
Vibe Code BenchV3 计分证据
站内排名#13
分数32.0
更新时间2026年9月12日
置信度3
AA Coding Index
站内排名#25
分数68.8
更新时间2026年9月12日
置信度3
AA-SciCodeV3 计分证据
站内排名#6
分数58.7
更新时间2026年9月12日
置信度3
LiveCodeBench (Vals)
站内排名#6
分数88.5
更新时间2026年9月12日
置信度3
SWE-bench (Vals)
站内排名#23
分数78.8
更新时间2026年9月12日
置信度3
EEBench
站内排名#5
分数46.3
更新时间2026年8月20日
置信度3
CADGenBench Generation
站内排名#8
分数21.1
更新时间2026年8月20日
置信度3

综合推理

V3.0

5 个指标 · 正式评分

分数57.4#1180% 区间48.7–66.13/4 实测维度Reasoning score50.6#60 / 67ARC-AGI-277.1#8 / 19
维度与证据
抽象逻辑51.7
1 个基准族 · 1 个指标
arc_agi · arc_agi2 · z 0.15 · q 1.00
科学与因果推理63.3
3 个基准族 · 4 个指标
critpt · critpt · z 0.73 · q 1.00
gpqa · aa_gpqa_diamond · z 1.42 · q 1.00
hle · aa_hle · z 1.05 · q 1.00
hle · hle_no_tools · z 0.30 · q 1.00
多步约束仅先验
证据整合与验证57.2
1 个基准族 · 1 个指标
lcr · lcr · z 0.62 · q 1.00
Reasoning score
站内排名#60
分数50.6
更新时间2026年9月12日
置信度3
ARC-AGI-2V3 计分证据
站内排名#8
分数77.1
更新时间2026年9月12日
置信度3
AA-LCRV3 计分证据
站内排名#14
分数82.0
更新时间2026年9月12日
置信度3
CritPtV3 计分证据
站内排名#19
分数17.7
更新时间2026年9月12日
置信度3
ARC-AGI-3
站内排名#7
分数0.4
更新时间2026年9月12日
置信度3

知识

V3.0

13 个指标 · 暂定评分

分数5780% 区间42.0–72.11/4 实测维度Knowledge score79.2#20 / 83GPQA-D94.3#3 / 32
维度与证据
广泛知识仅先验
专业知识57
2 个基准族 · 2 个指标
healthbench · health_bench_hard · z -1.20 · q 1.00
medxpert · med_xpert_qa_text · z 2.02 · q 0.50
事实性仅先验
检索与开放资料运用仅先验
Knowledge score
站内排名#20
分数79.2
更新时间2026年9月12日
置信度3
GPQA-D
站内排名#3
分数94.3
更新时间2026年9月12日
置信度3
HLE w/o tools
站内排名#6
分数45.4
更新时间2026年9月12日
置信度3
HealthBench HardV3 计分证据
站内排名#6
分数20.6
更新时间2026年9月12日
置信度3
MedXpertQA (Text)V3 计分证据
站内排名#1
分数71.5
更新时间2026年9月12日
置信度3
Artificial Analysis Intelligence Index
站内排名#48
分数30.4
更新时间2026年9月12日
置信度3
AA-GPQA Diamond
站内排名#5
分数94.1
更新时间2026年9月12日
置信度3
AA-HLE
站内排名#10
分数47.0
更新时间2026年9月12日
置信度3
AA-Omniscience Index
站内排名#5
分数31.9
更新时间2026年9月12日
置信度3
AA-Omniscience Accuracy
站内排名#9
分数54.9
更新时间2026年9月12日
置信度3
AA-Omniscience Hallucination Rate
站内排名#76
分数50.9
更新时间2026年9月12日
置信度3
GPQA Diamond (Vals)
站内排名#1
分数95.5
更新时间2026年9月12日
置信度3
MMLU-Pro (Vals)
站内排名#4
分数91.0
更新时间2026年9月12日
置信度3

数学

V3.0

3 个指标 · 暂定评分

分数54.680% 区间38.6–70.71/4 实测维度Math score54.3#35 / 63FrontierMath v2 (Tiers 1-3)36.9#15 / 47
维度与证据
基础数学仅先验
竞赛数学仅先验
高阶证明54.6
1 个基准族 · 2 个指标
frontiermath · frontier_math_v2_tier4 · z 0.58 · q 1.00
frontiermath · frontier_math_v2_tiers13 · z 0.36 · q 1.00
应用与工具辅助数学仅先验
Math score
站内排名#35
分数54.3
更新时间2026年9月12日
置信度3
FrontierMath v2 (Tiers 1-3)V3 计分证据
站内排名#15
分数36.9
更新时间2026年9月12日
置信度3
FrontierMath v2 (Tier 4)V3 计分证据
站内排名#14
分数16.7
更新时间2026年9月12日
置信度3

多语言

V3.0

1 个指标 · 暂定评分

分数69.380% 区间52.2–86.31/4 实测维度AA Global-MMLU-Lite93.2#1 / 5
维度与证据
跨语言理解69.3
1 个基准族 · 1 个指标
global_mmlu · aa_global_mmlu_lite · z 2.79 · q 0.63
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验
AA Global-MMLU-LiteV3 计分证据
站内排名#1
分数93.2
更新时间2026年9月12日
置信度3

多模态

V3.0

10 个指标 · 正式评分

分数55.1#280% 区间48.5–61.74/4 实测维度Multimodal Grounded score79.2#14 / 56MMMU-Pro83.9#2 / 31
维度与证据
感知与 OCR53
1 个基准族 · 1 个指标
simplevqa · simple_vqa · z 0.43 · q 1.00
文档与空间理解47.8
1 个基准族 · 1 个指标
charxiv · charxiv · z -0.15 · q 1.00
视觉推理64.1
3 个基准族 · 3 个指标
erqa · erqa · z 0.61 · q 1.00
medxpert · med_xpert_qa_mm · z 0.86 · q 0.75
mmmu_pro · mmmu_pro · z 1.46 · q 1.00
视频与落地行动55.5
1 个基准族 · 1 个指标
screenspot · screen_spot_pro · z 0.39 · q 1.00
Multimodal Grounded score
站内排名#14
分数79.2
更新时间2026年9月12日
置信度3
MMMU-ProV3 计分证据
站内排名#2
分数83.9
更新时间2026年9月12日
置信度3
CharXivV3 计分证据
站内排名#21
分数80.2
更新时间2026年9月12日
置信度3
ERQAV3 计分证据
站内排名#3
分数69.4
更新时间2026年9月12日
置信度3
SimpleVQAV3 计分证据
站内排名#4
分数72.4
更新时间2026年9月12日
置信度3
ScreenSpot ProV3 计分证据
站内排名#5
分数84.4
更新时间2026年9月12日
置信度3
ZeroBench
站内排名#2
分数29.0
更新时间2026年9月12日
置信度3
MedXpertQA (MM)V3 计分证据
站内排名#1
分数81.3
更新时间2026年9月12日
置信度3
AA-MMMU-Pro
站内排名#8
分数82.4
更新时间2026年9月12日
置信度3
Design Arena Website
站内排名#32
分数1265.0
更新时间2026年9月12日
置信度3

指令遵循

V3.0

1 个指标 · 暂定评分

分数55.380% 区间39.3–71.31/4 实测维度AA-IFBench77.1#7 / 84
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化55.3
1 个基准族 · 1 个指标
ifbench · aa_if_bench · z 0.41 · q 1.00
多轮与长指令仅先验
AA-IFBenchV3 计分证据
站内排名#7
分数77.1
更新时间2026年9月12日
置信度3

价格对比

对比 Gemini 3.1 Pro 在 653 家服务商的 API 价格。价格从 $0.0050/request 到 $1600.00/M,其中 小老鼠的奶酪工坊-酒馆聊天api 提供最低价 $0.0050/request。 15 家服务商提供免费 API 额度或免费套餐。

服务商健康度模型变体分组输入 ($/M)输出 ($/M)速度 (t/s)首字延迟检测
L1
100%
gemini-3.1-pro-preview
default
$2.00/M
$12.00/M
105.4 t/s
12.72 s
L1
100%
gemini-3.1-pro
Gemini
$0.600/M
Cache read$0.060/M
$3.60/M
97.9 t/s
12.32 s
L1
100%
gemini-3.1-pro-preview
default
$0.411/request
-
95.5 t/s
13.02 s
L1
100%
gemini-3.1-pro-low
default
$0.411/request
-
L1
100%
gemini-3.1-pro-high
default
$0.411/request
-
L1
99%
gemini-3.1-pro
default
$20.00/M
Cache read$2.00/MCache write$10.00/MCache write 1h$16.00/M
$100.00/M
88.8 t/s
11.90 s
L1
100%
gemini-3.1-pro-preview
default
$2.80/M
$16.80/M
70.1 t/s
23.27 s
L1
100%
gemini-3.1-pro
default
$2.80/M
$16.80/M
L1
100%
gemini-3.1-pro-preview-customtools
default
$2.80/M
$16.80/M
L1
29%
gemini-3.1-pro-preview
Gemini特价
$0.036/request
-
68.9 t/s
19.70 s
L1
100%
gemini-3.1-pro-preview
gemini-cli
$0.137/M
Cache read$0.014/M
$0.822/M
L1
100%
gemini-3.1-pro-preview-low
gemini_cli
$0.800/M
$4.80/M
L1
100%
gemini-3.1-pro-preview
gemini_cli
$0.800/M
$4.80/M
L1
100%
gemini-3.1-pro-preview-high
gemini_cli
$0.800/M
$4.80/M
L1
100%
gemini-3.1-pro-preview
gemini-slb
$0.857/M
$5.14/M
L1
100%
gemini-3.1-pro-preview
default
$0.014/request
-
L1
100%
gemini-3.1-pro-preview-low-nothinking
default
$0.274/M
Cache read$0.027/MImage$0.274/M
$1.64/M
L1
100%
gemini-3.1-pro
default
$0.274/M
$1.64/M
L1
100%
gemini-3.1-pro-preview-maxthinking
default
$0.274/M
Cache read$0.027/MImage$0.274/M
$1.64/M
L1
100%
gemini-3.1-pro-nothinking
default
$0.274/M
$0.822/M
当前显示 20 个模型 ID,共 270 个。

替代方案与相似模型

常见问题

Gemini 3.1 Pro 包含哪些基准测试数据?
LMSpeed 会在数据可用时展示 Gemini 3.1 Pro 的基准测试、API 价格、输出速度、首字延迟和 668 家服务商数据。
Gemini 3.1 Pro API 价格是多少?
Gemini 3.1 Pro 在 668 家服务商有价格记录,价格从 $0.0050/request$1600.00/M。最低价由 小老鼠的奶酪工坊-酒馆聊天api 提供。
Gemini 3.1 Pro API 价格表包含什么?
Gemini 3.1 Pro API 价格表会对比 668 家服务商的输入价格、输出价格、免费额度、速度、首字延迟和近期健康数据。
哪家服务商的 Gemini 3.1 Pro API 价格最低?
小老鼠的奶酪工坊-酒馆聊天api 当前提供 Gemini 3.1 Pro 的最低收录价格:$0.0050/request,共对比 668 家服务商。
可以同时对比 Gemini 3.1 Pro API 价格和速度吗?
可以。LMSpeed 会在同一页展示 Gemini 3.1 Pro API 价格、输出速度、首字延迟和服务商健康数据,方便一起比较成本和性能。
Gemini 3.1 Pro 的 API 免费吗?
是的,Gemini 3.1 Pro 免费 API 可通过 LMSpeed 上的 15 家服务商使用,包括DeadlySignal API, 兔子API, 兔子API, 兔子API, 兔子API。这些服务商提供免费 API 额度或免费套餐,无需按 token 计费。
哪里可以使用 Gemini 3.1 Pro 免费 API?
LMSpeed 当前收录了 15 家 Gemini 3.1 Pro 免费 API 服务商,包括DeadlySignal API, 兔子API, 兔子API, 兔子API, 兔子API。免费额度和限制可能变化,使用前请查看每一行服务商数据。

别名

Gemini-3-1-ProGemini-3.1-ProNotion/gemini-3.1-pro-preview[C][0.35/次]流式抗截断/gemini-3.1-pro-preview[L]gemini-3.1-pro-preview

排名基于社区提交的测试数据与定期健康探测,仅供参考,非官方数据。标准基准数据可能包含 BenchLM 等公开来源。

通过 API 获取 LMSpeed 数据

免费

免费的大模型价格、基准测试和服务商数据公开 API

  • 实时价格与可用性
  • 速度与延迟基准测试
  • 300+ 模型,600+ 服务商
  • 每天 1,000 次请求
查看 API 文档