Mistral Large 3 API 基准测试 价格和服务商数据

选择与 Mistral Large 3 对比的模型

选择一个模型后会直接打开对应的对比页面。

分享到 X
LLM

页面同时展示实测速度和首字延迟。

Mistral Large 3是旗舰大语言模型,专为高复杂度通用任务与多步推理优化。

质量
0.0
LMSpeed 评分
速度
#69of 76
29char/s
3.00 s

分类性能

基于独立 benchmark family 的实测能力估计,不确定性单独展示。

覆盖
6 / 8
方法论
V3.0
分类性能基于独立 benchmark family 的实测能力估计,不确定性单独展示。智能体39.2代码47.9综合推理44.5知识41.6数学43.5多语言-多模态-指令遵循42.2
#1代码47.9暂定评分1/4 实测维度
80% 区间: 33.961.8
code generation47.9
livecodebench · livecodebench / scicode · scicode
repository engineering仅先验
debugging testing仅先验
tooling quality仅先验
#2综合推理44.5正式评分全站排名 #553/4 实测维度
80% 区间: 35.953.2
abstract logic仅先验
scientific causal43.8
critpt · critpt / gpqa · gpqa / hle · hle
multistep constraints52.1
mmlu_pro · mmlu_pro
evidence verification37.6
lcr · lcr
#3数学43.5暂定评分1/4 实测维度
80% 区间: 27.459.6
foundational math43.5
aa_math_index · artificial_analysis_math_index
competition math仅先验
proof frontier仅先验
applied tool math仅先验
#4指令遵循42.2暂定评分1/4 实测维度
80% 区间: 26.258.2
constraint following仅先验
structured output仅先验
novel instruction generalization42.2
ifbench · aa_if_bench
long multiturn instruction仅先验
#5知识41.6暂定评分1/4 实测维度
80% 区间: 25.657.6
broad knowledge41.6
aa_omniscience · aa_omniscience_index
professional knowledge仅先验
factuality仅先验
retrieval open book仅先验
#6智能体39.2估算2/4 实测维度
80% 区间: 27.451.1
planning仅先验
tool use38.9
tau · tau2_bench
environment execution39.6
gdpval_aa · benchlm_agentic_gdpval_aa
recovery reliability仅先验
暂无数据:多语言多模态

技术规格

Technical Details

官方文档

排名

擅长

相对落后

详细分数

更新时间: 2026年8月31日

速度与延迟

2 个指标

输出速度37.8 tok/s#69 / 76首字延迟2.36 s#59 / 76
输出速度
Output speed
站内排名#69
分数37.8 tok/s
更新时间2026年8月31日
置信度4
首字延迟
Time to first token
站内排名#59
分数2.36 s
更新时间2026年8月31日
置信度4

价格

2 个指标

输入价格$0.500/M#82 / 180输出价格$1.50/M#62 / 180
输入价格
Input price
站内排名#82
分数$0.500/M
更新时间2026年8月31日
置信度4
输出价格
Output price
站内排名#62
分数$1.50/M
更新时间2026年8月31日
置信度4

智能体

V3.0

4 个指标 · 估算

分数39.280% 区间27.4–51.12/4 实测维度AA Agentic Index5.5#56 / 65Τ²-bench results24.6#74 / 82
维度与证据
规划拆解仅先验
工具调用38.9
1 个基准族 · 1 个指标
tau · tau2_bench · z -1.60 · q 1.00
环境与长程执行39.6
1 个基准族 · 1 个指标
gdpval_aa · benchlm_agentic_gdpval_aa · z -1.57 · q 1.00
恢复与完成可靠性仅先验
AA Agentic Index
站内排名#56
分数5.5
更新时间2026年8月20日
置信度1
Τ²-bench resultsV3 计分证据
站内排名#74
分数24.6
更新时间2026年8月20日
置信度1
GDPval-AA
站内排名#57
分数7.0
更新时间2026年8月20日
置信度1
GDPval-AAV3 计分证据
站内排名#57
分数639.0
更新时间2026年8月20日
置信度1

代码

V3.0

4 个指标 · 暂定评分

分数47.980% 区间33.9–61.81/4 实测维度LiveCodeBench46.5%#64 / 115SciCode36.2%#118 / 205
维度与证据
代码生成47.9
2 个基准族 · 2 个指标
livecodebench · livecodebench · z -0.05 · q 1.00
scicode · scicode · z -0.16 · q 1.00
仓库工程仅先验
调试与测试仅先验
工具化开发与质量仅先验
LiveCodeBenchV3 计分证据
站内排名#64
分数46.5%
更新时间2026年8月31日
置信度4
SciCodeV3 计分证据
站内排名#118
分数36.2%
更新时间2026年8月31日
置信度4
AA Coding Index
站内排名#65
分数20.1
更新时间2026年8月20日
置信度1
AA-SciCodeV3 计分证据
站内排名#84
分数36.2
更新时间2026年8月20日
置信度1

综合推理

V3.0

4 个指标 · 正式评分

分数44.5#5580% 区间35.9–53.23/4 实测维度MMLU-Pro80.7%#58 / 129GPQA68.0%#141 / 212
维度与证据
抽象逻辑仅先验
科学与因果推理43.8
3 个基准族 · 3 个指标
critpt · critpt · z -0.72 · q 1.00
gpqa · gpqa · z -0.44 · q 1.00
hle · hle · z -0.85 · q 1.00
多步约束52.1
1 个基准族 · 1 个指标
mmlu_pro · mmlu_pro · z 0.08 · q 1.00
证据整合与验证37.6
1 个基准族 · 1 个指标
lcr · lcr · z -2.01 · q 1.00
MMLU-ProV3 计分证据
站内排名#58
分数80.7%
更新时间2026年8月31日
置信度4
GPQAV3 计分证据
站内排名#141
分数68.0%
更新时间2026年8月31日
置信度4
HLEV3 计分证据
站内排名#170
分数4.2%
更新时间2026年8月31日
置信度4
AA-LCRV3 计分证据
站内排名#90
分数34.7
更新时间2026年8月20日
置信度1

知识

V3.0

5 个指标 · 暂定评分

分数41.680% 区间25.6–57.61/4 实测维度Artificial Analysis Intelligence Index15.9#92 / 111AA-GPQA Diamond68.0#89 / 108
维度与证据
广泛知识41.6
1 个基准族 · 1 个指标
aa_omniscience · aa_omniscience_index · z -1.21 · q 1.00
专业知识仅先验
事实性仅先验
检索与开放资料运用仅先验
Artificial Analysis Intelligence IndexV3 计分证据
站内排名#92
分数15.9
更新时间2026年8月20日
置信度1
AA-GPQA Diamond
站内排名#89
分数68.0
更新时间2026年8月20日
置信度1
AA-HLE
站内排名#96
分数4.2
更新时间2026年8月20日
置信度1
AA-Omniscience Accuracy
站内排名#68
分数25.0
更新时间2026年8月20日
置信度1
AA-Omniscience Hallucination Rate
站内排名#28
分数86.0
更新时间2026年8月20日
置信度1

数学

V3.0

0 个指标 · 暂定评分

分数43.580% 区间27.4–59.61/4 实测维度
维度与证据
基础数学43.5
1 个基准族 · 1 个指标
aa_math_index · artificial_analysis_math_index · z -0.47 · q 1.00
竞赛数学仅先验
高阶证明仅先验
应用与工具辅助数学仅先验

多语言

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
跨语言理解仅先验
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验

多模态

V3.0

1 个指标 · 暂无数据

80% 区间30.8–69.20/4 实测维度AA-MMMU-Pro55.7#58 / 65
维度与证据
感知与 OCR仅先验
文档与空间理解仅先验
视觉推理仅先验
视频与落地行动仅先验
AA-MMMU-Pro
站内排名#58
分数55.7
更新时间2026年8月20日
置信度1

指令遵循

V3.0

1 个指标 · 暂定评分

分数42.280% 区间26.2–58.21/4 实测维度AA-IFBench36.2#77 / 84
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化42.2
1 个基准族 · 1 个指标
ifbench · aa_if_bench · z -1.31 · q 1.00
多轮与长指令仅先验
AA-IFBenchV3 计分证据
站内排名#77
分数36.2
更新时间2026年8月20日
置信度1

替代方案与相似模型

别名

mistral-large-3mistral-large-3:675bmistral-large-3:675b-cloudmistral/mistral-large-3

排名基于社区提交的测试数据与定期健康探测,仅供参考,非官方数据。标准基准数据可能包含 BenchLM 等公开来源。

通过 API 获取 LMSpeed 数据

免费

免费的大模型价格、基准测试和服务商数据公开 API

  • 实时价格与可用性
  • 速度与延迟基准测试
  • 300+ 模型,600+ 服务商
  • 每天 1,000 次请求
查看 API 文档