Mistral Large 3 API 基准测试 价格和服务商数据
选择与 Mistral Large 3 对比的模型
选择一个模型后会直接打开对应的对比页面。
LLM
页面同时展示实测速度和首字延迟。
Mistral Large 3是旗舰大语言模型,专为高复杂度通用任务与多步推理优化。
质量
0.0
LMSpeed 评分
速度
#69of 76
29char/s
3.00 s
分类性能
基于独立 benchmark family 的实测能力估计,不确定性单独展示。
- 覆盖
- 6 / 8
- 方法论
- V3.0
#1代码47.9暂定评分1/4 实测维度
80% 区间: 33.9–61.8
code generation47.9
livecodebench · livecodebench / scicode · scicode
repository engineering仅先验
debugging testing仅先验
tooling quality仅先验
#2综合推理44.5正式评分全站排名 #553/4 实测维度
80% 区间: 35.9–53.2
abstract logic仅先验
scientific causal43.8
critpt · critpt / gpqa · gpqa / hle · hle
multistep constraints52.1
mmlu_pro · mmlu_pro
evidence verification37.6
lcr · lcr
#3数学43.5暂定评分1/4 实测维度
80% 区间: 27.4–59.6
foundational math43.5
aa_math_index · artificial_analysis_math_index
competition math仅先验
proof frontier仅先验
applied tool math仅先验
#4指令遵循42.2暂定评分1/4 实测维度
80% 区间: 26.2–58.2
constraint following仅先验
structured output仅先验
novel instruction generalization42.2
ifbench · aa_if_bench
long multiturn instruction仅先验
#5知识41.6暂定评分1/4 实测维度
80% 区间: 25.6–57.6
broad knowledge41.6
aa_omniscience · aa_omniscience_index
professional knowledge仅先验
factuality仅先验
retrieval open book仅先验
#6智能体39.2估算2/4 实测维度
80% 区间: 27.4–51.1
planning仅先验
tool use38.9
tau · tau2_bench
environment execution39.6
gdpval_aa · benchlm_agentic_gdpval_aa
recovery reliability仅先验
暂无数据:多语言多模态
技术规格
排名
擅长
相对落后
详细分数
更新时间: 2026年8月31日速度与延迟
2 个指标
输出速度37.8 tok/s#69 / 76首字延迟2.36 s#59 / 76
速度与延迟
2 个指标
基准
站内排名
分数
来源
更新时间
置信度
价格
2 个指标
输入价格$0.500/M#82 / 180输出价格$1.50/M#62 / 180
价格
2 个指标
基准
站内排名
分数
来源
更新时间
置信度
智能体
V3.04 个指标 · 估算
分数39.280% 区间27.4–51.12/4 实测维度AA Agentic Index5.5#56 / 65Τ²-bench results24.6#74 / 82
智能体
V3.04 个指标 · 估算
维度与证据
规划拆解仅先验
工具调用38.9
1 个基准族 · 1 个指标
tau · tau2_bench · z -1.60 · q 1.00
环境与长程执行39.6
1 个基准族 · 1 个指标
gdpval_aa · benchlm_agentic_gdpval_aa · z -1.57 · q 1.00
恢复与完成可靠性仅先验
基准
站内排名
分数
来源
更新时间
置信度
代码
V3.04 个指标 · 暂定评分
分数47.980% 区间33.9–61.81/4 实测维度LiveCodeBench46.5%#64 / 115SciCode36.2%#118 / 205
代码
V3.04 个指标 · 暂定评分
维度与证据
代码生成47.9
2 个基准族 · 2 个指标
livecodebench · livecodebench · z -0.05 · q 1.00
scicode · scicode · z -0.16 · q 1.00
仓库工程仅先验
调试与测试仅先验
工具化开发与质量仅先验
基准
站内排名
分数
来源
更新时间
置信度
综合推理
V3.04 个指标 · 正式评分
分数44.5#5580% 区间35.9–53.23/4 实测维度MMLU-Pro80.7%#58 / 129GPQA68.0%#141 / 212
综合推理
V3.04 个指标 · 正式评分
维度与证据
抽象逻辑仅先验
科学与因果推理43.8
3 个基准族 · 3 个指标
critpt · critpt · z -0.72 · q 1.00
gpqa · gpqa · z -0.44 · q 1.00
hle · hle · z -0.85 · q 1.00
多步约束52.1
1 个基准族 · 1 个指标
mmlu_pro · mmlu_pro · z 0.08 · q 1.00
证据整合与验证37.6
1 个基准族 · 1 个指标
lcr · lcr · z -2.01 · q 1.00
基准
站内排名
分数
来源
更新时间
置信度
知识
V3.05 个指标 · 暂定评分
分数41.680% 区间25.6–57.61/4 实测维度Artificial Analysis Intelligence Index15.9#92 / 111AA-GPQA Diamond68.0#89 / 108
知识
V3.05 个指标 · 暂定评分
维度与证据
广泛知识41.6
1 个基准族 · 1 个指标
aa_omniscience · aa_omniscience_index · z -1.21 · q 1.00
专业知识仅先验
事实性仅先验
检索与开放资料运用仅先验
基准
站内排名
分数
来源
更新时间
置信度
数学
V3.00 个指标 · 暂定评分
分数43.580% 区间27.4–59.61/4 实测维度
数学
V3.00 个指标 · 暂定评分
维度与证据
基础数学43.5
1 个基准族 · 1 个指标
aa_math_index · artificial_analysis_math_index · z -0.47 · q 1.00
竞赛数学仅先验
高阶证明仅先验
应用与工具辅助数学仅先验
多语言
V3.00 个指标 · 暂无数据
暂无数据80% 区间30.8–69.20/4 实测维度
多语言
V3.00 个指标 · 暂无数据
维度与证据
跨语言理解仅先验
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验
多模态
V3.01 个指标 · 暂无数据
80% 区间30.8–69.20/4 实测维度AA-MMMU-Pro55.7#58 / 65
多模态
V3.01 个指标 · 暂无数据
维度与证据
感知与 OCR仅先验
文档与空间理解仅先验
视觉推理仅先验
视频与落地行动仅先验
基准
站内排名
分数
来源
更新时间
置信度
指令遵循
V3.01 个指标 · 暂定评分
分数42.280% 区间26.2–58.21/4 实测维度AA-IFBench36.2#77 / 84
指令遵循
V3.01 个指标 · 暂定评分
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化42.2
1 个基准族 · 1 个指标
ifbench · aa_if_bench · z -1.31 · q 1.00
多轮与长指令仅先验
基准
站内排名
分数
来源
更新时间
置信度
替代方案与相似模型
GLM-5.1
glm-5-1
Zhipu 的 GLM-5.1是语言模型,专为通用对话与文本生成任务优化。
13 个共享提供商
Kimi K2.5
kimi-k2-5
Moonshot 的 Kimi K2.5是语言模型,专为通用对话与文本生成任务优化。
13 个共享提供商
Gemini 3 Flash
gemini-3-flash
Google 的 Gemini 3 Flash是Gemini 3 系列的语言模型,专为通用对话与文本生成任务优化。
13 个共享提供商
MiniMax M2.7
minimax-m2-7
MiniMax M2.7是语言模型,专为通用对话与文本生成任务优化。
13 个共享提供商
GPT-OSS
gpt-oss
GPT-OSS是语言模型,专为通用对话与文本生成任务优化。
13 个共享提供商
DeepSeek V4 Pro
deepseek-v4-pro
DeepSeek V4 Pro是DeepSeek V4 系列的语言模型,专为通用对话与文本生成任务优化。
12 个共享提供商
