赞助推荐Fusecode面向 Claude Code、Codex 与模型工作流的企业级编程 API 服务。
LogoLM Speed
  • 免费 API
  • 模型
  • 提供商
  • 排行榜
  • 文档
LogoLM Speed
  1. 首页
  2. 模型
  3. Kimi K3
LogoLMSpeed

专业的 LLM API 速度测试工具

GitHubGitHubTwitterX (Twitter)Email
产品
  • 功能
  • 价格
  • 常见问题
排行榜
  • 总览
  • 速度排行
  • 延迟排行
  • 健康度排行
  • 模型价格
  • 模型速度
  • 推理能力
  • 代码能力
模型
  • 全部模型
  • GPT
  • Claude
  • Gemini
  • DeepSeek
  • Llama
  • Qwen
免费模型
  • 全部免费模型
  • 免费 GPT
  • 免费 Claude
  • 免费 Gemini
  • 免费 DeepSeek
  • 免费 Llama
  • 免费 Qwen
工具
  • 速度测试
  • 服务商审计
公司
  • 关于我们
资源
  • 服务商目录
  • 文档
  • 公共 API
  • Botab
  • VidBee
法律
  • Cookie政策
  • 隐私政策
  • 服务条款
© 2026 LM Speed All Rights Reserved.Made by Nexmoe with ❤️
MoonshotAI
MoonshotAI
·Released on 2026年7月16日

Kimi K3 API 基准测试 价格和服务商数据

选择与 Kimi K3 对比的模型

选择一个模型后会直接打开对应的对比页面。

X (Twitter)分享到 X
LLM

Kimi K3 is an ultra-large-scale, open-weight multimodal reasoning model from Moonshot AI. It is suited for complex coding, knowledge work, and long-horizon agentic workflows, and is particularly stron...

质量
#8of 84
77.0
LMSpeed 评分

分类性能

基于独立 benchmark family 的实测能力估计,不确定性单独展示。

覆盖
5 / 8
方法论
V3.0
分类性能基于独立 benchmark family 的实测能力估计,不确定性单独展示。智能体69.8代码62综合推理61.8知识61.9数学-多语言-多模态69.7指令遵循-
#1智能体69.8正式评分·全站排名 #1·3/4 实测维度
80% 区间: 62.5–77.2
planning仅先验
tool use67.5
mcp_atlas · mcp_atlas / tau · aa_tau3_banking
environment execution71.4
browsecomp · browse_comp / deep_search_qa · deep_search_qa / enterprise_ops_gym · aa_enterprise_ops_gym / gdpval_aa · benchlm_agentic_gdpval_aa / itbench · aa_itbench / terminalbench · benchlm_agentic_terminal_bench2
recovery reliability70.6
apex_agents · apex_agents_aa / briefcase · aa_briefcase_elo / harvey_lab · aa_harvey_lab / jobbench · job_bench
#2多模态69.7估算·2/4 实测维度
80% 区间: 58.3–81.0
perception ocr仅先验
document spatial69.7
charxiv · charxiv
visual reasoning69.6
mathvision · math_vision / mmmu_pro · mmmu_pro
video action仅先验
#3代码62估算·2/4 实测维度
80% 区间: 50.1–74.0
code generation66.1
scicode · scicode
repository engineering仅先验
debugging testing仅先验
tooling quality58
terminalbench · aa_terminal_bench21
#4知识61.9暂定评分·1/4 实测维度
80% 区间: 47.9–75.9
broad knowledge61.9
aa_omniscience · aa_omniscience_index / benchlm_category_knowledge · benchlm_category_knowledge
professional knowledge仅先验
factuality仅先验
retrieval open book仅先验
#5综合推理61.8估算·2/4 实测维度
80% 区间: 51.1–72.6
abstract logic仅先验
scientific causal65.4
critpt · critpt / gpqa · gpqa / hle · hle / hle · hle_no_tools
multistep constraints仅先验
evidence verification58.3
lcr · lcr
暂无数据:数学多语言指令遵循
分类排行榜智能体代码综合推理知识多模态

技术规格

Input and output token limits for this model, plus how it ranks on long-context understanding.

INPUT
1.0Mtokens
≈ 1.3K pages of text
8K128K1M4M
1.0M

能力

Technical Details

输入
输出
发布日期
Jul 2026
官方文档
OpenRouterOllama
Tokenizer
Other
架构
text+image->text
内容审核
否
支持参数
frequency_penaltyinclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatstopstructured_outputstool_choicetools

排名

擅长

表现尚可

相对落后

详细分数

更新时间: 2026年7月22日

综合

3 个指标

Overall score77.0#8 / 84DeepSWE67.5#3 / 5
基准
站内排名
分数
来源
更新时间
置信度
Overall score
站内排名#8
分数77.0
来源benchlm.ai
更新时间2026年7月22日
置信度1
DeepSWE
站内排名#3
分数67.5
来源benchlm.ai
更新时间2026年7月22日
置信度1
SWE-Marathon
站内排名#1
分数42.0
来源benchlm.ai
更新时间2026年7月22日
置信度1

速度与延迟

2 个指标

输出速度38.4 tok/s#131 / 137首字延迟5.79 s#111 / 137
基准
站内排名
分数
来源
更新时间
置信度
输出速度
Output speed
站内排名#131
分数38.4 tok/s
来源artificialanalysis.ai
更新时间2026年7月22日
置信度4
首字延迟
Time to first token
站内排名#111
分数5.79 s
来源artificialanalysis.ai
更新时间2026年7月22日
置信度4

价格

2 个指标

输入价格$3.00/M#137 / 162输出价格$15.00/M#136 / 162
基准
站内排名
分数
来源
更新时间
置信度
输入价格
Input price
站内排名#137
分数$3.00/M
来源artificialanalysis.ai
更新时间2026年7月22日
置信度4
输出价格
Output price
站内排名#136
分数$15.00/M
来源artificialanalysis.ai
更新时间2026年7月22日
置信度4

智能体

V3.0

21 个指标 · 正式评分

分数69.8#180% 区间62.5–77.23/4 实测维度Agentic score94.7#1 / 53GDPval-AA1679.0#3 / 54
维度与证据
规划拆解仅先验
工具调用67.5
2 个基准族 · 2 个指标
mcp_atlas · mcp_atlas · z 1.07 · q 1.00
tau · aa_tau3_banking · z 1.27 · q 1.00
环境与长程执行71.4
6 个基准族 · 6 个指标
browsecomp · browse_comp · z 1.04 · q 1.00
deep_search_qa · deep_search_qa · z 1.31 · q 1.00
enterprise_ops_gym · aa_enterprise_ops_gym · z 0.68 · q 1.00
gdpval_aa · benchlm_agentic_gdpval_aa · z 1.51 · q 1.00
itbench · aa_itbench · z 0.81 · q 1.00
terminalbench · benchlm_agentic_terminal_bench2 · z 2.01 · q 1.00
恢复与完成可靠性70.6
4 个基准族 · 4 个指标
apex_agents · apex_agents_aa · z 0.91 · q 1.00
briefcase · aa_briefcase_elo · z 1.44 · q 1.00
harvey_lab · aa_harvey_lab · z 1.78 · q 1.00
jobbench · job_bench · z 1.52 · q 1.00
基准
站内排名
分数
来源
更新时间
置信度
Agentic score
站内排名#1
分数94.7
来源benchlm.ai
更新时间2026年7月22日
置信度1
GDPval-AAV3 计分证据
站内排名#3
分数1679.0
来源benchlm.ai
更新时间2026年7月22日
置信度1
AA BriefcaseV3 计分证据
站内排名#2
分数1543.0
来源benchlm.ai
更新时间2026年7月22日
置信度1
BrowseCompV3 计分证据
站内排名#2
分数91.2
来源benchlm.ai
更新时间2026年7月22日
置信度1
DeepSearchQAV3 计分证据
站内排名#1
分数95.0
来源benchlm.ai
更新时间2026年7月22日
置信度1
Toolathlon-Verified
站内排名#1
分数73.2
来源benchlm.ai
更新时间2026年7月22日
置信度1
MCP AtlasV3 计分证据
站内排名#1
分数84.2
来源benchlm.ai
更新时间2026年7月22日
置信度1
AutomationBench
站内排名#1
分数30.8
来源benchlm.ai
更新时间2026年7月22日
置信度1
JobBenchV3 计分证据
站内排名#1
分数52.9
来源benchlm.ai
更新时间2026年7月22日
置信度1
APEX-Agents
站内排名#1
分数37.6
来源benchlm.ai
更新时间2026年7月22日
置信度1
SpreadsheetBench 2
站内排名#1
分数34.8
来源benchlm.ai
更新时间2026年7月22日
置信度1
DECK-Bench
站内排名#1
分数73.5
来源benchlm.ai
更新时间2026年7月22日
置信度1
AA Agentic Index
站内排名#3
分数50.1
来源benchlm.ai
更新时间2026年7月22日
置信度1
GDPval-AA
站内排名#3
分数59.0
来源benchlm.ai
更新时间2026年7月22日
置信度1
AA AutomationBench
站内排名#1
分数52.7
来源benchlm.ai
更新时间2026年7月22日
置信度1
AA Tau3 BankingV3 计分证据
站内排名#1
分数33.4
来源benchlm.ai
更新时间2026年7月22日
置信度1
Terminal-Bench 2.0V3 计分证据
站内排名#2
分数88.3
来源benchlm.ai
更新时间2026年7月22日
置信度1
AA EnterpriseOps-GymV3 计分证据
站内排名#4
分数45.3
来源benchlm.ai
更新时间2026年7月22日
置信度1
AA Harvey LABV3 计分证据
站内排名#1
分数94.6
来源benchlm.ai
更新时间2026年7月22日
置信度1
APEX-Agents-AAV3 计分证据
站内排名#2
分数41.3
来源benchlm.ai
更新时间2026年7月22日
置信度1
AA ITBenchV3 计分证据
站内排名#3
分数47.7
来源benchlm.ai
更新时间2026年7月22日
置信度1

代码

V3.0

10 个指标 · 估算

分数6280% 区间50.1–74.02/4 实测维度SciCode58.7%#3 / 185FrontierSWE81.2#1 / 1
维度与证据
代码生成66.1
1 个基准族 · 1 个指标
scicode · scicode · z 1.96 · q 1.00
仓库工程仅先验
调试与测试仅先验
工具化开发与质量58
1 个基准族 · 1 个指标
terminalbench · aa_terminal_bench21 · z 0.68 · q 1.00
基准
站内排名
分数
来源
更新时间
置信度
SciCodeV3 计分证据
站内排名#3
分数58.7%
来源artificialanalysis.ai
更新时间2026年7月22日
置信度4
FrontierSWE
站内排名#1
分数81.2
来源benchlm.ai
更新时间2026年7月22日
置信度1
Kimi Code Bench v2
站内排名#1
分数72.9
来源benchlm.ai
更新时间2026年7月22日
置信度1
ProgramBench
站内排名#1
分数77.8
来源benchlm.ai
更新时间2026年7月22日
置信度1
PostTrain Bench
站内排名#1
分数36.6
来源benchlm.ai
更新时间2026年7月22日
置信度1
MLS-Bench Lite
站内排名#1
分数48.3
来源benchlm.ai
更新时间2026年7月22日
置信度1
AA Coding Index
站内排名#4
分数76.2
来源benchlm.ai
更新时间2026年7月22日
置信度1
AA-SciCodeV3 计分证据
站内排名#3
分数58.7
来源benchlm.ai
更新时间2026年7月22日
置信度1
AA Terminal-Bench 2.1V3 计分证据
站内排名#3
分数85.0
来源benchlm.ai
更新时间2026年7月22日
置信度1
Coding score
站内排名#6
分数69.0
来源benchlm.ai
更新时间2026年7月22日
置信度1

综合推理

V3.0

4 个指标 · 估算

分数61.880% 区间51.1–72.62/4 实测维度GPQA93.5%#3 / 188HLE44.3%#7 / 187
维度与证据
抽象逻辑仅先验
科学与因果推理65.4
3 个基准族 · 4 个指标
critpt · critpt · z 1.24 · q 1.00
gpqa · gpqa · z 1.45 · q 1.00
hle · hle · z 1.38 · q 1.00
hle · hle_no_tools · z 0.29 · q 1.00
多步约束仅先验
证据整合与验证58.3
1 个基准族 · 1 个指标
lcr · lcr · z 0.68 · q 1.00
基准
站内排名
分数
来源
更新时间
置信度
GPQAV3 计分证据
站内排名#3
分数93.5%
来源artificialanalysis.ai
更新时间2026年7月22日
置信度4
HLEV3 计分证据
站内排名#7
分数44.3%
来源artificialanalysis.ai
更新时间2026年7月22日
置信度4
AA-LCRV3 计分证据
站内排名#4
分数74.7
来源benchlm.ai
更新时间2026年7月22日
置信度1
CritPtV3 计分证据
站内排名#7
分数23.4
来源benchlm.ai
更新时间2026年7月22日
置信度1

知识

V3.0

9 个指标 · 暂定评分

分数61.980% 区间47.9–75.91/4 实测维度Knowledge score89.5#5 / 55GPQA-D93.5#6 / 24
维度与证据
广泛知识61.9
2 个基准族 · 2 个指标
aa_omniscience · aa_omniscience_index · z 0.92 · q 1.00
benchlm_category_knowledge · benchlm_category_knowledge · z 1.03 · q 1.00
专业知识仅先验
事实性仅先验
检索与开放资料运用仅先验
基准
站内排名
分数
来源
更新时间
置信度
Knowledge scoreV3 计分证据
站内排名#5
分数89.5
来源benchlm.ai
更新时间2026年7月22日
置信度1
GPQA-D
站内排名#6
分数93.5
来源benchlm.ai
更新时间2026年7月22日
置信度1
HLE w/o tools
站内排名#4
分数43.5
来源benchlm.ai
更新时间2026年7月22日
置信度1
Artificial Analysis Intelligence IndexV3 计分证据
站内排名#3
分数57.1
来源benchlm.ai
更新时间2026年7月22日
置信度1
AA-GPQA Diamond
站内排名#3
分数93.5
来源benchlm.ai
更新时间2026年7月22日
置信度1
AA-HLE
站内排名#5
分数44.3
来源benchlm.ai
更新时间2026年7月22日
置信度1
AA-Omniscience IndexV3 计分证据
站内排名#9
分数18.4
来源benchlm.ai
更新时间2026年7月22日
置信度1
AA-Omniscience Accuracy
站内排名#11
分数46.0
来源benchlm.ai
更新时间2026年7月22日
置信度1
AA-Omniscience Hallucination Rate
站内排名#67
分数50.9
来源benchlm.ai
更新时间2026年7月22日
置信度1

数学

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
基础数学仅先验
竞赛数学仅先验
高阶证明仅先验
应用与工具辅助数学仅先验

多语言

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
跨语言理解仅先验
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验

多模态

V3.0

16 个指标 · 估算

分数69.780% 区间58.3–81.02/4 实测维度Multimodal Grounded score90.3#2 / 35OfficeQA Pro63.3#2 / 7
维度与证据
感知与 OCR仅先验
文档与空间理解69.7
1 个基准族 · 1 个指标
charxiv · charxiv · z 2.66 · q 1.00
视觉推理69.6
2 个基准族 · 2 个指标
mathvision · math_vision · z 3.00 · q 1.00
mmmu_pro · mmmu_pro · z 0.90 · q 1.00
视频与落地行动仅先验
基准
站内排名
分数
来源
更新时间
置信度
Multimodal Grounded score
站内排名#2
分数90.3
来源benchlm.ai
更新时间2026年7月22日
置信度1
OfficeQA Pro
站内排名#2
分数63.3
来源benchlm.ai
更新时间2026年7月22日
置信度1
MMMU-ProV3 计分证据
站内排名#5
分数81.6
来源benchlm.ai
更新时间2026年7月22日
置信度1
MMMU-Pro w/ Python
站内排名#2
分数83.4
来源benchlm.ai
更新时间2026年7月22日
置信度1
CharXiv w/o tools
站内排名#1
分数84.8
来源benchlm.ai
更新时间2026年7月22日
置信度1
CharXivV3 计分证据
站内排名#1
分数91.3
来源benchlm.ai
更新时间2026年7月22日
置信度1
MathVisionV3 计分证据
站内排名#1
分数94.3
来源benchlm.ai
更新时间2026年7月22日
置信度1
MathVision w/ Python
站内排名#1
分数97.8
来源benchlm.ai
更新时间2026年7月22日
置信度1
BabyVision w/ Python
站内排名#1
分数85.7
来源benchlm.ai
更新时间2026年7月22日
置信度1
ZeroBench
站内排名#3
分数23.0
来源benchlm.ai
更新时间2026年7月22日
置信度1
ZeroBench w/ Python
站内排名#1
分数41.0
来源benchlm.ai
更新时间2026年7月22日
置信度1
WorldVQA ForceAnswer
站内排名#1
分数51.0
来源benchlm.ai
更新时间2026年7月22日
置信度1
OmniDocBench
站内排名#1
分数91.1
来源benchlm.ai
更新时间2026年7月22日
置信度1
PerceptionBench
站内排名#1
分数58.5
来源benchlm.ai
更新时间2026年7月22日
置信度1
AA-MMMU-Pro
站内排名#5
分数80.5
来源benchlm.ai
更新时间2026年7月22日
置信度1
Design Arena Website
站内排名#1
分数1386.0
来源benchlm.ai
更新时间2026年7月22日
置信度1

指令遵循

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化仅先验
多轮与长指令仅先验

数据更新于 2026年7月22日 15:19·排名基于社区提交的测试数据与定期健康探测,仅供参考,非官方数据。·标准基准数据可能包含 BenchLM 等公开来源。

通过 API 获取 LMSpeed 数据

免费

免费的大模型价格、基准测试和服务商数据公开 API

  • 实时价格与可用性
  • 速度与延迟基准测试
  • 300+ 模型,600+ 服务商
  • 每天 1,000 次请求
查看 API 文档