分类分数 V3 排行榜
LMSpeed 最适合 AI Agent 的模型
从规划拆解、工具调用、环境执行和失败恢复等全部有效 Benchmark 对比最适合 AI Agent 的模型;正式排名遵循 LMSpeed 分类分数 V3 的证据与不确定性规则。
方法论 3.0查看方法论
当前结论
当前可见的正式排名中,Kimi K3 的名次最高。它的全局名次是第 1 位,分类分为 68.3,80% 不确定性范围为 ±7.3。共有 55 个可见模型获得正式名次。这只代表本次评分运行。
当前可用榜单数据
- 收录模型
- 100
- 正式排名模型
- 55
- Benchmark 列
- 26
- 已有证据的维度
- 4/4
如何阅读 Benchmark 进度条
每个进度条只用于比较同一 Benchmark 列中的模型,长度相对于当前榜单展示的模型计算;它不是分类分数,也不能跨 Benchmark 列比较。
| 排名 | 模型 | LMSpeed 分类分 | 规划拆解 | 工具调用 | 环境与长程执行 | 恢复与完成可靠性 | 评级 | 证据覆盖 | 更新时间 | ||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Gert Labsundefined 个模型 | DeepPlanningundefined 个模型 | τ²-bench resultsundefined 个模型 | MCP Atlasundefined 个模型 | Toolathlonundefined 个模型 | AA Tau3 Bankingundefined 个模型 | τ³-bench resultsundefined 个模型 | MCP-Tasksundefined 个模型 | GDPval-AAundefined 个模型 | Terminal-Bench 2.0undefined 个模型 | BrowseCompundefined 个模型 | OSWorld-Verifiedundefined 个模型 | OSWorld 2.0undefined 个模型 | DeepSearchQAundefined 个模型 | AA EnterpriseOps-Gymundefined 个模型 | VITA-Benchundefined 个模型 | WideResearchundefined 个模型 | AA ITBenchundefined 个模型 | Claw-Evalundefined 个模型 | APEX-Agents-AAundefined 个模型 | JobBenchundefined 个模型 | ResearchClawBenchundefined 个模型 | AA Briefcaseundefined 个模型 | CyberGymundefined 个模型 | AA Harvey LABundefined 个模型 | ExploitGymundefined 个模型 | ||||||
| 正式排名模型55 | |||||||||||||||||||||||||||||||
| 1 | Kimi K3MoonshotAI | 68.3±7.3 | — | — | — | 84.2 | — | 46.0 | — | — | 1677.0 | 88.3 | 91.2 | — | — | 95.0 | 45.3 | — | — | 47.7 | — | 41.3 | 52.9 | — | 1542.0 | — | 94.6 | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 2 | GPT-5.6 SolOpenAI | 67.1±7.3 | — | — | 85.1 | — | 58.0 | 44.3 | — | — | 1735.0 | 91.9 | 92.2 | — | 62.6 | — | 42.9 | — | — | 56.2 | — | — | — | — | 1503.0 | 84.5 | 87.2 | 33.7 | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 3 | Claude Opus 5Anthropic | 66.1±8.2 | — | — | — | 85.8 | — | 42.1 | — | — | 1862.0 | — | 90.8 | — | 70.6 | 95.0 | 47.5 | — | — | — | — | — | — | — | 1720.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 4 | Claude Fable 5Anthropic | 64.6±8.2 | — | — | 98.5 | — | — | 38.1 | — | — | 1747.0 | 84.3 | — | 85.0 | — | — | 51.1 | — | — | — | — | — | — | — | 1574.0 | — | 93.6 | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 5 | Muse Spark 1.1Meta | 63.1±7.4 | — | — | — | 88.1 | 75.6 | — | — | — | 1375.0 | 80.0 | — | 80.8 | 14.2 | 84.9 | 47.2 | — | — | — | — | — | 54.7 | — | — | 59.0 | 93.1 | 0.8 | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 6 | GPT-5.6 TerraOpenAI | 62.8±7.4 | — | — | 86.3 | — | 53.1 | 40.2 | — | — | 1583.0 | 87.4 | 87.5 | — | 50.2 | — | — | — | — | 51.0 | — | 38.9 | — | — | — | 81.8 | 85.2 | 23.2 | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 7 | Grok 4.6SpaceXAI | 62.8±8.6 | — | — | — | — | — | 50.7 | — | — | 1753.0 | — | — | — | — | 81.6 | — | — | — | — | — | — | — | — | 1577.0 | 79.7 | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 8 | Claude Opus 4.8Anthropic | 62.7±5.5 | 73.0 | — | 94.4 | 82.2 | 59.9 | — | — | — | 1593.0 | 74.6 | 84.3 | 83.4 | 20.6 | 93.1 | — | — | — | — | — | — | — | 21.1 | — | — | 91.1 | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 9 | GPT-5.5OpenAI | 61.9±5.1 | 72.9 | — | 98.0 | 75.3 | 55.6 | — | — | — | 1490.0 | 82.0 | 84.4 | 78.7 | 13.0 | — | 46.6 | — | — | 45.8 | — | 37.7 | 42.7 | 17.0 | — | 81.8 | — | 13.4 | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 10 | Gemini 3.5 FlashGoogle | 60.6±5.6 | 61.9 | — | 95.3 | 83.6 | 56.5 | — | — | — | 1345.0 | 76.2 | — | 78.4 | — | — | 50.1 | — | — | — | — | 47.1 | — | 18.0 | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 11 | GLM-5.2Z.ai | 59.8±7.2 | — | — | 99.1 | 76.8 | 48.2 | 34.6 | — | — | 1505.0 | 81.0 | — | — | — | — | 42.7 | — | — | 42.7 | — | 33.7 | — | 20.7 | 1252.0 | — | 91.0 | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 12 | GPT-5.6 LunaOpenAI | 58.3±7.4 | — | — | — | — | 53.4 | 31.1 | — | — | 1582.0 | 84.7 | 83.3 | — | 45.6 | — | — | — | — | 40.3 | — | 35.8 | — | — | — | 77.9 | 87.9 | 12.4 | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 13 | DeepSeek V4 Pro 0813DeepSeek | 57.5±7.7 | — | — | 96.2 | 73.6 | 51.8 | 39.6 | — | — | 1306.0 | 67.9 | 83.4 | — | — | — | — | — | — | — | — | 24.3 | — | — | — | 83.3 | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 14 | Claude Opus 4.7 MaxAnthropic | 57.3±7.7 | — | — | 88.6 | 77.3 | — | — | — | — | 1490.0 | 69.4 | 79.3 | 78.0 | 18.2 | — | — | — | — | 46.7 | — | — | 45.9 | — | — | 73.1 | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 15 | GPT-5.4OpenAI | 57.2±5.1 | 64.9 | — | 98.9 | 70.6 | 54.6 | — | — | — | 1394.0 | 75.1 | 82.7 | 75.0 | — | 73.6 | — | — | — | — | 60.3 | 33.3 | 38.9 | 15.3 | — | 79.0 | — | 6.0 | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 16 | Gemini 3.7 FlashGoogle | 57.2±8.6 | — | — | — | — | — | 32.8 | — | — | 1532.0 | — | — | — | 47.9 | — | — | — | — | — | — | — | — | — | 1131.0 | — | 90.7 | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 17 | Qwen3.7 MaxQwen | 56.9±5.8 | 64.3 | — | 94.7 | 76.4 | — | — | — | — | 1271.0 | 69.7 | — | — | — | — | — | 47.9 | — | — | 65.2 | — | — | 18.7 | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 18 | Qwen3.6 27BQwen | 55.5±6.6 | 54.8 | — | 94.2 | — | — | — | — | — | 1140.0 | 59.3 | — | — | — | — | — | — | — | — | 72.4 | — | — | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 19 | Kimi K2.6MoonshotAI | 55±5.3 | 56.8 | — | 95.9 | 55.9 | 50.0 | — | — | — | 1192.0 | 66.7 | 83.2 | 73.1 | 4.6 | 92.5 | — | — | 80.8 | — | 62.3 | 28.5 | — | 18.0 | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 20 | Claude Opus 4.6Anthropic | 54.9±5.7 | 61.9 | — | 84.8 | — | — | — | — | — | — | 65.4 | 83.7 | 72.7 | — | 73.7 | — | — | — | — | 70.4 | 33.0 | 36.7 | 19.9 | — | 66.6 | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 21 | Claude Opus 4.7Anthropic | 54.6±6.9 | 65.6 | — | 74.0 | — | — | — | — | — | — | — | — | — | 13.9 | — | — | — | — | — | — | — | — | 20.7 | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 22 | MiniMax M3MiniMax | 54±7.3 | — | — | 88.9 | 74.2 | — | 15.3 | — | — | 1387.0 | 66.0 | 83.5 | 70.1 | 4.6 | — | 32.1 | — | — | — | 74.5 | — | — | 19.8 | 1107.0 | — | 88.4 | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 23 | Step 3.7 FlashStepFun | 53.7±5.7 | 51.6 | — | 98.5 | — | 49.5 | — | — | — | 1018.0 | 59.5 | 75.8 | — | — | 92.8 | — | — | — | — | 67.1 | 14.8 | — | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 24 | Qwen3.7 PlusQwen | 53.6±5.7 | — | 62.3 | 93.0 | 73.2 | — | — | — | — | 945.0 | 70.3 | — | 73.3 | 2.8 | — | — | 45.6 | — | — | 62.7 | 22.4 | — | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 25 | Gemini 3.6 FlashGoogle | 53.3±8.6 | — | — | — | — | — | 29.9 | — | — | 1423.0 | — | — | 83.0 | — | — | — | — | — | — | — | — | — | — | 963.0 | — | 85.1 | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 26 | GLM-5.1Z.ai | 53.3±5.7 | 60.1 | — | 97.7 | 71.8 | — | — | 70.6 | — | 1258.0 | 63.5 | 68.0 | — | — | — | — | — | — | — | 62.3 | — | — | 18.2 | — | 68.7 | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 27 | GPT-5.3 CodexOpenAI | 52.7±6.6 | 57.5 | — | 86.0 | — | — | — | — | — | — | 77.3 | — | 64.7 | — | — | — | — | — | — | — | — | 33.7 | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 28 | Claude Sonnet 4.6Anthropic | 52.7±6.1 | 62.9 | — | 79.5 | — | — | — | — | — | — | 59.1 | — | 72.1 | 8.3 | — | — | — | — | — | 67.8 | — | 36.9 | — | — | 65.2 | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 29 | DeepSeek V4 Flash 0731DeepSeek | 52.1±8.4 | — | — | — | 69.0 | 47.8 | — | — | — | 1189.0 | 56.9 | 73.2 | — | — | — | — | — | — | — | — | — | — | — | — | 76.7 | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 30 | MiMo-V2.5-ProXiaomi | 51.4±6.3 | 62.7 | — | 94.2 | — | — | — | 72.9 | — | 1265.0 | 68.4 | — | — | — | — | — | — | — | — | 63.8 | 2.4 | — | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 31 | GPT-5.4 MiniOpenAI | 51±8.1 | — | — | 93.4 | 57.7 | 42.9 | — | — | — | 1172.0 | 60.0 | — | 72.1 | — | — | — | — | — | — | — | 28.2 | — | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 32 | InklingThinking Machines | 50.9±8.3 | — | — | — | 74.1 | — | 29.1 | — | — | 1239.0 | 63.8 | 77.1 | — | — | — | 38.0 | — | — | — | — | — | — | — | 841.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 33 | MiMo-V2.5Xiaomi | 50.6±8.9 | 46.9 | — | — | — | — | — | — | — | — | 65.8 | — | — | — | — | — | — | — | — | 62.3 | — | — | 16.9 | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 34 | Gemini 3.1 ProGoogle | 50.6±6.1 | 56.9 | — | 95.6 | — | — | — | — | — | 965.0 | — | — | — | — | 69.7 | — | — | — | — | 57.8 | 32.0 | — | 13.3 | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 35 | Qwen3.6 PlusQwen | 49.3±5.5 | 50.6 | — | 97.7 | 48.2 | 39.8 | — | 70.7 | 74.1 | 1140.0 | 61.6 | — | — | — | — | — | 44.3 | 74.3 | — | 58.8 | — | — | 18.0 | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 36 | Grok 4.3SpaceXAI | 49.1±6.6 | 43.9 | — | 97.7 | — | — | — | — | — | 1088.0 | — | — | — | — | — | — | — | — | — | — | 17.0 | — | 12.4 | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 37 | Claude Opus 4.5Anthropic | 48.5±5.3 | 64.2 | — | 86.3 | 42.3 | 43.5 | — | 70.2 | 71.8 | — | 59.3 | — | 66.3 | — | — | — | 23.3 | 76.4 | — | 59.6 | — | 32.3 | — | — | 50.6 | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 38 | MiMo-V2-Pro | 48.1±8.9 | 36.7 | — | 95.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 57.8 | — | — | 15.3 | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 39 | GPT-5.2OpenAI | 47.6±6.6 | 46.5 | — | 84.8 | — | — | — | — | — | — | — | 65.8 | 47.3 | — | — | — | — | — | — | — | — | 34.3 | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 40 | Mistral Medium 3.5Mistral | 47.1±6.3 | 39.1 | — | 94.2 | — | — | — | 91.4 | — | 933.0 | — | — | — | — | — | 33.7 | — | — | — | — | — | — | — | 517.0 | — | 69.1 | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 41 | GLM-4.7Z.ai | 46.7±8.6 | 40.0 | — | 95.9 | — | — | — | — | — | 1169.0 | 41.0 | 52.0 | — | — | — | — | 15.5 | — | — | — | — | — | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 42 | Claude Sonnet 4.5Anthropic | 46.6±8.7 | 48.5 | — | — | — | — | — | — | — | — | 50.0 | — | 61.4 | — | — | — | 17.0 | — | — | — | — | 27.7 | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 43 | DeepSeek V4 FlashDeepSeek | 46±6.3 | 54.4 | — | — | 64.0 | 40.7 | — | — | — | — | 49.1 | 53.5 | — | — | — | — | — | — | — | 57.8 | — | — | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 44 | Qwen3.6 35B A3BQwen | 46±5.9 | 42.6 | — | 95.3 | 62.8 | 26.9 | — | 67.2 | — | 1055.0 | 51.5 | — | — | — | — | — | 35.6 | 60.1 | — | 68.7 | — | — | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 45 | Qwen3.5-27BQwen | 45.9±8.7 | 39.4 | — | 93.9 | — | — | — | — | — | — | 41.6 | 61.0 | 56.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 46 | MiniMax M2.7MiniMax | 45±6.0 | 40.4 | — | 84.8 | — | 46.3 | — | — | — | 1160.0 | 57.0 | — | — | — | — | — | — | — | — | 48.7 | 10.6 | — | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 47 | GPT-5.4 NanoOpenAI | 44.8±8.1 | — | — | 92.5 | 56.1 | 35.5 | — | — | — | 1105.0 | 46.3 | — | 39.0 | — | — | — | — | — | — | — | 24.9 | — | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 48 | Qwen3.5 | 44.7±5.2 | 46.8 | — | 95.6 | 46.1 | 36.3 | — | 68.4 | 74.2 | 964.0 | 52.5 | 62.0 | — | — | — | — | 43.7 | 74.0 | — | 56.8 | 15.3 | — | 14.2 | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 49 | Gemini 3.5 Flash-LiteGoogle | 43.6±8.8 | — | — | — | — | — | 17.5 | — | — | 1139.0 | 54.0 | — | 74.0 | — | — | — | — | — | — | — | — | — | — | 635.0 | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 50 | Gemini 3 FlashGoogle | 43±8.9 | 56.6 | — | 43.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 49.2 | — | 11.4 | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 51 | Qwen3.5-35B-A3BQwen | 42.8±8.7 | 29.0 | — | 89.2 | — | — | — | — | — | — | 40.5 | 61.0 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 52 | GLM-5Z.ai | 41.1±5.6 | 51.0 | — | 98.2 | 31.1 | 38.0 | — | 65.6 | 60.8 | — | 56.2 | — | — | — | — | — | — | 69.8 | — | 57.7 | 14.5 | — | — | — | 43.2 | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 53 | Kimi K2.5MoonshotAI | 39.1±5.1 | 45.9 | — | 95.9 | 29.5 | 27.8 | — | 65.7 | 59.1 | 1006.0 | 50.8 | 60.6 | — | — | 77.1 | — | — | 72.7 | — | 52.3 | 11.5 | 8.7 | 14.0 | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 54 | DeepSeek V3.2DeepSeek | 39.1±6.9 | 29.6 | — | 78.9 | — | — | — | — | — | — | — | — | — | — | — | — | 18.5 | — | — | 40.2 | — | — | — | — | — | — | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 55 | gpt-oss-120bOpenAI | 35.9±6.0 | 29.6 | — | 65.8 | — | — | — | — | — | 800.0 | — | — | — | — | — | 25.5 | — | — | 5.6 | — | 3.1 | — | — | 8.0 | — | 13.9 | — | 正式评级 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 估算模型(不排名)36 | |||||||||||||||||||||||||||||||
| — | Qwen3.8 MaxQwen | 66.4±10.9 | — | — | — | — | — | — | — | — | 1739.0 | — | — | 86.1 | 19.4 | — | — | — | 81.9 | — | — | — | 53.4 | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Grok 4.5SpaceXAI | 61.8±11.3 | — | — | — | — | — | — | — | — | 1526.0 | 83.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 92.4 | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3.8 27BQwen | 57.2±11.9 | — | — | — | — | — | — | — | — | — | — | — | 84.3 | — | — | — | — | — | — | — | — | 33.4 | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Muse Spark 1.2Meta | 56.9±9.3 | — | — | — | — | — | 34.8 | — | — | 1631.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | 1358.0 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Inkling SmallThinking Machines | 55.7±10.9 | — | — | — | 79.6 | — | — | — | — | 1268.0 | 64.7 | 77.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Kimi K2.7 CodeMoonshotAI | 53.7±11.2 | — | — | 90.1 | 76.0 | — | — | — | — | 1191.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3.6 Max PreviewQwen | 53.7±11.8 | — | — | 95.9 | — | — | — | — | — | — | 65.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GLM-5 TurboZ.ai | 52.1±11.9 | — | — | 98.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 55.8 | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.2 CodexOpenAI | 51.2±9.3 | 51.8 | — | 92.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 26.0 | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | DeepSeek V4 ProDeepSeek | 51±10.5 | — | — | — | 69.4 | 46.3 | — | — | — | — | 59.1 | 80.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.1 CodexOpenAI | 49.7±9.3 | 49.7 | — | 83.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 26.2 | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Gemini 3 ProGoogle | 49±9.3 | 63.2 | — | 87.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 11.4 | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3.5-122B-A10BQwen | 48±10.6 | — | — | 93.6 | — | — | — | — | — | 988.0 | 49.4 | 63.8 | 58.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Ling-3.0-flashInclusionai | 47.8±10.2 | — | — | — | 65.5 | — | 28.0 | — | — | 1107.0 | — | 72.2 | — | — | — | — | — | 73.6 | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.1OpenAI | 47.7±9.3 | 41.2 | — | 81.9 | — | — | — | — | — | 993.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Muse Glimmer 30BMeta | 47.7±10.2 | — | — | — | 75.5 | — | 23.5 | — | — | 953.0 | — | — | 65.9 | — | 74.6 | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Qwen3 MaxQwen | 47.5±11.8 | 43.7 | — | 74.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GLM-5V TurboZ.ai | 47.3±9.3 | 30.8 | — | 98.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 53.8 | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | MiMo-V2-Flash | 47.1±11.8 | — | — | 83.9 | — | — | — | — | — | 839.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Hy3 previewTencent | 46.3±11.2 | 36.9 | — | — | — | — | — | — | — | 1214.0 | 54.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5OpenAI | 45±9.3 | — | — | 84.8 | — | — | — | — | — | 1083.0 | — | — | — | — | — | — | — | — | — | — | — | 8.5 | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Command ACohere | 44.8±9.3 | — | — | 85.0 | — | — | — | — | — | 717.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | 369.0 | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Claude Sonnet 4Anthropic | 44.4±9.3 | 39.7 | — | 52.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 18.4 | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Ling 2.6 FlashinclusionAI | 44.3±11.8 | — | — | 86.0 | — | — | — | — | — | 550.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Trinity Large ThinkingArcee AI | 43.9±9.3 | 32.5 | — | 90.1 | — | — | — | — | — | 563.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Gemini 2.5 ProGoogle | 43.6±9.3 | 42.0 | — | 54.1 | — | — | — | — | — | 669.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Grok 4.20SpaceXAI | 43.1±11.2 | 38.4 | — | — | — | — | — | — | — | — | 47.1 | — | — | — | 62.8 | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | MiMo-V2-Omni | 42±11.9 | — | — | 91.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 45.2 | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-4.1 MiniOpenAI | 40.3±11.8 | — | — | 52.9 | — | — | — | — | — | 505.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-4.1OpenAI | 40±11.8 | 25.6 | — | 47.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Mistral Large 3 | 39.3±11.8 | — | — | 24.6 | — | — | — | — | — | 639.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | gpt-oss-20bOpenAI | 37.6±9.3 | — | — | 60.2 | — | — | — | — | — | 565.0 | — | — | — | — | — | — | — | — | — | — | 0.7 | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | DeepSeek V3 | 34.6±11.8 | — | — | 22.8 | — | — | — | — | — | 231.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Llama 4 MaverickMeta | 33±11.8 | — | — | 17.8 | — | — | — | — | — | 3.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-4.1 NanoOpenAI | 33±11.8 | — | — | 17.3 | — | — | — | — | — | 61.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Llama 4 ScoutMeta | 32.7±11.8 | — | — | 15.5 | — | — | — | — | — | 109.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 估算 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| 暂定模型(不排名)9 | |||||||||||||||||||||||||||||||
| — | Claude Sonnet 5Anthropic | 64.2±12.2 | — | — | — | — | — | — | — | — | 1603.0 | 80.4 | 84.7 | 81.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.5 ProOpenAI | 61.3±16.1 | — | — | — | — | — | — | — | — | — | — | 90.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.4 ProOpenAI | 60.4±16.1 | — | — | — | — | — | — | — | — | — | — | 89.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Laguna S 2.1Poolside | 53.5±16.0 | — | — | — | — | — | — | — | — | — | 70.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Hy3Tencent | 52.3±16.0 | — | — | — | — | — | — | — | — | 1214.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | Grok Build 0 1SpaceXAI | 50.1±16.1 | 49.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GPT-5.1 Codex MaxOpenAI | 49.9±16.0 | — | — | 83.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | O3OpenAI | 49.3±16.0 | — | — | 80.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
| — | GLM-4.6Z.ai | 48.4±16.0 | — | — | 76.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 暂定 | undefined/4 个维度 · undefined 个 Benchmark family | 2026年8月28日 |
这个榜单衡量什么
哪个 AI 模型更适合 Agent 任务
这类榜单关注模型能否规划任务、调用工具、操作环境,并在失败后继续完成任务。它不只看模型会不会回答问题。
四个能力维度
四个维度来自分类蓝图。当前可用数据可能只覆盖其中一部分。没有证据的维度不会被写成已验证能力。
规划拆解
当前有 2 个 Benchmark 列提供这个维度的证据。
- Gert Labs
- DeepPlanning
工具调用
当前有 6 个 Benchmark 列提供这个维度的证据。
- τ²-bench results
- MCP Atlas
- Toolathlon
- AA Tau3 Banking
- τ³-bench results
- MCP-Tasks
环境与长程执行
当前有 10 个 Benchmark 列提供这个维度的证据。
- GDPval-AA
- Terminal-Bench 2.0
- BrowseComp
- OSWorld-Verified
- OSWorld 2.0
- DeepSearchQA
- AA EnterpriseOps-Gym
- VITA-Bench
- WideResearch
- AA ITBench
恢复与完成可靠性
当前有 8 个 Benchmark 列提供这个维度的证据。
- Claw-Eval
- APEX-Agents-AA
- JobBench
- ResearchClawBench
- AA Briefcase
- CyberGym
- AA Harvey LAB
- ExploitGym
适合参考的 Agent 任务
- 调研助手。它需要搜索资料,整理证据,并根据新信息调整计划。
- 网页和电脑操作。它需要读懂界面,调用工具,并连续完成多个步骤。
- 多步业务自动化。它需要遵守规则,处理失败,并留下可检查的结果。
如何用这张榜单选择模型
- 第 1 步
先确认评级状态
只有正式评级模型才有名次。估算和暂定模型没有正式名次。
- 第 2 步
再看评分区间和证据
分数接近时,不要只看名次。还要查看不确定性、维度覆盖和 Benchmark 数量。
- 第 3 步
最后用真实任务测试
榜单不能替代你的测试。请同时检查质量、速度、价格、上下文和供应商限制。
先看你的工具和运行环境。再看恢复能力、速度、成本和权限控制。榜单第一不一定适合每个 Agent。
评级状态说明
正式评级
正式评级表示证据和重叠条件已满足。模型可以进入排名。
估算
估算表示已有部分证据,但还不满足正式排名条件。
暂定
暂定表示证据较少,或维度与 Benchmark family 覆盖还不满足估算条件。结果只适合早期观察。
Benchmark 与证据来源
证据来源名称和 Benchmark 分组来自当前可用评分数据。一个来源可以提供多个 Benchmark。
BenchLM
AA Briefcase、AA EnterpriseOps-Gym、AA Harvey LAB、AA ITBench、AA Tau3 Banking、APEX-Agents-AA、BrowseComp、Claw-Eval、CyberGym、DeepPlanning、DeepSearchQA、ExploitGym、GDPval-AA、Gert Labs、JobBench、MCP Atlas、MCP-Tasks、OSWorld 2.0、OSWorld-Verified、ResearchClawBench、Terminal-Bench 2.0、Toolathlon、VITA-Bench、WideResearch、τ²-bench results和τ³-bench results
AI Agent 模型排行榜如何生成
LMSpeed 将合格的第三方 Benchmark 先归入四个固定能力维度。Rated 模型满足正式排名所需的证据覆盖与重叠校准要求;Estimated 与 Provisional 模型继续展示,但不授予名次。
阅读分类分数方法论榜单限制
分类分来自当前收录的第三方 Benchmark。不同测试可能使用不同数据、提示和评分规则。榜单不代表永久结论,也不能代表每个真实任务。重要选择仍要用自己的数据和流程测试。
常见问题
当前可见模型中谁的正式名次最高
当前可见模型中,Kimi K3 的正式名次最高。它的全局名次是第 1 位,分类分为 68.3。共有 55 个可见模型满足正式排名条件。这个结果只适用于页面所示的评分日期和方法版本。
不同分类的分数可以直接比较吗
不可以。每个分类使用不同的能力维度和证据。分类分只适合在同一张榜单内比较。需要比较不同任务时,请分别查看对应分类。
估算和暂定模型值得看吗
可以把它们当成候选模型。它们的证据还不够完整,所以没有正式名次。先看证据覆盖和不确定性,再用真实任务测试。
榜单多久更新一次
新的完整评分运行发布后,榜单会更新。页面顶部会显示当前运行日期和方法版本。LMSpeed 不保证固定的日更或周更时间。
排名第一就是最适合我的模型吗
不一定。你的任务还会受到速度、价格、上下文长度、工具支持、地区和供应商限制影响。榜单用于缩小范围,不能替代真实测试。
Agent 排名和推理排名有什么不同
推理榜关注逻辑、因果和证据验证。Agent 榜还关注规划、工具调用、环境执行和失败恢复。推理能力强,不等于能稳定完成真实 Agent 流程。
