分类分数 V3 排行榜
LMSpeed 最佳多模态 AI 模型
在一张榜单中对比感知、OCR、文档空间理解、视觉推理、视频与落地行动等多模态 Benchmark。
方法论 3.0查看方法论
当前结论
当前可见的正式排名中,Qwen3.8 Max 的名次最高。它的全局名次是第 1 位,分类分为 65.9,80% 不确定性范围为 ±6.3。共有 10 个可见模型获得正式名次。这只代表本次评分运行。
当前可用榜单数据
- 收录模型
- 45
- 正式排名模型
- 10
- Benchmark 列
- 10
- 已有证据的维度
- 4/4
如何阅读 Benchmark 进度条
每个进度条只用于比较同一 Benchmark 列中的模型,长度相对于当前榜单展示的模型计算;它不是分类分数,也不能跨 Benchmark 列比较。
| 排名 | 模型 | LMSpeed 分类分 | 感知与 OCR | 文档与空间理解 | 视觉推理 | 视频与落地行动 | 评级 | 证据覆盖 | 更新时间 | ||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| V*11 个模型 | SimpleVQA8 个模型 | CharXiv26 个模型 | MMMU-Pro30 个模型 | MathVision12 个模型 | ERQA7 个模型 | MedXpertQA (MM)6 个模型 | BenchLM Multimodal Grounded score5 个模型 | ScreenSpot Pro10 个模型 | VideoMMMU10 个模型 | ||||||
| 正式排名模型10 | |||||||||||||||
| 1 | Qwen3.8 MaxQwen | 65.9±6.3 | — | 75.0 | 93.5 | 82.3 | 95.2 | 77.8 | 80.4 | — | 84.5 | 88.7 | 正式评级 | 4/4 个维度 · 8 个 Benchmark family | 2026年8月9日 |
| 2 | Qwen3.7 PlusQwen | 55.8±6.3 | — | 81.7 | 85.9 | 79.0 | 90.3 | 69.8 | 71.0 | — | 79.0 | 85.4 | 正式评级 | 4/4 个维度 · 8 个 Benchmark family | 2026年8月9日 |
| 3 | Gemini 3.1 ProGoogle | 55.2±6.7 | — | 72.4 | 80.2 | 83.9 | — | 69.4 | 81.3 | — | 84.4 | — | 正式评级 | 4/4 个维度 · 6 个 Benchmark family | 2026年8月9日 |
| 4 | GPT-5.4OpenAI | 53±6.7 | — | 61.1 | 82.8 | 81.2 | — | 65.4 | 77.1 | — | 85.4 | — | 正式评级 | 4/4 个维度 · 6 个 Benchmark family | 2026年8月9日 |
| 5 | Qwen3.6 PlusQwen | 50.9±6.5 | 96.9 | — | 81.5 | 78.8 | 88.0 | — | — | — | 68.2 | 84.0 | 正式评级 | 4/4 个维度 · 6 个 Benchmark family | 2026年8月9日 |
| 6 | Qwen3.5 | 50.4±6.5 | 95.8 | — | 80.8 | 79.0 | 88.6 | — | — | — | 65.6 | 84.7 | 正式评级 | 4/4 个维度 · 6 个 Benchmark family | 2026年8月9日 |
| 7 | Gemini 3 ProGoogle | 50.1±6.5 | 88.0 | — | 81.4 | 81.0 | 86.6 | — | — | — | 72.7 | 87.6 | 正式评级 | 4/4 个维度 · 6 个 Benchmark family | 2026年8月9日 |
| 8 | Qwen3.6 27BQwen | 46.1±6.5 | 94.7 | 56.1 | 78.4 | 75.8 | — | 62.5 | — | — | — | 84.4 | 正式评级 | 4/4 个维度 · 6 个 Benchmark family | 2026年8月9日 |
| 9 | Qwen3.6 35B A3BQwen | 43.7±7.0 | — | 58.9 | 78.0 | 75.3 | — | — | — | — | — | 83.7 | 正式评级 | 4/4 个维度 · 4 个 Benchmark family | 2026年8月9日 |
| 10 | Claude Opus 4.5Anthropic | 31.3±6.5 | 67.0 | — | 68.5 | 70.6 | 74.3 | — | — | — | 45.7 | 84.4 | 正式评级 | 4/4 个维度 · 6 个 Benchmark family | 2026年8月9日 |
| 估算模型(不排名)16 | |||||||||||||||
| — | Kimi K3MoonshotAI | 67.9±11.3 | — | — | 91.3 | 81.6 | 94.3 | — | — | — | — | — | 估算 | 2/4 个维度 · 3 个 Benchmark family | 2026年8月9日 |
| — | Claude Opus 4.8Anthropic | 61.6±12.0 | — | — | 89.9 | — | — | — | — | — | 87.9 | — | 估算 | 2/4 个维度 · 2 个 Benchmark family | 2026年8月9日 |
| — | Gemini 3.5 FlashGoogle | 57.3±11.9 | — | — | 84.2 | 83.6 | — | — | — | — | — | — | 估算 | 2/4 个维度 · 2 个 Benchmark family | 2026年8月9日 |
| — | Kimi K2.6MoonshotAI | 53.6±9.0 | 96.9 | — | 80.4 | 79.4 | 87.4 | — | — | — | — | — | 估算 | 3/4 个维度 · 4 个 Benchmark family | 2026年8月9日 |
| — | Kimi K2.5MoonshotAI | 52.6±12.0 | — | — | — | 78.5 | — | — | — | — | — | 86.6 | 估算 | 2/4 个维度 · 2 个 Benchmark family | 2026年8月9日 |
| — | Qwen3.5-27BQwen | 49.1±12.1 | 93.7 | — | — | — | 86.0 | — | — | — | — | — | 估算 | 2/4 个维度 · 2 个 Benchmark family | 2026年8月9日 |
| — | MiMo-V2.5Xiaomi | 49±11.9 | — | — | 81.0 | 77.9 | — | — | — | — | — | — | 估算 | 2/4 个维度 · 2 个 Benchmark family | 2026年8月9日 |
| — | Claude Opus 4.6Anthropic | 48.8±11.2 | — | — | — | 77.3 | — | 51.6 | 64.8 | — | 83.1 | — | 估算 | 2/4 个维度 · 4 个 Benchmark family | 2026年8月9日 |
| — | Qwen3.5-122B-A10BQwen | 47.3±9.4 | 93.2 | — | 77.2 | — | 86.2 | — | — | — | — | — | 估算 | 3/4 个维度 · 3 个 Benchmark family | 2026年8月9日 |
| — | MiniMax M3MiniMax | 46.9±12.0 | — | — | — | 78.1 | — | — | — | — | — | 84.6 | 估算 | 2/4 个维度 · 2 个 Benchmark family | 2026年8月9日 |
| — | InklingThinking Machines | 45.7±11.9 | — | — | 82.0 | 73.5 | — | — | — | — | — | — | 估算 | 2/4 个维度 · 2 个 Benchmark family | 2026年8月9日 |
| — | Inkling SmallThinking Machines | 45.7±11.9 | — | — | 81.3 | 74.0 | — | — | — | — | — | — | 估算 | 2/4 个维度 · 2 个 Benchmark family | 2026年8月9日 |
| — | Qwen3.5-35B-A3BQwen | 45.5±12.1 | 92.7 | — | — | — | 83.9 | — | — | — | — | — | 估算 | 2/4 个维度 · 2 个 Benchmark family | 2026年8月9日 |
| — | GPT-5.2OpenAI | 42.3±9.0 | 75.9 | — | 82.1 | 79.5 | 83.0 | — | — | — | — | — | 估算 | 3/4 个维度 · 4 个 Benchmark family | 2026年8月9日 |
| — | Grok 4.20SpaceXAI | 38.4±8.9 | — | 57.4 | 60.9 | 75.2 | — | 54.1 | 65.8 | — | — | — | 估算 | 3/4 个维度 · 5 个 Benchmark family | 2026年8月9日 |
| — | Command ACohere | 27.4±11.9 | — | — | 52.7 | 63.0 | — | — | — | — | — | — | 估算 | 2/4 个维度 · 2 个 Benchmark family | 2026年8月9日 |
| 暂定模型(不排名)19 | |||||||||||||||
| — | GPT-5.4 ProOpenAI | 73.2±16.1 | — | — | — | 94.0 | — | — | — | — | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | Claude Opus 4.7 MaxAnthropic | 66.2±16.2 | — | — | 91.0 | — | — | — | — | — | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | Muse Spark 1.1Meta | 60.5±16.2 | — | — | 88.4 | — | — | — | — | — | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | Claude Sonnet 5Anthropic | 60.3±16.2 | — | — | 88.3 | — | — | — | — | — | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | GPT-5.6 SolOpenAI | 59.9±16.1 | — | — | — | 83.0 | — | — | — | — | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | Step 3.7 FlashStepFun | 59±14.5 | 95.3 | 79.2 | — | — | — | — | — | — | — | — | 暂定 | 1/4 个维度 · 2 个 Benchmark family | 2026年8月9日 |
| — | Claude Opus 5Anthropic | 58.5±17.0 | — | — | — | — | — | — | — | 88.5 | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | GPT-5.5OpenAI | 55.9±16.1 | — | — | — | 81.2 | — | — | — | — | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | GPT-5.6 TerraOpenAI | 54.8±16.1 | — | — | — | 80.7 | — | — | — | — | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | Gemini 3.6 FlashGoogle | 51.3±17.0 | — | — | — | — | — | — | — | 73.7 | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | GPT-5.6 LunaOpenAI | 50.2±16.1 | — | — | — | 78.4 | — | — | — | — | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | Grok 4.3SpaceXAI | 49.6±16.1 | — | — | — | 78.1 | — | — | — | — | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | Grok 4.5SpaceXAI | 48.5±17.0 | — | — | — | — | — | — | — | 68.0 | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | GPT-5.4 MiniOpenAI | 46.8±16.1 | — | — | — | 76.6 | — | — | — | — | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | Claude Fable 5Anthropic | 46.2±17.0 | — | — | — | — | — | — | — | 63.4 | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | Gemini 3.5 Flash-LiteGoogle | 46±17.0 | — | — | — | — | — | — | — | 62.9 | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | Claude Sonnet 4.6Anthropic | 44.4±16.2 | — | — | 77.4 | — | — | — | — | — | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | Gemini 3.1 Flash LiteGoogle | 39.8±16.2 | — | — | 73.2 | — | — | — | — | — | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
| — | GPT-5.4 NanoOpenAI | 29.7±16.1 | — | — | — | 66.1 | — | — | — | — | — | — | 暂定 | 1/4 个维度 · 1 个 Benchmark family | 2026年8月9日 |
这个榜单衡量什么
哪个 AI 模型更适合图片和文档任务
这类榜单关注图片感知、OCR、文档空间理解、视觉推理、视频和行动能力。不同模型支持的输入类型可能不同。
四个能力维度
四个维度来自分类蓝图。当前可用数据可能只覆盖其中一部分。没有证据的维度不会被写成已验证能力。
感知与 OCR
当前有 2 个 Benchmark 列提供这个维度的证据。
- V*
- SimpleVQA
文档与空间理解
当前有 1 个 Benchmark 列提供这个维度的证据。
- CharXiv
视觉推理
当前有 5 个 Benchmark 列提供这个维度的证据。
- MMMU-Pro
- MathVision
- ERQA
- MedXpertQA (MM)
- BenchLM Multimodal Grounded score
视频与落地行动
当前有 2 个 Benchmark 列提供这个维度的证据。
- ScreenSpot Pro
- VideoMMMU
适合参考的多模态任务
- 文档提取。模型需要识别文字、表格、布局和页面关系。
- 图片问答。模型需要理解图像细节,并结合文字完成推理。
- 视频或视觉 Agent。模型需要理解过程,并把视觉信息用于行动。
如何用这张榜单选择模型
- 第 1 步
先确认评级状态
只有正式评级模型才有名次。估算和暂定模型没有正式名次。
- 第 2 步
再看评分区间和证据
分数接近时,不要只看名次。还要查看不确定性、维度覆盖和 Benchmark 数量。
- 第 3 步
最后用真实任务测试
榜单不能替代你的测试。请同时检查质量、速度、价格、上下文和供应商限制。
先确认模型支持的文件和输入类型。还要检查 OCR 语言、文件限制、速度、成本和隐私。
评级状态说明
正式评级
正式评级表示证据和重叠条件已满足。模型可以进入排名。
估算
估算表示已有部分证据,但还不满足正式排名条件。
暂定
暂定表示证据较少,或维度与 Benchmark family 覆盖还不满足估算条件。结果只适合早期观察。
Benchmark 与证据来源
证据来源名称和 Benchmark 分组来自当前可用评分数据。一个来源可以提供多个 Benchmark。
BenchLM
BenchLM Multimodal Grounded score、CharXiv、ERQA、MathVision、MedXpertQA (MM)、MMMU-Pro、ScreenSpot Pro、SimpleVQA、V*和VideoMMMU
Multimodal 模型排行榜如何生成
LMSpeed 将合格的第三方 Benchmark 先归入四个固定能力维度。Rated 模型满足正式排名所需的证据覆盖与重叠校准要求;Estimated 与 Provisional 模型继续展示,但不授予名次。
阅读分类分数方法论榜单限制
分类分来自当前收录的第三方 Benchmark。不同测试可能使用不同数据、提示和评分规则。榜单不代表永久结论,也不能代表每个真实任务。重要选择仍要用自己的数据和流程测试。
常见问题
当前可见模型中谁的正式名次最高
当前可见模型中,Qwen3.8 Max 的正式名次最高。它的全局名次是第 1 位,分类分为 65.9。共有 10 个可见模型满足正式排名条件。这个结果只适用于页面所示的评分日期和方法版本。
不同分类的分数可以直接比较吗
不可以。每个分类使用不同的能力维度和证据。分类分只适合在同一张榜单内比较。需要比较不同任务时,请分别查看对应分类。
估算和暂定模型值得看吗
可以把它们当成候选模型。它们的证据还不够完整,所以没有正式名次。先看证据覆盖和不确定性,再用真实任务测试。
榜单多久更新一次
新的完整评分运行发布后,榜单会更新。页面顶部会显示当前运行日期和方法版本。LMSpeed 不保证固定的日更或周更时间。
排名第一就是最适合我的模型吗
不一定。你的任务还会受到速度、价格、上下文长度、工具支持、地区和供应商限制影响。榜单用于缩小范围,不能替代真实测试。
多模态分高就支持所有图片和视频格式吗
不代表。Benchmark 分数和产品功能支持是两件事。使用前要确认文件格式、大小限制、视频能力、OCR 语言和供应商接口。
