赞助推荐Fusecode面向 Claude Code、Codex 与模型工作流的企业级编程 API 服务。
LogoLM Speed
  • 免费 API
  • 模型
  • 提供商
  • 排行榜
LogoLM Speed
  1. 首页
  2. 排行榜
  3. Best Model For Multimodal
LogoLMSpeed

专业的 LLM API 速度测试工具

GitHubGitHubTwitterX (Twitter)Email
产品
  • 功能
  • 价格
  • 常见问题
排行榜
  • 总览
  • 速度排行
  • 延迟排行
  • 健康度排行
  • 模型价格
  • 模型速度
  • 推理能力
  • 代码能力
模型
  • 全部模型
  • GPT
  • Claude
  • Gemini
  • DeepSeek
  • Llama
  • Qwen
免费模型
  • 全部免费模型
  • 免费 GPT
  • 免费 Claude
  • 免费 Gemini
  • 免费 DeepSeek
  • 免费 Llama
  • 免费 Qwen
工具
  • 速度测试
  • 服务商审计
公司
  • 关于我们
资源
  • 服务商目录
  • 文档
  • 公共 API
  • Botab
  • VidBee
法律
  • Cookie政策
  • 隐私政策
  • 服务条款
© 2026 LM Speed All Rights Reserved.Made by Nexmoe with ❤️
AgentCodingReasoningKnowledgeMathMultilingualMultimodal指令遵循

分类分数 V3 排行榜

LMSpeed 最佳多模态 AI 模型

在一张榜单中对比感知、OCR、文档空间理解、视觉推理、视频与落地行动等多模态 Benchmark。

更新于 2026年8月9日·方法论 3.0·查看方法论

当前结论

当前可见的正式排名中,Qwen3.8 Max 的名次最高。它的全局名次是第 1 位,分类分为 65.9,80% 不确定性范围为 ±6.3。共有 10 个可见模型获得正式名次。这只代表本次评分运行。

查看 Qwen3.8 Max 的详情排名会随新数据和方法更新。页面顶部显示本次运行日期。

当前可用榜单数据

收录模型
45
正式排名模型
10
Benchmark 列
10
已有证据的维度
4/4

如何阅读 Benchmark 进度条

每个进度条只用于比较同一 Benchmark 列中的模型,长度相对于当前榜单展示的模型计算;它不是分类分数,也不能跨 Benchmark 列比较。

排名模型LMSpeed 分类分感知与 OCR文档与空间理解视觉推理视频与落地行动评级证据覆盖更新时间
V*11 个模型SimpleVQA8 个模型CharXiv26 个模型MMMU-Pro30 个模型MathVision12 个模型ERQA7 个模型MedXpertQA (MM)6 个模型BenchLM Multimodal Grounded score5 个模型ScreenSpot Pro10 个模型VideoMMMU10 个模型
正式排名模型10
1QwenQwen3.8 MaxQwen
65.9±6.3
—75.093.582.395.277.880.4—84.588.7正式评级4/4 个维度 · 8 个 Benchmark family2026年8月9日
2QwenQwen3.7 PlusQwen
55.8±6.3
—81.785.979.090.369.871.0—79.085.4正式评级4/4 个维度 · 8 个 Benchmark family2026年8月9日
3GeminiGemini 3.1 ProGoogle
55.2±6.7
—72.480.283.9—69.481.3—84.4—正式评级4/4 个维度 · 6 个 Benchmark family2026年8月9日
4OpenAIGPT-5.4OpenAI
53±6.7
—61.182.881.2—65.477.1—85.4—正式评级4/4 个维度 · 6 个 Benchmark family2026年8月9日
5QwenQwen3.6 PlusQwen
50.9±6.5
96.9—81.578.888.0———68.284.0正式评级4/4 个维度 · 6 个 Benchmark family2026年8月9日
6QwenQwen3.5
50.4±6.5
95.8—80.879.088.6———65.684.7正式评级4/4 个维度 · 6 个 Benchmark family2026年8月9日
7GeminiGemini 3 ProGoogle
50.1±6.5
88.0—81.481.086.6———72.787.6正式评级4/4 个维度 · 6 个 Benchmark family2026年8月9日
8QwenQwen3.6 27BQwen
46.1±6.5
94.756.178.475.8—62.5———84.4正式评级4/4 个维度 · 6 个 Benchmark family2026年8月9日
9QwenQwen3.6 35B A3BQwen
43.7±7.0
—58.978.075.3—————83.7正式评级4/4 个维度 · 4 个 Benchmark family2026年8月9日
10ClaudeClaude Opus 4.5Anthropic
31.3±6.5
67.0—68.570.674.3———45.784.4正式评级4/4 个维度 · 6 个 Benchmark family2026年8月9日
估算模型(不排名)16
—MoonshotAIKimi K3MoonshotAI
67.9±11.3
——91.381.694.3—————估算2/4 个维度 · 3 个 Benchmark family2026年8月9日
—ClaudeClaude Opus 4.8Anthropic
61.6±12.0
——89.9—————87.9—估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—GeminiGemini 3.5 FlashGoogle
57.3±11.9
——84.283.6——————估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—MoonshotAIKimi K2.6MoonshotAI
53.6±9.0
96.9—80.479.487.4—————估算3/4 个维度 · 4 个 Benchmark family2026年8月9日
—MoonshotAIKimi K2.5MoonshotAI
52.6±12.0
———78.5—————86.6估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—QwenQwen3.5-27BQwen
49.1±12.1
93.7———86.0—————估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—MiMo-V2.5Xiaomi
49±11.9
——81.077.9——————估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—ClaudeClaude Opus 4.6Anthropic
48.8±11.2
———77.3—51.664.8—83.1—估算2/4 个维度 · 4 个 Benchmark family2026年8月9日
—QwenQwen3.5-122B-A10BQwen
47.3±9.4
93.2—77.2—86.2—————估算3/4 个维度 · 3 个 Benchmark family2026年8月9日
—MinimaxMiniMax M3MiniMax
46.9±12.0
———78.1—————84.6估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—InklingThinking Machines
45.7±11.9
——82.073.5——————估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—Inkling SmallThinking Machines
45.7±11.9
——81.374.0——————估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—QwenQwen3.5-35B-A3BQwen
45.5±12.1
92.7———83.9—————估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
—OpenAIGPT-5.2OpenAI
42.3±9.0
75.9—82.179.583.0—————估算3/4 个维度 · 4 个 Benchmark family2026年8月9日
—GrokGrok 4.20SpaceXAI
38.4±8.9
—57.460.975.2—54.165.8———估算3/4 个维度 · 5 个 Benchmark family2026年8月9日
—CohereCommand ACohere
27.4±11.9
——52.763.0——————估算2/4 个维度 · 2 个 Benchmark family2026年8月9日
暂定模型(不排名)19
—OpenAIGPT-5.4 ProOpenAI
73.2±16.1
———94.0——————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—ClaudeClaude Opus 4.7 MaxAnthropic
66.2±16.2
——91.0———————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—SparkMuse Spark 1.1Meta
60.5±16.2
——88.4———————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—ClaudeClaude Sonnet 5Anthropic
60.3±16.2
——88.3———————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—OpenAIGPT-5.6 SolOpenAI
59.9±16.1
———83.0——————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—StepfunStep 3.7 FlashStepFun
59±14.5
95.379.2————————暂定1/4 个维度 · 2 个 Benchmark family2026年8月9日
—ClaudeClaude Opus 5Anthropic
58.5±17.0
———————88.5——暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—OpenAIGPT-5.5OpenAI
55.9±16.1
———81.2——————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—OpenAIGPT-5.6 TerraOpenAI
54.8±16.1
———80.7——————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—GeminiGemini 3.6 FlashGoogle
51.3±17.0
———————73.7——暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—OpenAIGPT-5.6 LunaOpenAI
50.2±16.1
———78.4——————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—GrokGrok 4.3SpaceXAI
49.6±16.1
———78.1——————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—GrokGrok 4.5SpaceXAI
48.5±17.0
———————68.0——暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—OpenAIGPT-5.4 MiniOpenAI
46.8±16.1
———76.6——————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—ClaudeClaude Fable 5Anthropic
46.2±17.0
———————63.4——暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—GeminiGemini 3.5 Flash-LiteGoogle
46±17.0
———————62.9——暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—ClaudeClaude Sonnet 4.6Anthropic
44.4±16.2
——77.4———————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—GeminiGemini 3.1 Flash LiteGoogle
39.8±16.2
——73.2———————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日
—OpenAIGPT-5.4 NanoOpenAI
29.7±16.1
———66.1——————暂定1/4 个维度 · 1 个 Benchmark family2026年8月9日

这个榜单衡量什么

哪个 AI 模型更适合图片和文档任务

这类榜单关注图片感知、OCR、文档空间理解、视觉推理、视频和行动能力。不同模型支持的输入类型可能不同。

当前可用数据覆盖 4/4 个维度,并展示 10 个 Benchmark 列。

四个能力维度

四个维度来自分类蓝图。当前可用数据可能只覆盖其中一部分。没有证据的维度不会被写成已验证能力。

感知与 OCR

当前有 2 个 Benchmark 列提供这个维度的证据。

  • V*
  • SimpleVQA

文档与空间理解

当前有 1 个 Benchmark 列提供这个维度的证据。

  • CharXiv

视觉推理

当前有 5 个 Benchmark 列提供这个维度的证据。

  • MMMU-Pro
  • MathVision
  • ERQA
  • MedXpertQA (MM)
  • BenchLM Multimodal Grounded score

视频与落地行动

当前有 2 个 Benchmark 列提供这个维度的证据。

  • ScreenSpot Pro
  • VideoMMMU

适合参考的多模态任务

  • 文档提取。模型需要识别文字、表格、布局和页面关系。
  • 图片问答。模型需要理解图像细节,并结合文字完成推理。
  • 视频或视觉 Agent。模型需要理解过程,并把视觉信息用于行动。

如何用这张榜单选择模型

  1. 第 1 步

    先确认评级状态

    只有正式评级模型才有名次。估算和暂定模型没有正式名次。

  2. 第 2 步

    再看评分区间和证据

    分数接近时,不要只看名次。还要查看不确定性、维度覆盖和 Benchmark 数量。

  3. 第 3 步

    最后用真实任务测试

    榜单不能替代你的测试。请同时检查质量、速度、价格、上下文和供应商限制。

先确认模型支持的文件和输入类型。还要检查 OCR 语言、文件限制、速度、成本和隐私。

评级状态说明

正式评级

正式评级表示证据和重叠条件已满足。模型可以进入排名。

估算

估算表示已有部分证据,但还不满足正式排名条件。

暂定

暂定表示证据较少,或维度与 Benchmark family 覆盖还不满足估算条件。结果只适合早期观察。

Benchmark 与证据来源

证据来源名称和 Benchmark 分组来自当前可用评分数据。一个来源可以提供多个 Benchmark。

  • BenchLM

    BenchLM Multimodal Grounded score、CharXiv、ERQA、MathVision、MedXpertQA (MM)、MMMU-Pro、ScreenSpot Pro、SimpleVQA、V*和VideoMMMU

Multimodal 模型排行榜如何生成

LMSpeed 将合格的第三方 Benchmark 先归入四个固定能力维度。Rated 模型满足正式排名所需的证据覆盖与重叠校准要求;Estimated 与 Provisional 模型继续展示,但不授予名次。

阅读分类分数方法论

榜单限制

分类分来自当前收录的第三方 Benchmark。不同测试可能使用不同数据、提示和评分规则。榜单不代表永久结论,也不能代表每个真实任务。重要选择仍要用自己的数据和流程测试。

常见问题

当前可见模型中谁的正式名次最高

当前可见模型中,Qwen3.8 Max 的正式名次最高。它的全局名次是第 1 位,分类分为 65.9。共有 10 个可见模型满足正式排名条件。这个结果只适用于页面所示的评分日期和方法版本。

不同分类的分数可以直接比较吗

不可以。每个分类使用不同的能力维度和证据。分类分只适合在同一张榜单内比较。需要比较不同任务时,请分别查看对应分类。

估算和暂定模型值得看吗

可以把它们当成候选模型。它们的证据还不够完整,所以没有正式名次。先看证据覆盖和不确定性,再用真实任务测试。

榜单多久更新一次

新的完整评分运行发布后,榜单会更新。页面顶部会显示当前运行日期和方法版本。LMSpeed 不保证固定的日更或周更时间。

排名第一就是最适合我的模型吗

不一定。你的任务还会受到速度、价格、上下文长度、工具支持、地区和供应商限制影响。榜单用于缩小范围,不能替代真实测试。

多模态分高就支持所有图片和视频格式吗

不代表。Benchmark 分数和产品功能支持是两件事。使用前要确认文件格式、大小限制、视频能力、OCR 语言和供应商接口。