返回模型目录

Model compare

Claude Opus 4.6 vs Gemini 3.1 Pro

Claude Opus 4.6 和 Gemini 3.1 Pro 的结论先放在这里,方便先判断是否值得继续看明细。

Key Takeaways

综合加权结果:Gemini 3.1 Pro。Benchmark 能力分类占 80%,价格、API 性能和可用性占 20%。

结论

Gemini 3.1 Pro

Gemini 3.1 Pro 当前综合加权更高;模型 A / B 得分为 36 对 64。

证据覆盖

142 个数据点

包含 39 个 benchmark、0 个 audit 样本和 10 个 provider 样本。

选择依据

优先看 Gemini 3.1 Pro

下方图表把 49 组高信号样本拆开,便于核对速度、跑分和安全分。

切换对比模型

左右两边都可以换成其他模型,页面会打开新的 LMSpeed 对比 URL。

选择其他模型后会打开新的对比页。

对比总表

这份报告只使用 LMSpeed 已有数据:Claude Opus 4.6 和 Gemini 3.1 Pro 的价格、测速聚合、第三方跑分与共同服务商样本。

Model compare
Claude Opus 4.6
Gemini 3.1 Pro
综合领先对照领先
综合加权得分36.0 分64.0 分
Benchmark 分类领先2 类6 类
运营维度优势最低输入价格、首 token 延迟、免费服务商、服务商覆盖平均速度
上下文窗口1M tokens1.0M tokens
最大输出128K tokens65.5K tokens
模态

输入

文本图像文件

输出

文本

输入

音频文件图像文本video

输出

文本
能力
文本输入图像输入文件输入文本输出工具调用结构化输出JSON 模式推理
文本输入图像输入文件输入音频输入文本输出工具调用结构化输出JSON 模式推理

总体结果按 80% benchmark 能力分类和 20% 价格、API 速度/延迟与可用性加权;近期测试数量不参与胜负,缺失的 benchmark 分类不计分。

模型元信息

Model compare
Claude Opus 4.6
Gemini 3.1 Pro
开发者AnthropicGoogle
发布日期2026年2月2026年2月
参数量暂无数据暂无数据
TokenizerClaudeGemini
知识截止暂无数据暂无数据
OpenRouter IDanthropic/claude-opus-4.6google/gemini-3.1-pro-preview
来源链接暂无数据暂无数据

什么时候选哪个模型

这份报告只使用 LMSpeed 已有数据:Claude Opus 4.6 和 Gemini 3.1 Pro 的价格、测速聚合、第三方跑分与共同服务商样本。

Claude Opus 4.6

Claude Opus 4.6 在 benchmark 分类(Agents、数学)和运营维度(最低输入价格、首 token 延迟、免费服务商、服务商覆盖)更强。

Gemini 3.1 Pro

Gemini 3.1 Pro 在 benchmark 分类(代码、推理、知识、多语言、多模态)和运营维度(平均速度)更强。

跑分对比

来自 LMSpeed 同步的第三方 benchmark profile;只展示两个模型都有数值的指标。

分类能力对比

按 0-100 分对比 benchmark 分类表现;点击分类可以聚焦查看差距。

模型 A 覆盖
8 / 8
模型 B 覆盖
8 / 8
共同覆盖
8 个共同分类

平均分

Claude Opus 4.6

51.8

平均分

Gemini 3.1 Pro

57

Agents

Claude Opus 4.6 领先 4.1

Claude Opus 4.654.3
Gemini 3.1 Pro50.2

代码

Gemini 3.1 Pro 领先 0.6

Claude Opus 4.656.6
Gemini 3.1 Pro57.2

推理

Gemini 3.1 Pro 领先 4.0

Claude Opus 4.653.4
Gemini 3.1 Pro57.4

知识

Gemini 3.1 Pro 领先 3.7

Claude Opus 4.653.3
Gemini 3.1 Pro57

数学

Claude Opus 4.6 领先 1.1

Claude Opus 4.655.7
Gemini 3.1 Pro54.6

多语言

Gemini 3.1 Pro 领先 20.9

Claude Opus 4.648.4
Gemini 3.1 Pro69.3

多模态

Gemini 3.1 Pro 领先 7.3

Claude Opus 4.647.8
Gemini 3.1 Pro55.1

指令遵循

Gemini 3.1 Pro 领先 10.5

Claude Opus 4.644.8
Gemini 3.1 Pro55.3

专业跑分明细

按具体 benchmark 指标对比两个模型,展示来源、排名覆盖、置信度、误差和评测日期等上下文。

综合reported

BenchLM overall score

Claude Opus 4.6

62.0

排名 #42/112 · confidence 4 · 评测日期 2026-02-01

+5.0

Gemini 3.1 Pro

领先

67.0

排名 #27/112 · confidence 3 · 评测日期 2026-02-19

推理reported

AA-LCR

Claude Opus 4.6

67.0

排名 #71/106 · confidence 4 · 评测日期 2026-02-01

+15.0

Gemini 3.1 Pro

领先

82.0

排名 #14/106 · confidence 3 · 评测日期 2026-02-19

推理reported

CritPt

Claude Opus 4.6

2.8

排名 #57/88 · confidence 4 · 评测日期 2026-02-01

+14.9

Gemini 3.1 Pro

领先

17.7

排名 #19/88 · confidence 3 · 评测日期 2026-02-19

推理reported

BenchLM Reasoning score

Claude Opus 4.6

领先

67.1

排名 #42/67 · confidence 4 · 评测日期 2026-02-01

+16.5

Gemini 3.1 Pro

50.6

排名 #60/67 · confidence 3 · 评测日期 2026-02-19

代码reported

LiveCodeBench Pro

Claude Opus 4.6

70.7

排名 #4/4 · confidence 4 · 评测日期 2026-02-01

+12.2

Gemini 3.1 Pro

领先

82.9

排名 #2/4 · confidence 3 · 评测日期 2026-02-19

代码reported

React Native Evals

Claude Opus 4.6

领先

84.1

排名 #3/12 · confidence 4 · 评测日期 2026-02-01

+5.2

Gemini 3.1 Pro

78.9

排名 #6/12 · confidence 3 · 评测日期 2026-02-19

代码reported

Vibe Code Bench

Claude Opus 4.6

领先

57.6

排名 #5/33 · confidence 4 · 评测日期 2026-02-01

+25.5

Gemini 3.1 Pro

32.0

排名 #13/33 · confidence 3 · 评测日期 2026-02-19

代码reported

AA-SciCode

Claude Opus 4.6

45.7

排名 #54/113 · confidence 4 · 评测日期 2026-02-01

+13.0

Gemini 3.1 Pro

领先

58.7

排名 #6/113 · confidence 3 · 评测日期 2026-02-19

代码reported

BenchLM Coding score

Claude Opus 4.6

50.3

排名 #54/87 · confidence 4 · 评测日期 2026-02-01

+24.0

Gemini 3.1 Pro

领先

74.3

排名 #7/87 · confidence 3 · 评测日期 2026-02-19

数学reported

FrontierMath v2 (Tiers 1-3)

Claude Opus 4.6

领先

40.7

排名 #10/47 · confidence 4 · 评测日期 2026-02-01

+3.8

Gemini 3.1 Pro

36.9

排名 #15/47 · confidence 3 · 评测日期 2026-02-19

数学reported

FrontierMath v2 (Tier 4)

Claude Opus 4.6

领先

22.9

排名 #11/36 · confidence 4 · 评测日期 2026-02-01

+6.2

Gemini 3.1 Pro

16.7

排名 #14/36 · confidence 3 · 评测日期 2026-02-19

数学reported

BenchLM Math score

Claude Opus 4.6

领先

58.6

排名 #29/63 · confidence 4 · 评测日期 2026-02-01

+4.3

Gemini 3.1 Pro

54.3

排名 #35/63 · confidence 3 · 评测日期 2026-02-19

知识reported

MedXpertQA (Text)

Claude Opus 4.6

52.1

排名 #3/4 · confidence 4 · 评测日期 2026-02-01

+19.4

Gemini 3.1 Pro

领先

71.5

排名 #1/4 · confidence 3 · 评测日期 2026-02-19

知识reported

GPQA-D

Claude Opus 4.6

89.2

排名 #19/32 · confidence 4 · 评测日期 2026-02-01

+5.1

Gemini 3.1 Pro

领先

94.3

排名 #3/32 · confidence 3 · 评测日期 2026-02-19

知识reported

AA-GPQA Diamond

Claude Opus 4.6

84.0

排名 #67/113 · confidence 4 · 评测日期 2026-02-01

+10.1

Gemini 3.1 Pro

领先

94.1

排名 #5/113 · confidence 3 · 评测日期 2026-02-19

知识reported

AA-Omniscience Index

Claude Opus 4.6

2.4

排名 #36/45 · confidence 4 · 评测日期 2026-02-01

+29.5

Gemini 3.1 Pro

领先

31.9

排名 #5/45 · confidence 3 · 评测日期 2026-02-19

知识reported

HealthBench Hard

Claude Opus 4.6

14.8

排名 #8/8 · confidence 4 · 评测日期 2026-02-01

+5.8

Gemini 3.1 Pro

领先

20.6

排名 #6/8 · confidence 3 · 评测日期 2026-02-19

知识reported

HLE w/o tools

Claude Opus 4.6

40.0

排名 #14/22 · confidence 4 · 评测日期 2026-02-01

+5.4

Gemini 3.1 Pro

领先

45.4

排名 #6/22 · confidence 3 · 评测日期 2026-02-19

知识reported

AA-Omniscience Accuracy

Claude Opus 4.6

45.8

排名 #23/106 · confidence 4 · 评测日期 2026-02-01

+9.1

Gemini 3.1 Pro

领先

54.9

排名 #9/106 · confidence 3 · 评测日期 2026-02-19

知识reported

AA-HLE

Claude Opus 4.6

19.1

排名 #74/114 · confidence 4 · 评测日期 2026-02-01

+27.9

Gemini 3.1 Pro

领先

47.0

排名 #10/114 · confidence 3 · 评测日期 2026-02-19

知识reported

BenchLM Knowledge score

Claude Opus 4.6

领先

79.8

排名 #15/83 · confidence 4 · 评测日期 2026-02-01

+0.6

Gemini 3.1 Pro

79.2

排名 #20/83 · confidence 3 · 评测日期 2026-02-19

知识reported

AA-Omniscience Hallucination Rate

Claude Opus 4.6

领先

80.1

排名 #43/106 · confidence 4 · 评测日期 2026-02-01

+29.2

Gemini 3.1 Pro

50.9

排名 #76/106 · confidence 3 · 评测日期 2026-02-19

知识reported

Artificial Analysis Intelligence Index

Claude Opus 4.6

26.4

排名 #57/117 · confidence 4 · 评测日期 2026-02-01

+4.0

Gemini 3.1 Pro

领先

30.4

排名 #48/117 · confidence 3 · 评测日期 2026-02-19

多语言reported

AA Global-MMLU-Lite

Claude Opus 4.6

92.2

排名 #3/5 · confidence 1 · 评测日期 2026-02-01

+1.0

Gemini 3.1 Pro

领先

93.2

排名 #1/5 · confidence 3 · 评测日期 2026-02-19

多模态reported

MedXpertQA (MM)

Claude Opus 4.6

64.8

排名 #6/6 · confidence 4 · 评测日期 2026-02-01

+16.5

Gemini 3.1 Pro

领先

81.3

排名 #1/6 · confidence 3 · 评测日期 2026-02-19

多模态reported

MMMU-Pro

Claude Opus 4.6

77.3

排名 #21/31 · confidence 4 · 评测日期 2026-02-01

+6.6

Gemini 3.1 Pro

领先

83.9

排名 #2/31 · confidence 3 · 评测日期 2026-02-19

多模态reported

ERQA

Claude Opus 4.6

51.6

排名 #8/8 · confidence 4 · 评测日期 2026-02-01

+17.8

Gemini 3.1 Pro

领先

69.4

排名 #3/8 · confidence 3 · 评测日期 2026-02-19

多模态reported

ScreenSpot Pro

Claude Opus 4.6

83.1

排名 #6/12 · confidence 4 · 评测日期 2026-02-01

+1.3

Gemini 3.1 Pro

领先

84.4

排名 #5/12 · confidence 3 · 评测日期 2026-02-19

多模态reported

AA-MMMU-Pro

Claude Opus 4.6

72.5

排名 #45/68 · confidence 4 · 评测日期 2026-02-01

+9.9

Gemini 3.1 Pro

领先

82.4

排名 #8/68 · confidence 3 · 评测日期 2026-02-19

多模态reported

BenchLM Multimodal Grounded score

Claude Opus 4.6

59.5

排名 #40/56 · confidence 4 · 评测日期 2026-02-01

+19.7

Gemini 3.1 Pro

领先

79.2

排名 #14/56 · confidence 3 · 评测日期 2026-02-19

多模态reported

Design Arena Website

Claude Opus 4.6

领先

1304.0

排名 #14/78 · confidence 4 · 评测日期 2026-02-01

+39.0

Gemini 3.1 Pro

1265.0

排名 #32/78 · confidence 3 · 评测日期 2026-02-19

指令遵循reported

AA-IFBench

Claude Opus 4.6

44.6

排名 #59/84 · confidence 4 · 评测日期 2026-02-01

+32.5

Gemini 3.1 Pro

领先

77.1

排名 #7/84 · confidence 3 · 评测日期 2026-02-19

Agentsreported

Claw-Eval

Claude Opus 4.6

领先

70.4

排名 #3/27 · confidence 4 · 评测日期 2026-02-01

+12.6

Gemini 3.1 Pro

57.8

排名 #16/27 · confidence 3 · 评测日期 2026-02-19

Agentsreported

ResearchClawBench

Claude Opus 4.6

领先

19.9

排名 #4/18 · confidence 4 · 评测日期 2026-02-01

+6.6

Gemini 3.1 Pro

13.3

排名 #17/18 · confidence 3 · 评测日期 2026-02-19

Agentsreported

APEX-Agents-AA

Claude Opus 4.6

领先

33.0

排名 #8/23 · confidence 1 · 评测日期 2026-02-01

+1.0

Gemini 3.1 Pro

32.0

排名 #9/23 · confidence 3 · 评测日期 2026-02-19

Agentsreported

Gert Labs

Claude Opus 4.6

领先

61.9

排名 #10/49 · confidence 4 · 评测日期 2026-02-01

+5.0

Gemini 3.1 Pro

56.9

排名 #14/49 · confidence 3 · 评测日期 2026-02-19

Agentsreported

DeepSearchQA

Claude Opus 4.6

领先

73.7

排名 #11/14 · confidence 4 · 评测日期 2026-02-01

+4.0

Gemini 3.1 Pro

69.7

排名 #13/14 · confidence 3 · 评测日期 2026-02-19

Agentsreported

τ²-bench results

Claude Opus 4.6

84.8

排名 #46/82 · confidence 4 · 评测日期 2026-02-01

+10.8

Gemini 3.1 Pro

领先

95.6

排名 #17/82 · confidence 3 · 评测日期 2026-02-19

Agentsreported

BenchLM Agentic score

Claude Opus 4.6

63.5

排名 #37/77 · confidence 4 · 评测日期 2026-02-01

+9.3

Gemini 3.1 Pro

领先

72.8

排名 #28/77 · confidence 3 · 评测日期 2026-02-19

API audit 对比

来自共同 provider 的最近完成 audit,展示四个安全/完整性分组分数和报告入口。

Provider
Claude Opus 4.6
Gemini 3.1 Pro
暂无共同 provider 的已完成 audit。

Provider 数据样本

把同一 provider 的测速聚合和 input/output 价格放进同一行,便于判断实际 API 表现和迁移成本。

Provider
Claude Opus 4.6
Gemini 3.1 Pro
钠 API25 次测试

Claude Opus 4.6

speed / latency

42 tok/s / 2282ms

input / output

暂无数据

Gemini 3.1 Pro

speed / latency

96 tok/s / 13019ms

input / output

暂无数据

Kunkunout API20 次测试

Claude Opus 4.6

speed / latency

40 tok/s / 16141ms

input / output

暂无数据

Gemini 3.1 Pro

speed / latency

N/A / N/A

input / output

暂无数据

Rnglg2 API15 次测试

Claude Opus 4.6

speed / latency

57 tok/s / 3926ms

input / output

暂无数据

Gemini 3.1 Pro

speed / latency

N/A / N/A

input / output

暂无数据

TradingBase API15 次测试

Claude Opus 4.6

speed / latency

43 tok/s / 1437ms

input / output

暂无数据

Gemini 3.1 Pro

speed / latency

102 tok/s / 12933ms

input / output

暂无数据

小水管 API15 次测试

Claude Opus 4.6

speed / latency

45 tok/s / 6167ms

input / output

暂无数据

Gemini 3.1 Pro

speed / latency

101 tok/s / 15025ms

input / output

暂无数据

Claude Opus 4.6

claude-opus-4-6

speed / latency

暂无数据

input / output

$0/request

Gemini 3.1 Pro

gemini-3.1-pro-preview-high

speed / latency

暂无数据

input / output

$0/request

Claude Opus 4.6

claude-opus-4-6

speed / latency

暂无数据

input / output

$0.017/request

Gemini 3.1 Pro

gemini-3.1-pro-preview

speed / latency

暂无数据

input / output

$0.0052/request

Claude Opus 4.6

claude-opus-4-6-c

speed / latency

暂无数据

input / output

$0.027/request

Gemini 3.1 Pro

gemini-3.1-pro-preview-c

speed / latency

暂无数据

input / output

$0.0055/request

Claude Opus 4.6

anti/claude-opus-4-6-c

speed / latency

暂无数据

input / output

$0.200/request

Gemini 3.1 Pro

anti/gemini-3.1-pro-c

speed / latency

暂无数据

input / output

$0.012/request

Claude Opus 4.6

claude-opus-4-6

speed / latency

暂无数据

input / output

$0.300/M/$1.50/M

Gemini 3.1 Pro

[按量]gemini-3.1-pro

speed / latency

暂无数据

input / output

$0.015/request

常见问题

综合加权结果:Gemini 3.1 Pro。Benchmark 能力分类占 80%,价格、API 性能和可用性占 20%。

这个比较为什么能收录?
它至少有 6 个可验证比较点,并且两个模型都有价格或测速数据。
没有数据的指标会不会编?
不会。没有 LMSpeed 数据的指标不会出现在这份报告里。

排名基于社区提交的测试数据与定期健康探测,仅供参考,非官方数据。