返回模型目录

Model compare

Claude Sonnet 4.6 vs Gemini 3.1 Pro

Claude Sonnet 4.6 和 Gemini 3.1 Pro 的结论先放在这里,方便先判断是否值得继续看明细。

Key Takeaways

综合加权结果:Gemini 3.1 Pro。Benchmark 能力分类占 80%,价格、API 性能和可用性占 20%。

结论

Gemini 3.1 Pro

Gemini 3.1 Pro 当前综合加权更高;模型 A / B 得分为 38.9 对 61.1。

证据覆盖

130 个数据点

包含 33 个 benchmark、0 个 audit 样本和 10 个 provider 样本。

选择依据

优先看 Gemini 3.1 Pro

下方图表把 43 组高信号样本拆开,便于核对速度、跑分和安全分。

切换对比模型

左右两边都可以换成其他模型,页面会打开新的 LMSpeed 对比 URL。

选择其他模型后会打开新的对比页。

对比总表

这份报告只使用 LMSpeed 已有数据:Claude Sonnet 4.6 和 Gemini 3.1 Pro 的价格、测速聚合、第三方跑分与共同服务商样本。

Model compare
Claude Sonnet 4.6
Gemini 3.1 Pro
综合领先对照领先
综合加权得分38.9 分61.1 分
Benchmark 分类领先2 类5 类
运营维度优势最低输入价格、首 token 延迟、免费服务商、服务商覆盖平均速度
上下文窗口1M tokens1.0M tokens
最大输出128K tokens65.5K tokens
模态

输入

文本图像文件

输出

文本

输入

音频文件图像文本video

输出

文本
能力
文本输入图像输入文件输入文本输出工具调用结构化输出JSON 模式推理
文本输入图像输入文件输入音频输入文本输出工具调用结构化输出JSON 模式推理

总体结果按 80% benchmark 能力分类和 20% 价格、API 速度/延迟与可用性加权;近期测试数量不参与胜负,缺失的 benchmark 分类不计分。

模型元信息

Model compare
Claude Sonnet 4.6
Gemini 3.1 Pro
开发者AnthropicGoogle
发布日期2026年2月2026年2月
参数量暂无数据暂无数据
TokenizerClaudeGemini
知识截止暂无数据暂无数据
OpenRouter IDanthropic/claude-sonnet-4.6google/gemini-3.1-pro-preview
来源链接暂无数据暂无数据

什么时候选哪个模型

这份报告只使用 LMSpeed 已有数据:Claude Sonnet 4.6 和 Gemini 3.1 Pro 的价格、测速聚合、第三方跑分与共同服务商样本。

Claude Sonnet 4.6

Claude Sonnet 4.6 在 benchmark 分类(Agents、知识)和运营维度(最低输入价格、首 token 延迟、免费服务商、服务商覆盖)更强。

Gemini 3.1 Pro

Gemini 3.1 Pro 在 benchmark 分类(代码、推理、数学、多模态、指令遵循)和运营维度(平均速度)更强。

跑分对比

来自 LMSpeed 同步的第三方 benchmark profile;只展示两个模型都有数值的指标。

分类能力对比

按 0-100 分对比 benchmark 分类表现;点击分类可以聚焦查看差距。

模型 A 覆盖
7 / 8
模型 B 覆盖
8 / 8
共同覆盖
7 个共同分类

平均分

Claude Sonnet 4.6

52.9

平均分

Gemini 3.1 Pro

57

Agents

Claude Sonnet 4.6 领先 1.7

Claude Sonnet 4.651.9
Gemini 3.1 Pro50.2

代码

Gemini 3.1 Pro 领先 1.2

Claude Sonnet 4.656
Gemini 3.1 Pro57.2

推理

Gemini 3.1 Pro 领先 7.3

Claude Sonnet 4.650.1
Gemini 3.1 Pro57.4

知识

Claude Sonnet 4.6 领先 13.6

Claude Sonnet 4.670.6
Gemini 3.1 Pro57

数学

Gemini 3.1 Pro 领先 2.0

Claude Sonnet 4.652.6
Gemini 3.1 Pro54.6

多语言

Gemini 3.1 Pro

Claude Sonnet 4.6-
Gemini 3.1 Pro69.3

多模态

Gemini 3.1 Pro 领先 9.7

Claude Sonnet 4.645.4
Gemini 3.1 Pro55.1

指令遵循

Gemini 3.1 Pro 领先 11.5

Claude Sonnet 4.643.8
Gemini 3.1 Pro55.3

专业跑分明细

按具体 benchmark 指标对比两个模型,展示来源、排名覆盖、置信度、误差和评测日期等上下文。

综合reported

BenchLM overall score

Claude Sonnet 4.6

59.0

排名 #55/112 · confidence 4 · 评测日期 2026-02-01

+8.0

Gemini 3.1 Pro

领先

67.0

排名 #27/112 · confidence 3 · 评测日期 2026-02-19

推理reported

AA-LCR

Claude Sonnet 4.6

68.3

排名 #70/106 · confidence 4 · 评测日期 2026-02-01

+13.7

Gemini 3.1 Pro

领先

82.0

排名 #14/106 · confidence 3 · 评测日期 2026-02-19

推理reported

CritPt

Claude Sonnet 4.6

0.9

排名 #74/88 · confidence 4 · 评测日期 2026-02-01

+16.8

Gemini 3.1 Pro

领先

17.7

排名 #19/88 · confidence 3 · 评测日期 2026-02-19

推理reported

BenchLM Reasoning score

Claude Sonnet 4.6

领先

67.9

排名 #41/67 · confidence 4 · 评测日期 2026-02-01

+17.3

Gemini 3.1 Pro

50.6

排名 #60/67 · confidence 3 · 评测日期 2026-02-19

代码reported

EEBench

Claude Sonnet 4.6

20.4

排名 #14/25 · confidence 3 · 评测日期 2026-02-01

+25.9

Gemini 3.1 Pro

领先

46.3

排名 #5/25 · confidence 3 · 评测日期 2026-02-19

代码reported

React Native Evals

Claude Sonnet 4.6

领先

80.6

排名 #5/12 · confidence 4 · 评测日期 2026-02-01

+1.7

Gemini 3.1 Pro

78.9

排名 #6/12 · confidence 3 · 评测日期 2026-02-19

代码reported

AA-SciCode

Claude Sonnet 4.6

46.9

排名 #49/113 · confidence 4 · 评测日期 2026-02-01

+11.8

Gemini 3.1 Pro

领先

58.7

排名 #6/113 · confidence 3 · 评测日期 2026-02-19

代码reported

LiveCodeBench (Vals)

Claude Sonnet 4.6

82.1

排名 #30/35 · confidence 4 · 评测日期 2026-02-01

+6.4

Gemini 3.1 Pro

领先

88.5

排名 #6/35 · confidence 3 · 评测日期 2026-02-19

代码reported

BenchLM Coding score

Claude Sonnet 4.6

61.8

排名 #22/87 · confidence 4 · 评测日期 2026-02-01

+12.5

Gemini 3.1 Pro

领先

74.3

排名 #7/87 · confidence 3 · 评测日期 2026-02-19

代码reported

CADGenBench Generation

Claude Sonnet 4.6

领先

22.1

排名 #7/8 · confidence 3 · 评测日期 2026-02-01

+0.9

Gemini 3.1 Pro

21.1

排名 #8/8 · confidence 3 · 评测日期 2026-02-19

代码reported

Vibe Code Bench

Claude Sonnet 4.6

领先

51.5

排名 #7/33 · confidence 4 · 评测日期 2026-02-01

+19.4

Gemini 3.1 Pro

32.0

排名 #13/33 · confidence 3 · 评测日期 2026-02-19

代码reported

SWE-bench (Vals)

Claude Sonnet 4.6

77.4

排名 #26/37 · confidence 4 · 评测日期 2026-02-01

+1.4

Gemini 3.1 Pro

领先

78.8

排名 #23/37 · confidence 3 · 评测日期 2026-02-19

数学reported

FrontierMath v2 (Tier 4)

Claude Sonnet 4.6

8.3

排名 #20/36 · confidence 4 · 评测日期 2026-02-01

+8.4

Gemini 3.1 Pro

领先

16.7

排名 #14/36 · confidence 3 · 评测日期 2026-02-19

数学reported

FrontierMath v2 (Tiers 1-3)

Claude Sonnet 4.6

32.4

排名 #18/47 · confidence 4 · 评测日期 2026-02-01

+4.5

Gemini 3.1 Pro

领先

36.9

排名 #15/47 · confidence 3 · 评测日期 2026-02-19

数学reported

BenchLM Math score

Claude Sonnet 4.6

49.0

排名 #38/63 · confidence 4 · 评测日期 2026-02-01

+5.3

Gemini 3.1 Pro

领先

54.3

排名 #35/63 · confidence 3 · 评测日期 2026-02-19

知识reported

GPQA Diamond (Vals)

Claude Sonnet 4.6

85.6

排名 #30/37 · confidence 4 · 评测日期 2026-02-01

+9.9

Gemini 3.1 Pro

领先

95.5

排名 #1/37 · confidence 3 · 评测日期 2026-02-19

知识reported

MMLU-Pro (Vals)

Claude Sonnet 4.6

87.3

排名 #23/38 · confidence 4 · 评测日期 2026-02-01

+3.7

Gemini 3.1 Pro

领先

91.0

排名 #4/38 · confidence 3 · 评测日期 2026-02-19

知识reported

AA-GPQA Diamond

Claude Sonnet 4.6

79.9

排名 #79/113 · confidence 4 · 评测日期 2026-02-01

+14.2

Gemini 3.1 Pro

领先

94.1

排名 #5/113 · confidence 3 · 评测日期 2026-02-19

知识reported

AA-Omniscience Accuracy

Claude Sonnet 4.6

38.6

排名 #40/106 · confidence 4 · 评测日期 2026-02-01

+16.3

Gemini 3.1 Pro

领先

54.9

排名 #9/106 · confidence 3 · 评测日期 2026-02-19

知识reported

AA-HLE

Claude Sonnet 4.6

13.3

排名 #82/114 · confidence 4 · 评测日期 2026-02-01

+33.7

Gemini 3.1 Pro

领先

47.0

排名 #10/114 · confidence 3 · 评测日期 2026-02-19

知识reported

BenchLM Knowledge score

Claude Sonnet 4.6

75.2

排名 #27/83 · confidence 4 · 评测日期 2026-02-01

+4.0

Gemini 3.1 Pro

领先

79.2

排名 #20/83 · confidence 3 · 评测日期 2026-02-19

知识reported

Artificial Analysis Intelligence Index

Claude Sonnet 4.6

24.7

排名 #68/117 · confidence 4 · 评测日期 2026-02-01

+5.7

Gemini 3.1 Pro

领先

30.4

排名 #48/117 · confidence 3 · 评测日期 2026-02-19

知识reported

AA-Omniscience Hallucination Rate

Claude Sonnet 4.6

领先

68.5

排名 #57/106 · confidence 4 · 评测日期 2026-02-01

+17.6

Gemini 3.1 Pro

50.9

排名 #76/106 · confidence 3 · 评测日期 2026-02-19

多模态reported

AA-MMMU-Pro

Claude Sonnet 4.6

70.6

排名 #49/68 · confidence 4 · 评测日期 2026-02-01

+11.8

Gemini 3.1 Pro

领先

82.4

排名 #8/68 · confidence 3 · 评测日期 2026-02-19

多模态reported

BenchLM Multimodal Grounded score

Claude Sonnet 4.6

54.1

排名 #44/56 · confidence 4 · 评测日期 2026-02-01

+25.1

Gemini 3.1 Pro

领先

79.2

排名 #14/56 · confidence 3 · 评测日期 2026-02-19

多模态reported

Design Arena Website

Claude Sonnet 4.6

领先

1297.0

排名 #15/78 · confidence 4 · 评测日期 2026-02-01

+32.0

Gemini 3.1 Pro

1265.0

排名 #32/78 · confidence 3 · 评测日期 2026-02-19

多模态reported

CharXiv

Claude Sonnet 4.6

77.4

排名 #25/30 · confidence 4 · 评测日期 2026-02-01

+2.8

Gemini 3.1 Pro

领先

80.2

排名 #21/30 · confidence 3 · 评测日期 2026-02-19

指令遵循reported

AA-IFBench

Claude Sonnet 4.6

41.2

排名 #67/84 · confidence 4 · 评测日期 2026-02-01

+35.9

Gemini 3.1 Pro

领先

77.1

排名 #7/84 · confidence 3 · 评测日期 2026-02-19

Agentsreported

Claw-Eval

Claude Sonnet 4.6

领先

67.8

排名 #5/27 · confidence 4 · 评测日期 2026-02-01

+10.0

Gemini 3.1 Pro

57.8

排名 #16/27 · confidence 3 · 评测日期 2026-02-19

Agentsreported

Gert Labs

Claude Sonnet 4.6

领先

62.9

排名 #8/49 · confidence 4 · 评测日期 2026-02-01

+6.1

Gemini 3.1 Pro

56.9

排名 #14/49 · confidence 3 · 评测日期 2026-02-19

Agentsreported

Terminal-Bench 2.1 (Vals)

Claude Sonnet 4.6

57.3

排名 #26/40 · confidence 4 · 评测日期 2026-02-01

+13.5

Gemini 3.1 Pro

领先

70.8

排名 #17/40 · confidence 3 · 评测日期 2026-02-19

Agentsreported

τ²-bench results

Claude Sonnet 4.6

79.5

排名 #55/82 · confidence 4 · 评测日期 2026-02-01

+16.1

Gemini 3.1 Pro

领先

95.6

排名 #17/82 · confidence 3 · 评测日期 2026-02-19

Agentsreported

BenchLM Agentic score

Claude Sonnet 4.6

50.5

排名 #55/77 · confidence 4 · 评测日期 2026-02-01

+22.3

Gemini 3.1 Pro

领先

72.8

排名 #28/77 · confidence 3 · 评测日期 2026-02-19

API audit 对比

来自共同 provider 的最近完成 audit,展示四个安全/完整性分组分数和报告入口。

Provider
Claude Sonnet 4.6
Gemini 3.1 Pro
暂无共同 provider 的已完成 audit。

Provider 数据样本

把同一 provider 的测速聚合和 input/output 价格放进同一行,便于判断实际 API 表现和迁移成本。

Provider
Claude Sonnet 4.6
Gemini 3.1 Pro
UoCode25 次测试

Claude Sonnet 4.6

speed / latency

32 tok/s / 6074ms

input / output

暂无数据

Gemini 3.1 Pro

speed / latency

N/A / N/A

input / output

暂无数据

天宫造物25 次测试

Claude Sonnet 4.6

speed / latency

40 tok/s / 3145ms

input / output

暂无数据

Gemini 3.1 Pro

speed / latency

N/A / N/A

input / output

暂无数据

小水管 API20 次测试

Claude Sonnet 4.6

speed / latency

31 tok/s / 4124ms

input / output

暂无数据

Gemini 3.1 Pro

speed / latency

101 tok/s / 15025ms

input / output

暂无数据

Tokeness.io15 次测试

Claude Sonnet 4.6

speed / latency

48 tok/s / 1587ms

input / output

暂无数据

Gemini 3.1 Pro

speed / latency

98 tok/s / 12325ms

input / output

暂无数据

CatClaw API10 次测试

Claude Sonnet 4.6

speed / latency

N/A / N/A

input / output

暂无数据

Gemini 3.1 Pro

speed / latency

121 tok/s / 11404ms

input / output

暂无数据

Claude Sonnet 4.6

claude-sonnet-4-6

speed / latency

暂无数据

input / output

$0/request

Gemini 3.1 Pro

gemini-3.1-pro-preview-high

speed / latency

暂无数据

input / output

$0/request

Claude Sonnet 4.6

claude-sonnet-4-6

speed / latency

暂无数据

input / output

$0.010/M/$0.050/M

Gemini 3.1 Pro

gemini-3.1-pro-preview

speed / latency

暂无数据

input / output

$0.0050/request

Claude Sonnet 4.6

claude-sonnet-4-6

speed / latency

暂无数据

input / output

$0.010/request

Gemini 3.1 Pro

gemini-3.1-pro-preview

speed / latency

暂无数据

input / output

$0.0052/request

Claude Sonnet 4.6

claude-sonnet-4-6-c

speed / latency

暂无数据

input / output

$0.027/request

Gemini 3.1 Pro

gemini-3.1-pro-preview-c

speed / latency

暂无数据

input / output

$0.0055/request

Claude Sonnet 4.6

anthropic/claude-sonnet-4.6

speed / latency

暂无数据

input / output

$0.010/request

Gemini 3.1 Pro

gemini-3.1-pro-high

speed / latency

暂无数据

input / output

$0.100/request

常见问题

综合加权结果:Gemini 3.1 Pro。Benchmark 能力分类占 80%,价格、API 性能和可用性占 20%。

这个比较为什么能收录?
它至少有 6 个可验证比较点,并且两个模型都有价格或测速数据。
没有数据的指标会不会编?
不会。没有 LMSpeed 数据的指标不会出现在这份报告里。

排名基于社区提交的测试数据与定期健康探测,仅供参考,非官方数据。