Qwen
·Released on 2026年8月14日

Qwen3.8 27B API 基准测试 价格和服务商数据

选择与 Qwen3.8 27B 对比的模型

选择一个模型后会直接打开对应的对比页面。

分享到 X
LLM

Qwen3.8 27B is an open-weight dense vision-language model from Qwen. It is suited for coding, professional workflows, research, multimodal interaction, and long-running agent tasks, with flexible thin...

质量
#24of 100
68.0
LMSpeed 评分

分类性能

基于独立 benchmark family 的实测能力估计,不确定性单独展示。

覆盖
6 / 8
方法论
V3.0
分类性能基于独立 benchmark family 的实测能力估计,不确定性单独展示。智能体57.2代码56.2综合推理58.1知识41.5数学-多语言-多模态57.7指令遵循56.1
#1综合推理58.1暂定评分1/4 实测维度
80% 区间: 44.272.0
abstract logic仅先验
scientific causal58.1
gpqa · gpqa / hle · hle / hle · hle_no_tools
multistep constraints仅先验
evidence verification仅先验
#2多模态57.7估算2/4 实测维度
80% 区间: 46.469.0
perception ocr仅先验
document spatial59.4
charxiv · charxiv
visual reasoning56
erqa · erqa / mathvision · math_vision
video action仅先验
#3智能体57.2估算2/4 实测维度
80% 区间: 45.369.1
planning仅先验
tool use仅先验
environment execution62
osworld · os_world_verified
recovery reliability52.4
jobbench · job_bench
#4代码56.2估算2/4 实测维度
80% 区间: 45.666.9
code generation59.9
livecodebench · live_code_bench_v6 / scicode · scicode
repository engineering52.6
nl2repo · nl2_repo / swe_pro · swe_pro
debugging testing仅先验
tooling quality仅先验
#5指令遵循56.1暂定评分1/4 实测维度
80% 区间: 40.172.2
constraint following仅先验
structured output仅先验
novel instruction generalization56.1
ifbench · if_bench
long multiturn instruction仅先验
#6知识41.5暂定评分1/4 实测维度
80% 区间: 25.457.5
broad knowledge41.5
benchlm_category_knowledge · benchlm_category_knowledge
professional knowledge仅先验
factuality仅先验
retrieval open book仅先验
暂无数据:数学多语言

技术规格

Input and output token limits for this model, plus how it ranks on long-context understanding.

INPUT
1Mtokens
1.2K pages of text
OUTPUT
131.1Ktokens
8K128K1M4M
1M

能力

Technical Details

输入
输出
总参数量
27B
发布日期
Aug 2026
Tokenizer
Qwen
架构
text+image+video->text
内容审核
支持参数
frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokenspresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p

排名

擅长

表现尚可

相对落后

详细分数

更新时间: 2026年8月23日

综合

2 个指标

Overall score68.0#24 / 100DeepSWE42.2#15 / 16
Overall score
站内排名#24
分数68.0
更新时间2026年8月20日
置信度3
DeepSWE
站内排名#15
分数42.2
更新时间2026年8月20日
置信度3

价格

2 个指标

输入价格$0.425/M#79 / 180输出价格$3.10/M#102 / 180
输入价格
Input price
站内排名#79
分数$0.425/M
更新时间2026年8月23日
置信度4
输出价格
Output price
站内排名#102
分数$3.10/M
更新时间2026年8月23日
置信度4

智能体

V3.0

8 个指标 · 估算

分数57.280% 区间45.3–69.12/4 实测维度Agentic score84.4#12 / 69Terminal-Bench 2.173.0#6 / 7
维度与证据
规划拆解仅先验
工具调用仅先验
环境与长程执行62
1 个基准族 · 1 个指标
osworld · os_world_verified · z 1.24 · q 1.00
恢复与完成可靠性52.4
1 个基准族 · 1 个指标
jobbench · job_bench · z 0.07 · q 1.00
Agentic score
站内排名#12
分数84.4
更新时间2026年8月20日
置信度3
Terminal-Bench 2.1
站内排名#6
分数73.0
更新时间2026年8月20日
置信度3
CoWorkBench
站内排名#2
分数70.7
更新时间2026年8月20日
置信度3
JobBenchV3 计分证据
站内排名#11
分数33.4
更新时间2026年8月20日
置信度3
Agents' Last Exam
站内排名#2
分数42.9
更新时间2026年8月20日
置信度3
OSWorld-VerifiedV3 计分证据
站内排名#3
分数84.3
更新时间2026年8月20日
置信度3
WebArena-Verified
站内排名#3
分数64.8
更新时间2026年8月20日
置信度3
AndroidWorld
站内排名#2
分数81.9
更新时间2026年8月20日
置信度3

代码

V3.0

6 个指标 · 估算

分数56.280% 区间45.6–66.92/4 实测维度SciCode44.7%#48 / 204Coding score53.3#51 / 81
维度与证据
代码生成59.9
2 个基准族 · 2 个指标
livecodebench · live_code_bench_v6 · z 1.49 · q 0.75
scicode · scicode · z 0.59 · q 1.00
仓库工程52.6
2 个基准族 · 2 个指标
nl2repo · nl2_repo · z -0.10 · q 1.00
swe_pro · swe_pro · z 0.91 · q 1.00
调试与测试仅先验
工具化开发与质量仅先验
SciCodeV3 计分证据
站内排名#48
分数44.7%
更新时间2026年8月23日
置信度4
Coding score
站内排名#51
分数53.3
更新时间2026年8月20日
置信度3
Terminal-Bench 2.1
站内排名#6
分数73.0
更新时间2026年8月20日
置信度3
SWE-bench ProV3 计分证据
站内排名#12
分数61.7
更新时间2026年8月20日
置信度3
NL2RepoV3 计分证据
站内排名#9
分数42.3
更新时间2026年8月20日
置信度3
LiveCodeBench v6V3 计分证据
站内排名#1
分数90.3
更新时间2026年8月20日
置信度3

综合推理

V3.0

2 个指标 · 暂定评分

分数58.180% 区间44.2–72.01/4 实测维度GPQA90.5%#25 / 211HLE33.9%#40 / 208
维度与证据
抽象逻辑仅先验
科学与因果推理58.1
2 个基准族 · 3 个指标
gpqa · gpqa · z 0.98 · q 1.00
hle · hle · z 0.76 · q 1.00
hle · hle_no_tools · z -1.21 · q 1.00
多步约束仅先验
证据整合与验证仅先验
GPQAV3 计分证据
站内排名#25
分数90.5%
更新时间2026年8月23日
置信度4
HLEV3 计分证据
站内排名#40
分数33.9%
更新时间2026年8月23日
置信度4

知识

V3.0

3 个指标 · 暂定评分

分数41.580% 区间25.4–57.51/4 实测维度Knowledge score47.0#62 / 69GPQA-D89.2#18 / 31
维度与证据
广泛知识41.5
1 个基准族 · 1 个指标
benchlm_category_knowledge · benchlm_category_knowledge · z -1.47 · q 1.00
专业知识仅先验
事实性仅先验
检索与开放资料运用仅先验
Knowledge scoreV3 计分证据
站内排名#62
分数47.0
更新时间2026年8月20日
置信度3
GPQA-D
站内排名#18
分数89.2
更新时间2026年8月20日
置信度3
HLE w/o tools
站内排名#18
分数30.8
更新时间2026年8月20日
置信度3

数学

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
基础数学仅先验
竞赛数学仅先验
高阶证明仅先验
应用与工具辅助数学仅先验

多语言

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
跨语言理解仅先验
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验

多模态

V3.0

11 个指标 · 估算

分数57.780% 区间46.4–69.02/4 实测维度Multimodal Grounded score79.8#9 / 44MathVision90.0#4 / 13
维度与证据
感知与 OCR仅先验
文档与空间理解59.4
1 个基准族 · 1 个指标
charxiv · charxiv · z 1.37 · q 1.00
视觉推理56
2 个基准族 · 2 个指标
erqa · erqa · z 0.01 · q 1.00
mathvision · math_vision · z 0.92 · q 1.00
视频与落地行动仅先验
Multimodal Grounded score
站内排名#9
分数79.8
更新时间2026年8月20日
置信度3
MathVisionV3 计分证据
站内排名#4
分数90.0
更新时间2026年8月20日
置信度3
MathVision w/ Python
站内排名#3
分数94.6
更新时间2026年8月20日
置信度3
BabyVision
站内排名#3
分数65.7
更新时间2026年8月20日
置信度3
BabyVision w/ Python
站内排名#3
分数85.6
更新时间2026年8月20日
置信度3
Vision2Web
站内排名#2
分数62.9
更新时间2026年8月20日
置信度3
CharXiv w/o tools
站内排名#4
分数83.7
更新时间2026年8月20日
置信度3
CharXivV3 计分证据
站内排名#4
分数90.2
更新时间2026年8月20日
置信度3
OmniDocBench 1.5
站内排名#4
分数91.1
更新时间2026年8月20日
置信度3
RealWorldQA
站内排名#3
分数85.9
更新时间2026年8月20日
置信度3
ERQAV3 计分证据
站内排名#4
分数65.5
更新时间2026年8月20日
置信度3

指令遵循

V3.0

2 个指标 · 暂定评分

分数56.180% 区间40.1–72.21/4 实测维度Instruction Following score90.4#10 / 25IFBench79.5#5 / 14
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化56.1
1 个基准族 · 1 个指标
ifbench · if_bench · z 0.55 · q 1.00
多轮与长指令仅先验
Instruction Following score
站内排名#10
分数90.4
更新时间2026年8月20日
置信度3
IFBenchV3 计分证据
站内排名#5
分数79.5
更新时间2026年8月20日
置信度3

OpenRouter 端点

8 个端点

来自 OpenRouter 的第三方端点数据,和 LMSpeed 自测数据分开展示。部分 30 分钟实时性能字段需要配置 OpenRouter API key 后同步才会出现。

Provider endpoint输入输出1 天在线率30m 延迟30m 吞吐上下文 / 输出
Alibaba
alibaba
$0.500/M$3/M100.0%undefined tokens / undefined tokens
AkashML
akashml/bf16
$0.400/M$3/M99.9%undefined tokens / undefined tokens
Reka
reka/fp8
$0.450/M$3.20/M99.9%undefined tokens / undefined tokens
Parasail
parasail/fp8
$0.450/M$3.20/M99.6%undefined tokens / undefined tokens
Chutes
chutes/fp8
$0.400/M$3/M99.5%undefined tokens / undefined tokens
Io Net
io-net/fp8
$0.480/M$3.40/M99.3%undefined tokens / undefined tokens
Venice
venice/fp8
$0.450/M$3.20/M99.3%undefined tokens / undefined tokens
CoreWeave
coreweave/fp8
$0.400/M$3/M98.0%undefined tokens / undefined tokens

排名基于社区提交的测试数据与定期健康探测,仅供参考,非官方数据。标准基准数据可能包含 BenchLM 等公开来源。

通过 API 获取 LMSpeed 数据

免费

免费的大模型价格、基准测试和服务商数据公开 API

  • 实时价格与可用性
  • 速度与延迟基准测试
  • 300+ 模型,600+ 服务商
  • 每天 1,000 次请求
查看 API 文档