Qwen
·Released on 2026年8月14日Qwen3.8 27B API 基准测试 价格和服务商数据
选择与 Qwen3.8 27B 对比的模型
选择一个模型后会直接打开对应的对比页面。
LLM
Qwen3.8 27B is an open-weight dense vision-language model from Qwen. It is suited for coding, professional workflows, research, multimodal interaction, and long-running agent tasks, with flexible thin...
质量
#24of 100
68.0
LMSpeed 评分
分类性能
基于独立 benchmark family 的实测能力估计,不确定性单独展示。
- 覆盖
- 6 / 8
- 方法论
- V3.0
#1综合推理58.1暂定评分1/4 实测维度
80% 区间: 44.2–72.0
abstract logic仅先验
scientific causal58.1
gpqa · gpqa / hle · hle / hle · hle_no_tools
multistep constraints仅先验
evidence verification仅先验
#2多模态57.7估算2/4 实测维度
80% 区间: 46.4–69.0
perception ocr仅先验
document spatial59.4
charxiv · charxiv
visual reasoning56
erqa · erqa / mathvision · math_vision
video action仅先验
#3智能体57.2估算2/4 实测维度
80% 区间: 45.3–69.1
planning仅先验
tool use仅先验
environment execution62
osworld · os_world_verified
recovery reliability52.4
jobbench · job_bench
#4代码56.2估算2/4 实测维度
80% 区间: 45.6–66.9
code generation59.9
livecodebench · live_code_bench_v6 / scicode · scicode
repository engineering52.6
nl2repo · nl2_repo / swe_pro · swe_pro
debugging testing仅先验
tooling quality仅先验
#5指令遵循56.1暂定评分1/4 实测维度
80% 区间: 40.1–72.2
constraint following仅先验
structured output仅先验
novel instruction generalization56.1
ifbench · if_bench
long multiturn instruction仅先验
#6知识41.5暂定评分1/4 实测维度
80% 区间: 25.4–57.5
broad knowledge41.5
benchlm_category_knowledge · benchlm_category_knowledge
professional knowledge仅先验
factuality仅先验
retrieval open book仅先验
暂无数据:数学多语言
技术规格
Input and output token limits for this model, plus how it ranks on long-context understanding.
INPUT
1Mtokens
≈ 1.2K pages of text
OUTPUT
131.1Ktokens
8K128K1M4M
1M
能力
Technical Details
- 输入
- 输出
- 总参数量
- 27B
- 发布日期
- Aug 2026
- Tokenizer
- Qwen
- 架构
- text+image+video->text
- 内容审核
- 否
- 支持参数
- frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokenspresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p
排名
擅长
表现尚可
相对落后
详细分数
更新时间: 2026年8月23日综合
2 个指标
Overall score68.0#24 / 100DeepSWE42.2#15 / 16
综合
2 个指标
基准
站内排名
分数
来源
更新时间
置信度
价格
2 个指标
输入价格$0.425/M#79 / 180输出价格$3.10/M#102 / 180
价格
2 个指标
基准
站内排名
分数
来源
更新时间
置信度
智能体
V3.08 个指标 · 估算
分数57.280% 区间45.3–69.12/4 实测维度Agentic score84.4#12 / 69Terminal-Bench 2.173.0#6 / 7
智能体
V3.08 个指标 · 估算
维度与证据
规划拆解仅先验
工具调用仅先验
环境与长程执行62
1 个基准族 · 1 个指标
osworld · os_world_verified · z 1.24 · q 1.00
恢复与完成可靠性52.4
1 个基准族 · 1 个指标
jobbench · job_bench · z 0.07 · q 1.00
基准
站内排名
分数
来源
更新时间
置信度
代码
V3.06 个指标 · 估算
分数56.280% 区间45.6–66.92/4 实测维度SciCode44.7%#48 / 204Coding score53.3#51 / 81
代码
V3.06 个指标 · 估算
维度与证据
代码生成59.9
2 个基准族 · 2 个指标
livecodebench · live_code_bench_v6 · z 1.49 · q 0.75
scicode · scicode · z 0.59 · q 1.00
仓库工程52.6
2 个基准族 · 2 个指标
nl2repo · nl2_repo · z -0.10 · q 1.00
swe_pro · swe_pro · z 0.91 · q 1.00
调试与测试仅先验
工具化开发与质量仅先验
基准
站内排名
分数
来源
更新时间
置信度
综合推理
V3.02 个指标 · 暂定评分
分数58.180% 区间44.2–72.01/4 实测维度GPQA90.5%#25 / 211HLE33.9%#40 / 208
综合推理
V3.02 个指标 · 暂定评分
维度与证据
抽象逻辑仅先验
科学与因果推理58.1
2 个基准族 · 3 个指标
gpqa · gpqa · z 0.98 · q 1.00
hle · hle · z 0.76 · q 1.00
hle · hle_no_tools · z -1.21 · q 1.00
多步约束仅先验
证据整合与验证仅先验
基准
站内排名
分数
来源
更新时间
置信度
知识
V3.03 个指标 · 暂定评分
分数41.580% 区间25.4–57.51/4 实测维度Knowledge score47.0#62 / 69GPQA-D89.2#18 / 31
知识
V3.03 个指标 · 暂定评分
维度与证据
广泛知识41.5
1 个基准族 · 1 个指标
benchlm_category_knowledge · benchlm_category_knowledge · z -1.47 · q 1.00
专业知识仅先验
事实性仅先验
检索与开放资料运用仅先验
基准
站内排名
分数
来源
更新时间
置信度
数学
V3.00 个指标 · 暂无数据
暂无数据80% 区间30.8–69.20/4 实测维度
数学
V3.00 个指标 · 暂无数据
维度与证据
基础数学仅先验
竞赛数学仅先验
高阶证明仅先验
应用与工具辅助数学仅先验
多语言
V3.00 个指标 · 暂无数据
暂无数据80% 区间30.8–69.20/4 实测维度
多语言
V3.00 个指标 · 暂无数据
维度与证据
跨语言理解仅先验
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验
多模态
V3.011 个指标 · 估算
分数57.780% 区间46.4–69.02/4 实测维度Multimodal Grounded score79.8#9 / 44MathVision90.0#4 / 13
多模态
V3.011 个指标 · 估算
维度与证据
感知与 OCR仅先验
文档与空间理解59.4
1 个基准族 · 1 个指标
charxiv · charxiv · z 1.37 · q 1.00
视觉推理56
2 个基准族 · 2 个指标
erqa · erqa · z 0.01 · q 1.00
mathvision · math_vision · z 0.92 · q 1.00
视频与落地行动仅先验
基准
站内排名
分数
来源
更新时间
置信度
指令遵循
V3.02 个指标 · 暂定评分
分数56.180% 区间40.1–72.21/4 实测维度Instruction Following score90.4#10 / 25IFBench79.5#5 / 14
指令遵循
V3.02 个指标 · 暂定评分
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化56.1
1 个基准族 · 1 个指标
ifbench · if_bench · z 0.55 · q 1.00
多轮与长指令仅先验
基准
站内排名
分数
来源
更新时间
置信度
OpenRouter 端点
8 个端点来自 OpenRouter 的第三方端点数据,和 LMSpeed 自测数据分开展示。部分 30 分钟实时性能字段需要配置 OpenRouter API key 后同步才会出现。
| Provider endpoint | 输入 | 输出 | 1 天在线率 | 30m 延迟 | 30m 吞吐 | 上下文 / 输出 |
|---|---|---|---|---|---|---|
Alibaba alibaba | $0.500/M | $3/M | 100.0% | — | — | undefined tokens / undefined tokens |
AkashML akashml/bf16 | $0.400/M | $3/M | 99.9% | — | — | undefined tokens / undefined tokens |
Reka reka/fp8 | $0.450/M | $3.20/M | 99.9% | — | — | undefined tokens / undefined tokens |
Parasail parasail/fp8 | $0.450/M | $3.20/M | 99.6% | — | — | undefined tokens / undefined tokens |
Chutes chutes/fp8 | $0.400/M | $3/M | 99.5% | — | — | undefined tokens / undefined tokens |
Io Net io-net/fp8 | $0.480/M | $3.40/M | 99.3% | — | — | undefined tokens / undefined tokens |
Venice venice/fp8 | $0.450/M | $3.20/M | 99.3% | — | — | undefined tokens / undefined tokens |
CoreWeave coreweave/fp8 | $0.400/M | $3/M | 98.0% | — | — | undefined tokens / undefined tokens |
