Qwen
·Released on 2025年7月21日Qwen3 235B A22B Instruct 2507 API 基准测试 价格和服务商数据
选择与 Qwen3 235B A22B Instruct 2507 对比的模型
选择一个模型后会直接打开对应的对比页面。
LLM
Qwen3-235B-A22B-Instruct-2507 is a multilingual, instruction-tuned mixture-of-experts language model based on the Qwen3-235B architecture, with 22B active parameters per forward pass. It is optimized ...
分类性能
基于独立 benchmark family 的实测能力估计,不确定性单独展示。
- 覆盖
- 3 / 8
- 方法论
- V3.0
#1数学62.9估算2/4 实测维度
80% 区间: 51.1–74.7
foundational math62.1
math_500 · math_500
competition math63.7
aime · aime
proof frontier仅先验
applied tool math仅先验
#2代码55.5暂定评分1/4 实测维度
80% 区间: 41.5–69.4
code generation55.5
livecodebench · livecodebench / scicode · scicode
repository engineering仅先验
debugging testing仅先验
tooling quality仅先验
#3综合推理53.6估算2/4 实测维度
80% 区间: 42.5–64.7
abstract logic仅先验
scientific causal51.8
gpqa · gpqa / hle · hle
multistep constraints55.5
mmlu_pro · mmlu_pro
evidence verification仅先验
暂无数据:智能体知识多语言多模态指令遵循
技术规格
Input and output token limits for this model, plus how it ranks on long-context understanding.
INPUT
262.1Ktokens
≈ 314.6 pages of text
OUTPUT
16.4Ktokens
8K128K1M4M
262.1K
能力
排名
擅长
详细分数
更新时间: 2026年8月23日价格
2 个指标
输入价格$0.230/M#42 / 180输出价格$2.30/M#82 / 180
价格
2 个指标
基准
站内排名
分数
来源
更新时间
置信度
智能体
V3.00 个指标 · 暂无数据
暂无数据80% 区间30.8–69.20/4 实测维度
智能体
V3.00 个指标 · 暂无数据
维度与证据
规划拆解仅先验
工具调用仅先验
环境与长程执行仅先验
恢复与完成可靠性仅先验
代码
V3.02 个指标 · 暂定评分
分数55.580% 区间41.5–69.41/4 实测维度LiveCodeBench78.8%#21 / 115SciCode42.4%#62 / 204
代码
V3.02 个指标 · 暂定评分
维度与证据
代码生成55.5
2 个基准族 · 2 个指标
livecodebench · livecodebench · z 0.90 · q 1.00
scicode · scicode · z 0.39 · q 1.00
仓库工程仅先验
调试与测试仅先验
工具化开发与质量仅先验
基准
站内排名
分数
来源
更新时间
置信度
综合推理
V3.03 个指标 · 估算
分数53.680% 区间42.5–64.72/4 实测维度MMLU-Pro84.3%#33 / 129GPQA79.0%#94 / 211
综合推理
V3.03 个指标 · 估算
维度与证据
抽象逻辑仅先验
科学与因果推理51.8
2 个基准族 · 2 个指标
gpqa · gpqa · z 0.11 · q 1.00
hle · hle · z 0.11 · q 1.00
多步约束55.5
1 个基准族 · 1 个指标
mmlu_pro · mmlu_pro · z 0.53 · q 1.00
证据整合与验证仅先验
基准
站内排名
分数
来源
更新时间
置信度
知识
V3.00 个指标 · 暂无数据
暂无数据80% 区间30.8–69.20/4 实测维度
知识
V3.00 个指标 · 暂无数据
维度与证据
广泛知识仅先验
专业知识仅先验
事实性仅先验
检索与开放资料运用仅先验
数学
V3.02 个指标 · 估算
分数62.980% 区间51.1–74.72/4 实测维度AIME94.0%#1 / 68MATH-50098.4%#5 / 73
数学
V3.02 个指标 · 估算
维度与证据
基础数学62.1
1 个基准族 · 1 个指标
math_500 · math_500 · z 1.65 · q 1.00
竞赛数学63.7
1 个基准族 · 1 个指标
aime · aime · z 1.80 · q 1.00
高阶证明仅先验
应用与工具辅助数学仅先验
基准
站内排名
分数
来源
更新时间
置信度
多语言
V3.00 个指标 · 暂无数据
暂无数据80% 区间30.8–69.20/4 实测维度
多语言
V3.00 个指标 · 暂无数据
维度与证据
跨语言理解仅先验
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验
多模态
V3.00 个指标 · 暂无数据
暂无数据80% 区间30.8–69.20/4 实测维度
多模态
V3.00 个指标 · 暂无数据
维度与证据
感知与 OCR仅先验
文档与空间理解仅先验
视觉推理仅先验
视频与落地行动仅先验
指令遵循
V3.00 个指标 · 暂无数据
暂无数据80% 区间30.8–69.20/4 实测维度
指令遵循
V3.00 个指标 · 暂无数据
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化仅先验
多轮与长指令仅先验
OpenRouter 端点
10 个端点来自 OpenRouter 的第三方端点数据,和 LMSpeed 自测数据分开展示。部分 30 分钟实时性能字段需要配置 OpenRouter API key 后同步才会出现。
| Provider endpoint | 输入 | 输出 | 1 天在线率 | 30m 延迟 | 30m 吞吐 | 上下文 / 输出 |
|---|---|---|---|---|---|---|
Google google-vertex/us-south1 | $0.220/M | $0.880/M | 100.0% | — | — | undefined tokens / undefined tokens |
Alibaba alibaba | $0.150/M | $0.598/M | 99.9% | — | — | undefined tokens / undefined tokens |
Parasail parasail/fp8 | $0.140/M | $0.800/M | 99.9% | — | — | undefined tokens / undefined tokens |
StreamLake streamlake | $0.210/M | $0.840/M | 99.7% | — | — | undefined tokens / undefined tokens |
Novita novita/fp8 | $0.090/M | $0.580/M | 99.6% | — | — | undefined tokens / undefined tokens |
GMICloud gmicloud/fp8 | $0.087/M | $0.350/M | 99.5% | — | — | undefined tokens / — |
AtlasCloud atlas-cloud/fp8 | $0.200/M | $0.880/M | 99.5% | — | — | undefined tokens / undefined tokens |
DeepInfra deepinfra/fp8 | $0.090/M | $0.550/M | 99.1% | — | — | undefined tokens / undefined tokens |
Venice venice/fp8 | $0.150/M | $0.750/M | 98.2% | — | — | undefined tokens / undefined tokens |
Nebius nebius/fp8 | $0.200/M | $0.600/M | 98.1% | — | — | undefined tokens / — |
