Meta
·Released on 2026年8月9日

Muse Glimmer 30B API 基准测试 价格和服务商数据

选择与 Muse Glimmer 30B 对比的模型

选择一个模型后会直接打开对应的对比页面。

分享到 X
LLM

Muse Glimmer 30B is a dense, open-weight multimodal model from Meta Superintelligence Labs, distilled from Muse Spark and optimized for autonomous agents on consumer hardware. It is suited for long-ho...

质量
#55of 100
57.0
LMSpeed 评分

分类性能

基于独立 benchmark family 的实测能力估计,不确定性单独展示。

覆盖
7 / 8
方法论
V3.0
分类性能基于独立 benchmark family 的实测能力估计,不确定性单独展示。智能体47.7代码46.6综合推理56.1知识43.3数学46.1多语言-多模态46.4指令遵循55.1
#1综合推理56.1估算2/4 实测维度
80% 区间: 45.366.9
abstract logic仅先验
scientific causal54
critpt · critpt / gpqa · aa_gpqa_diamond / hle · aa_hle
multistep constraints仅先验
evidence verification58.2
lcr · lcr
#2指令遵循55.1暂定评分1/4 实测维度
80% 区间: 39.171.1
constraint following仅先验
structured output仅先验
novel instruction generalization55.1
ifbench · if_bench
long multiturn instruction仅先验
#3智能体47.7估算2/4 实测维度
80% 区间: 37.557.9
planning仅先验
tool use48.8
mcp_atlas · mcp_atlas / tau · aa_tau3_banking
environment execution46.5
deep_search_qa · deep_search_qa / gdpval_aa · benchlm_agentic_gdpval_aa / osworld · os_world_verified
recovery reliability仅先验
#4代码46.6正式评分全站排名 #344/4 实测维度
80% 区间: 39.753.5
code generation54.8
scicode · aa_sci_code
repository engineering42
swe_pro · swe_pro
debugging testing49.2
swe_verified · swe_verified
tooling quality40.4
terminalbench · aa_terminal_bench21
#5多模态46.4估算3/4 实测维度
80% 区间: 37.155.8
perception ocr仅先验
document spatial46.8
charxiv · charxiv
visual reasoning42.8
mmmu_pro · mmmu_pro
video action49.7
screenspot · screen_spot_pro
#6数学46.1暂定评分1/4 实测维度
80% 区间: 29.862.4
foundational math仅先验
competition math46.1
aime · aime2026
proof frontier仅先验
applied tool math仅先验
#7知识43.3暂定评分1/4 实测维度
80% 区间: 27.359.3
broad knowledge43.3
aa_omniscience · aa_omniscience_index
professional knowledge仅先验
factuality仅先验
retrieval open book仅先验
暂无数据:多语言

技术规格

Input and output token limits for this model, plus how it ranks on long-context understanding.

INPUT
131.1Ktokens
157.3 pages of text
OUTPUT
131.1Ktokens
8K128K1M4M
131.1K

能力

Technical Details

输入
输出
总参数量
30B
发布日期
Aug 2026
Tokenizer
Other
架构
text+image->text
内容审核
支持参数
frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p

排名

擅长

表现尚可

相对落后

详细分数

更新时间: 2026年8月23日

综合

2 个指标

Overall score57.0#55 / 100SkillsBench44.3#3 / 3
Overall score
站内排名#55
分数57.0
更新时间2026年8月23日
置信度2
SkillsBench
站内排名#3
分数44.3
更新时间2026年8月23日
置信度2

智能体

V3.0

8 个指标 · 估算

分数47.780% 区间37.5–57.92/4 实测维度Agentic score51.7#46 / 69MCP Atlas75.5#11 / 31
维度与证据
规划拆解仅先验
工具调用48.8
2 个基准族 · 2 个指标
mcp_atlas · mcp_atlas · z 0.21 · q 1.00
tau · aa_tau3_banking · z -1.49 · q 1.00
环境与长程执行46.5
3 个基准族 · 3 个指标
deep_search_qa · deep_search_qa · z -0.36 · q 1.00
gdpval_aa · benchlm_agentic_gdpval_aa · z -0.64 · q 1.00
osworld · os_world_verified · z -0.62 · q 1.00
恢复与完成可靠性仅先验
Agentic score
站内排名#46
分数51.7
更新时间2026年8月23日
置信度2
MCP AtlasV3 计分证据
站内排名#11
分数75.5
更新时间2026年8月23日
置信度2
DeepSearchQAV3 计分证据
站内排名#9
分数74.6
更新时间2026年8月23日
置信度2
OSWorld-VerifiedV3 计分证据
站内排名#20
分数65.9
更新时间2026年8月23日
置信度2
AA Agentic Index
站内排名#44
分数22.9
更新时间2026年8月23日
置信度2
GDPval-AA
站内排名#50
分数22.7
更新时间2026年8月23日
置信度2
GDPval-AAV3 计分证据
站内排名#50
分数953.0
更新时间2026年8月23日
置信度2
AA Tau3 BankingV3 计分证据
站内排名#15
分数23.5
更新时间2026年8月23日
置信度2

代码

V3.0

8 个指标 · 正式评分

分数46.6#3480% 区间39.7–53.54/4 实测维度Coding score47.3#62 / 81SWE-bench Pro51.2#44 / 49
维度与证据
代码生成54.8
1 个基准族 · 1 个指标
scicode · aa_sci_code · z 0.50 · q 1.00
仓库工程42
1 个基准族 · 1 个指标
swe_pro · swe_pro · z -1.01 · q 1.00
调试与测试49.2
1 个基准族 · 1 个指标
swe_verified · swe_verified · z -0.16 · q 1.00
工具化开发与质量40.4
1 个基准族 · 1 个指标
terminalbench · aa_terminal_bench21 · z -1.53 · q 1.00
Coding score
站内排名#62
分数47.3
更新时间2026年8月23日
置信度2
SWE-bench ProV3 计分证据
站内排名#44
分数51.2
更新时间2026年8月23日
置信度2
SWE-bench VerifiedV3 计分证据
站内排名#30
分数76.0
更新时间2026年8月23日
置信度2
Terminal-Bench 2.1
站内排名#8
分数51.7
更新时间2026年8月23日
置信度2
SciCodeV3 计分证据
站内排名#9
分数43.6
更新时间2026年8月23日
置信度2
AA Coding Index
站内排名#44
分数49.0
更新时间2026年8月23日
置信度2
AA-SciCodeV3 计分证据
站内排名#52
分数43.6
更新时间2026年8月23日
置信度2
AA Terminal-Bench 2.1V3 计分证据
站内排名#16
分数51.7
更新时间2026年8月20日
置信度2

综合推理

V3.0

2 个指标 · 估算

分数56.180% 区间45.3–66.92/4 实测维度AA-LCR80.0#5 / 100CritPt2.6#53 / 83
维度与证据
抽象逻辑仅先验
科学与因果推理54
3 个基准族 · 3 个指标
critpt · critpt · z -0.03 · q 1.00
gpqa · aa_gpqa_diamond · z 0.39 · q 1.00
hle · aa_hle · z 0.37 · q 1.00
多步约束仅先验
证据整合与验证58.2
1 个基准族 · 1 个指标
lcr · lcr · z 0.73 · q 1.00
AA-LCRV3 计分证据
站内排名#5
分数80.0
更新时间2026年8月23日
置信度2
CritPtV3 计分证据
站内排名#53
分数2.6
更新时间2026年8月23日
置信度2

知识

V3.0

6 个指标 · 暂定评分

分数43.380% 区间27.3–59.31/4 实测维度Artificial Analysis Intelligence Index35.1#62 / 111AA-GPQA Diamond83.5#64 / 108
维度与证据
广泛知识43.3
1 个基准族 · 1 个指标
aa_omniscience · aa_omniscience_index · z -0.98 · q 1.00
专业知识仅先验
事实性仅先验
检索与开放资料运用仅先验
Artificial Analysis Intelligence IndexV3 计分证据
站内排名#62
分数35.1
更新时间2026年8月23日
置信度2
AA-GPQA Diamond
站内排名#64
分数83.5
更新时间2026年8月23日
置信度2
AA-HLE
站内排名#63
分数22.0
更新时间2026年8月23日
置信度2
AA-Omniscience Accuracy
站内排名#59
分数27.0
更新时间2026年8月23日
置信度2
AA-Omniscience Hallucination Rate
站内排名#37
分数81.9
更新时间2026年8月23日
置信度2
AA Openness Index
站内排名#1
分数44.4
更新时间2026年8月23日
置信度2

数学

V3.0

2 个指标 · 暂定评分

分数46.180% 区间29.8–62.41/4 实测维度Math score75.5#13 / 62AIME2694.7#10 / 14
维度与证据
基础数学仅先验
竞赛数学46.1
1 个基准族 · 1 个指标
aime · aime2026 · z -0.52 · q 1.00
高阶证明仅先验
应用与工具辅助数学仅先验
Math score
站内排名#13
分数75.5
更新时间2026年8月23日
置信度2
AIME26V3 计分证据
站内排名#10
分数94.7
更新时间2026年8月23日
置信度2

多语言

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
跨语言理解仅先验
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验

多模态

V3.0

6 个指标 · 估算

分数46.480% 区间37.1–55.83/4 实测维度Multimodal Grounded score48.9#37 / 44CharXiv78.8#21 / 29
维度与证据
感知与 OCR仅先验
文档与空间理解46.8
1 个基准族 · 1 个指标
charxiv · charxiv · z -0.30 · q 1.00
视觉推理42.8
1 个基准族 · 1 个指标
mmmu_pro · mmmu_pro · z -1.02 · q 1.00
视频与落地行动49.7
1 个基准族 · 1 个指标
screenspot · screen_spot_pro · z -0.34 · q 1.00
Multimodal Grounded score
站内排名#37
分数48.9
更新时间2026年8月23日
置信度2
CharXivV3 计分证据
站内排名#21
分数78.8
更新时间2026年8月23日
置信度2
ScreenSpot ProV3 计分证据
站内排名#7
分数75.4
更新时间2026年8月23日
置信度2
OmniDocBench 1.5
站内排名#6
分数75.8
更新时间2026年8月23日
置信度2
MMMU-ProV3 计分证据
站内排名#26
分数74.0
更新时间2026年8月23日
置信度2
AA-MMMU-Pro
站内排名#36
分数74.3
更新时间2026年8月23日
置信度2

指令遵循

V3.0

2 个指标 · 暂定评分

分数55.180% 区间39.1–71.11/4 实测维度Instruction Following score84.5#17 / 25IFBench77.0#8 / 14
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化55.1
1 个基准族 · 1 个指标
ifbench · if_bench · z 0.40 · q 1.00
多轮与长指令仅先验
Instruction Following score
站内排名#17
分数84.5
更新时间2026年8月23日
置信度2
IFBenchV3 计分证据
站内排名#8
分数77.0
更新时间2026年8月23日
置信度2

OpenRouter 端点

5 个端点

来自 OpenRouter 的第三方端点数据,和 LMSpeed 自测数据分开展示。部分 30 分钟实时性能字段需要配置 OpenRouter API key 后同步才会出现。

Provider endpoint输入输出1 天在线率30m 延迟30m 吞吐上下文 / 输出
Parasail
parasail/bf16
$0.300/M$1.10/M100.0%undefined tokens / undefined tokens
DeepInfra
deepinfra/bf16
$0.300/M$1.20/M100.0%undefined tokens / undefined tokens
Phala
phala
$0.300/M$1.10/M99.9%undefined tokens / undefined tokens
Together
together
$0.350/M$1.50/M99.9%undefined tokens / —
Fireworks
fireworks
$0.350/M$1.50/M98.1%undefined tokens / —

排名基于社区提交的测试数据与定期健康探测,仅供参考,非官方数据。标准基准数据可能包含 BenchLM 等公开来源。

通过 API 获取 LMSpeed 数据

免费

免费的大模型价格、基准测试和服务商数据公开 API

  • 实时价格与可用性
  • 速度与延迟基准测试
  • 300+ 模型,600+ 服务商
  • 每天 1,000 次请求
查看 API 文档