Meta
·Released on 2026年8月9日Muse Glimmer 30B API 基准测试 价格和服务商数据
选择与 Muse Glimmer 30B 对比的模型
选择一个模型后会直接打开对应的对比页面。
LLM
Muse Glimmer 30B is a dense, open-weight multimodal model from Meta Superintelligence Labs, distilled from Muse Spark and optimized for autonomous agents on consumer hardware. It is suited for long-ho...
质量
#55of 100
57.0
LMSpeed 评分
分类性能
基于独立 benchmark family 的实测能力估计,不确定性单独展示。
- 覆盖
- 7 / 8
- 方法论
- V3.0
#1综合推理56.1估算2/4 实测维度
80% 区间: 45.3–66.9
abstract logic仅先验
scientific causal54
critpt · critpt / gpqa · aa_gpqa_diamond / hle · aa_hle
multistep constraints仅先验
evidence verification58.2
lcr · lcr
#2指令遵循55.1暂定评分1/4 实测维度
80% 区间: 39.1–71.1
constraint following仅先验
structured output仅先验
novel instruction generalization55.1
ifbench · if_bench
long multiturn instruction仅先验
#3智能体47.7估算2/4 实测维度
80% 区间: 37.5–57.9
planning仅先验
tool use48.8
mcp_atlas · mcp_atlas / tau · aa_tau3_banking
environment execution46.5
deep_search_qa · deep_search_qa / gdpval_aa · benchlm_agentic_gdpval_aa / osworld · os_world_verified
recovery reliability仅先验
#4代码46.6正式评分全站排名 #344/4 实测维度
80% 区间: 39.7–53.5
code generation54.8
scicode · aa_sci_code
repository engineering42
swe_pro · swe_pro
debugging testing49.2
swe_verified · swe_verified
tooling quality40.4
terminalbench · aa_terminal_bench21
#5多模态46.4估算3/4 实测维度
80% 区间: 37.1–55.8
perception ocr仅先验
document spatial46.8
charxiv · charxiv
visual reasoning42.8
mmmu_pro · mmmu_pro
video action49.7
screenspot · screen_spot_pro
#6数学46.1暂定评分1/4 实测维度
80% 区间: 29.8–62.4
foundational math仅先验
competition math46.1
aime · aime2026
proof frontier仅先验
applied tool math仅先验
#7知识43.3暂定评分1/4 实测维度
80% 区间: 27.3–59.3
broad knowledge43.3
aa_omniscience · aa_omniscience_index
professional knowledge仅先验
factuality仅先验
retrieval open book仅先验
暂无数据:多语言
技术规格
Input and output token limits for this model, plus how it ranks on long-context understanding.
INPUT
131.1Ktokens
≈ 157.3 pages of text
OUTPUT
131.1Ktokens
8K128K1M4M
131.1K
能力
Technical Details
- 输入
- 输出
- 总参数量
- 30B
- 发布日期
- Aug 2026
- Tokenizer
- Other
- 架构
- text+image->text
- 内容审核
- 否
- 支持参数
- frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p
排名
擅长
表现尚可
相对落后
详细分数
更新时间: 2026年8月23日综合
2 个指标
Overall score57.0#55 / 100SkillsBench44.3#3 / 3
综合
2 个指标
基准
站内排名
分数
来源
更新时间
置信度
智能体
V3.08 个指标 · 估算
分数47.780% 区间37.5–57.92/4 实测维度Agentic score51.7#46 / 69MCP Atlas75.5#11 / 31
智能体
V3.08 个指标 · 估算
维度与证据
规划拆解仅先验
工具调用48.8
2 个基准族 · 2 个指标
mcp_atlas · mcp_atlas · z 0.21 · q 1.00
tau · aa_tau3_banking · z -1.49 · q 1.00
环境与长程执行46.5
3 个基准族 · 3 个指标
deep_search_qa · deep_search_qa · z -0.36 · q 1.00
gdpval_aa · benchlm_agentic_gdpval_aa · z -0.64 · q 1.00
osworld · os_world_verified · z -0.62 · q 1.00
恢复与完成可靠性仅先验
基准
站内排名
分数
来源
更新时间
置信度
代码
V3.08 个指标 · 正式评分
分数46.6#3480% 区间39.7–53.54/4 实测维度Coding score47.3#62 / 81SWE-bench Pro51.2#44 / 49
代码
V3.08 个指标 · 正式评分
维度与证据
代码生成54.8
1 个基准族 · 1 个指标
scicode · aa_sci_code · z 0.50 · q 1.00
仓库工程42
1 个基准族 · 1 个指标
swe_pro · swe_pro · z -1.01 · q 1.00
调试与测试49.2
1 个基准族 · 1 个指标
swe_verified · swe_verified · z -0.16 · q 1.00
工具化开发与质量40.4
1 个基准族 · 1 个指标
terminalbench · aa_terminal_bench21 · z -1.53 · q 1.00
基准
站内排名
分数
来源
更新时间
置信度
综合推理
V3.02 个指标 · 估算
分数56.180% 区间45.3–66.92/4 实测维度AA-LCR80.0#5 / 100CritPt2.6#53 / 83
综合推理
V3.02 个指标 · 估算
维度与证据
抽象逻辑仅先验
科学与因果推理54
3 个基准族 · 3 个指标
critpt · critpt · z -0.03 · q 1.00
gpqa · aa_gpqa_diamond · z 0.39 · q 1.00
hle · aa_hle · z 0.37 · q 1.00
多步约束仅先验
证据整合与验证58.2
1 个基准族 · 1 个指标
lcr · lcr · z 0.73 · q 1.00
基准
站内排名
分数
来源
更新时间
置信度
知识
V3.06 个指标 · 暂定评分
分数43.380% 区间27.3–59.31/4 实测维度Artificial Analysis Intelligence Index35.1#62 / 111AA-GPQA Diamond83.5#64 / 108
知识
V3.06 个指标 · 暂定评分
维度与证据
广泛知识43.3
1 个基准族 · 1 个指标
aa_omniscience · aa_omniscience_index · z -0.98 · q 1.00
专业知识仅先验
事实性仅先验
检索与开放资料运用仅先验
基准
站内排名
分数
来源
更新时间
置信度
数学
V3.02 个指标 · 暂定评分
分数46.180% 区间29.8–62.41/4 实测维度Math score75.5#13 / 62AIME2694.7#10 / 14
数学
V3.02 个指标 · 暂定评分
维度与证据
基础数学仅先验
竞赛数学46.1
1 个基准族 · 1 个指标
aime · aime2026 · z -0.52 · q 1.00
高阶证明仅先验
应用与工具辅助数学仅先验
基准
站内排名
分数
来源
更新时间
置信度
多语言
V3.00 个指标 · 暂无数据
暂无数据80% 区间30.8–69.20/4 实测维度
多语言
V3.00 个指标 · 暂无数据
维度与证据
跨语言理解仅先验
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验
多模态
V3.06 个指标 · 估算
分数46.480% 区间37.1–55.83/4 实测维度Multimodal Grounded score48.9#37 / 44CharXiv78.8#21 / 29
多模态
V3.06 个指标 · 估算
维度与证据
感知与 OCR仅先验
文档与空间理解46.8
1 个基准族 · 1 个指标
charxiv · charxiv · z -0.30 · q 1.00
视觉推理42.8
1 个基准族 · 1 个指标
mmmu_pro · mmmu_pro · z -1.02 · q 1.00
视频与落地行动49.7
1 个基准族 · 1 个指标
screenspot · screen_spot_pro · z -0.34 · q 1.00
基准
站内排名
分数
来源
更新时间
置信度
指令遵循
V3.02 个指标 · 暂定评分
分数55.180% 区间39.1–71.11/4 实测维度Instruction Following score84.5#17 / 25IFBench77.0#8 / 14
指令遵循
V3.02 个指标 · 暂定评分
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化55.1
1 个基准族 · 1 个指标
ifbench · if_bench · z 0.40 · q 1.00
多轮与长指令仅先验
基准
站内排名
分数
来源
更新时间
置信度
OpenRouter 端点
5 个端点来自 OpenRouter 的第三方端点数据,和 LMSpeed 自测数据分开展示。部分 30 分钟实时性能字段需要配置 OpenRouter API key 后同步才会出现。
| Provider endpoint | 输入 | 输出 | 1 天在线率 | 30m 延迟 | 30m 吞吐 | 上下文 / 输出 |
|---|---|---|---|---|---|---|
Parasail parasail/bf16 | $0.300/M | $1.10/M | 100.0% | — | — | undefined tokens / undefined tokens |
DeepInfra deepinfra/bf16 | $0.300/M | $1.20/M | 100.0% | — | — | undefined tokens / undefined tokens |
Phala phala | $0.300/M | $1.10/M | 99.9% | — | — | undefined tokens / undefined tokens |
Together together | $0.350/M | $1.50/M | 99.9% | — | — | undefined tokens / — |
Fireworks fireworks | $0.350/M | $1.50/M | 98.1% | — | — | undefined tokens / — |
