Meta
·Released on 2026年7月16日

Muse Spark 1.1 API 基准测试 价格和服务商数据

选择与 Muse Spark 1.1 对比的模型

选择一个模型后会直接打开对应的对比页面。

分享到 X
LLM

Muse Spark 1.1 is a multimodal reasoning model from Meta, built for agentic tasks. It accepts text, images, video, audio, and PDF documents and returns text, with a 1M-token context...

质量
#14of 112
72.0
LMSpeed 评分

分类性能

基于独立 benchmark family 的实测能力估计,不确定性单独展示。

覆盖
5 / 8
方法论
V3.0
分类性能基于独立 benchmark family 的实测能力估计,不确定性单独展示。智能体61.6代码58综合推理57.5知识63.3数学-多语言-多模态56.5指令遵循-
#1知识63.3暂定评分1/4 实测维度
80% 区间: 49.377.3
broad knowledge63.3
aa_omniscience · aa_omniscience_index / benchlm_category_knowledge · benchlm_category_knowledge
professional knowledge仅先验
factuality仅先验
retrieval open book仅先验
#2智能体61.6正式评分全站排名 #103/4 实测维度
80% 区间: 54.268.9
planning仅先验
tool use77.1
mcp_atlas · mcp_atlas / toolathlon · toolathlon
environment execution59.7
deep_search_qa · deep_search_qa / enterprise_ops_gym · aa_enterprise_ops_gym / gdpval_aa · benchlm_agentic_gdpval_aa / osworld · os_world2 / osworld · os_world_verified / terminalbench · benchlm_agentic_terminal_bench2
recovery reliability48
cyber_gym · cyber_gym / exploit_gym · exploit_gym / harvey_lab · aa_harvey_lab / jobbench · job_bench
#3代码58估算3/4 实测维度
80% 区间: 48.867.3
code generation62.8
scicode · scicode
repository engineering55.1
swe_pro · swe_pro
debugging testing仅先验
tooling quality56.2
terminalbench · benchlm_coding_terminal_bench2
#4综合推理57.5估算2/4 实测维度
80% 区间: 47.467.7
abstract logic仅先验
scientific causal61.5
critpt · critpt / gpqa · gpqa / hle · hle / hle · hle_no_tools
multistep constraints仅先验
evidence verification53.5
lcr · lcr / mrcr · mrcr1m
#5多模态56.5暂定评分1/4 实测维度
80% 区间: 40.472.6
perception ocr仅先验
document spatial56.5
charxiv · charxiv
visual reasoning仅先验
video action仅先验
暂无数据:数学多语言指令遵循

技术规格

Input and output token limits for this model, plus how it ranks on long-context understanding.

INPUT
1.0Mtokens
1.3K pages of text
OUTPUT
943.7Ktokens
8K128K1M4M
1.0M

能力

Technical Details

输入
输出
发布日期
Jul 2026
官方文档
Tokenizer
Other
架构
text+image+file+audio+video->text
内容审核
支持参数
include_reasoningmax_tokensreasoningreasoning_effortrepetition_penaltyresponse_formatstructured_outputstemperaturetool_choicetoolstop_ktop_p

排名

擅长

表现尚可

相对落后

详细分数

更新时间: 2026年9月13日

综合

2 个指标

Overall score72.0#14 / 112DeepSWE53.3#17 / 21
Overall score
站内排名#14
分数72.0
更新时间2026年9月13日
置信度3
DeepSWE
站内排名#17
分数53.3
更新时间2026年9月10日
置信度3

价格

2 个指标

输入价格$1.25/M#123 / 186输出价格$4.25/M#116 / 186
输入价格
Input price
站内排名#123
分数$1.25/M
更新时间2026年9月13日
置信度4
输出价格
Output price
站内排名#116
分数$4.25/M
更新时间2026年9月13日
置信度4

智能体

V3.0

21 个指标 · 正式评分

分数61.6#1080% 区间54.2–68.93/4 实测维度Agentic score76.1#24 / 77Terminal-Bench 2.080.0#10 / 53
维度与证据
规划拆解仅先验
工具调用77.1
2 个基准族 · 2 个指标
mcp_atlas · mcp_atlas · z 1.81 · q 1.00
toolathlon · toolathlon · z 3.00 · q 1.00
环境与长程执行59.7
5 个基准族 · 6 个指标
deep_search_qa · deep_search_qa · z 0.11 · q 1.00
enterprise_ops_gym · aa_enterprise_ops_gym · z 0.44 · q 1.00
gdpval_aa · benchlm_agentic_gdpval_aa · z 0.53 · q 1.00
osworld · os_world2 · z -0.30 · q 1.00
osworld · os_world_verified · z 0.80 · q 1.00
terminalbench · benchlm_agentic_terminal_bench2 · z 1.21 · q 1.00
恢复与完成可靠性48
4 个基准族 · 4 个指标
cyber_gym · cyber_gym · z -1.60 · q 1.00
exploit_gym · exploit_gym · z -2.81 · q 0.58
harvey_lab · aa_harvey_lab · z 0.58 · q 1.00
jobbench · job_bench · z 1.00 · q 1.00
Agentic score
站内排名#24
分数76.1
更新时间2026年9月13日
置信度3
Terminal-Bench 2.0V3 计分证据
站内排名#10
分数80.0
更新时间2026年9月13日
置信度3
MCP AtlasV3 计分证据
站内排名#1
分数88.1
更新时间2026年9月13日
置信度3
ToolathlonV3 计分证据
站内排名#1
分数75.6
更新时间2026年9月13日
置信度3
OSWorld-VerifiedV3 计分证据
站内排名#7
分数80.8
更新时间2026年9月13日
置信度3
DeepSearchQAV3 计分证据
站内排名#7
分数84.9
更新时间2026年9月13日
置信度3
CyberGymV3 计分证据
站内排名#13
分数59.0
更新时间2026年9月13日
置信度3
Finance Agent v2
站内排名#3
分数57.2
更新时间2026年9月13日
置信度3
OSWorld 2.0V3 计分证据
站内排名#13
分数14.2
更新时间2026年9月13日
置信度3
JobBenchV3 计分证据
站内排名#2
分数54.7
更新时间2026年9月13日
置信度3
Cybench
站内排名#1
分数92.9
更新时间2026年9月13日
置信度3
ExploitGymV3 计分证据
站内排名#7
分数0.8
更新时间2026年9月13日
置信度3
AA Agentic Index
站内排名#31
分数27.5
更新时间2026年9月13日
置信度3
GDPval-AA
站内排名#28
分数39.7
更新时间2026年9月13日
置信度3
GDPval-AAV3 计分证据
站内排名#24
分数1375.0
更新时间2026年9月13日
置信度3
WebArena-Verified
站内排名#1
分数69.0
更新时间2026年9月13日
置信度3
Terminal-Bench 2.1 (Vals)
站内排名#19
分数69.3
更新时间2026年9月13日
置信度3
Benchlm_agentic_deep_swe
站内排名#1
分数53.3
更新时间2026年9月13日
置信度3
AA Harvey LABV3 计分证据
站内排名#4
分数93.1
更新时间2026年8月28日
置信度2
AA EnterpriseOps-GymV3 计分证据
站内排名#7
分数47.2
更新时间2026年8月28日
置信度2
AA AutomationBench
站内排名#17
分数42.8
更新时间2026年8月20日
置信度2

代码

V3.0

8 个指标 · 估算

分数5880% 区间48.8–67.33/4 实测维度SciCode58.8%#5 / 89Coding score56.6#34 / 87
维度与证据
代码生成62.8
1 个基准族 · 1 个指标
scicode · scicode · z 1.53 · q 1.00
仓库工程55.1
1 个基准族 · 1 个指标
swe_pro · swe_pro · z 0.78 · q 1.00
调试与测试仅先验
工具化开发与质量56.2
1 个基准族 · 1 个指标
terminalbench · benchlm_coding_terminal_bench2 · z 0.85 · q 1.00
SciCodeV3 计分证据
站内排名#5
分数58.8%
更新时间2026年9月13日
置信度4
Coding score
站内排名#34
分数56.6
更新时间2026年9月13日
置信度3
Terminal-Bench 2.0V3 计分证据
站内排名#9
分数80.0
更新时间2026年9月13日
置信度3
SWE-bench ProV3 计分证据
站内排名#14
分数61.5
更新时间2026年9月13日
置信度3
AA Coding Index
站内排名#20
分数71.3
更新时间2026年9月13日
置信度3
AA-SciCodeV3 计分证据
站内排名#4
分数58.8
更新时间2026年9月13日
置信度3
LiveCodeBench (Vals)
站内排名#18
分数85.9
更新时间2026年9月13日
置信度3
SWE-bench (Vals)
站内排名#18
分数82.0
更新时间2026年9月13日
置信度3

综合推理

V3.0

6 个指标 · 估算

分数57.580% 区间47.4–67.72/4 实测维度GPQA89.8%#37 / 218HLE46.2%#14 / 216
维度与证据
抽象逻辑仅先验
科学与因果推理61.5
3 个基准族 · 4 个指标
critpt · critpt · z 0.66 · q 1.00
gpqa · gpqa · z 0.86 · q 1.00
hle · hle · z 1.03 · q 1.00
hle · hle_no_tools · z 1.04 · q 1.00
多步约束仅先验
证据整合与验证53.5
2 个基准族 · 2 个指标
lcr · lcr · z 0.28 · q 1.00
mrcr · mrcr1m · z 0.17 · q 0.75
GPQAV3 计分证据
站内排名#37
分数89.8%
更新时间2026年9月13日
置信度4
HLEV3 计分证据
站内排名#14
分数46.2%
更新时间2026年9月13日
置信度4
MRCR 1MV3 计分证据
站内排名#5
分数54.1
更新时间2026年9月13日
置信度3
AA-LCRV3 计分证据
站内排名#37
分数77.7
更新时间2026年9月13日
置信度3
CritPtV3 计分证据
站内排名#26
分数15.1
更新时间2026年9月13日
置信度3
Reasoning score
站内排名#25
分数74.4
更新时间2026年9月13日
置信度3

知识

V3.0

11 个指标 · 暂定评分

分数63.380% 区间49.3–77.31/4 实测维度Knowledge score90.6#3 / 83HLE w/o tools52.2#3 / 22
维度与证据
广泛知识63.3
2 个基准族 · 2 个指标
aa_omniscience · aa_omniscience_index · z 1.06 · q 1.00
benchlm_category_knowledge · benchlm_category_knowledge · z 1.25 · q 1.00
专业知识仅先验
事实性仅先验
检索与开放资料运用仅先验
Knowledge scoreV3 计分证据
站内排名#3
分数90.6
更新时间2026年9月13日
置信度3
HLE w/o tools
站内排名#3
分数52.2
更新时间2026年9月13日
置信度3
HealthBench Professional
站内排名#4
分数59.3
更新时间2026年9月13日
置信度3
Artificial Analysis Intelligence IndexV3 计分证据
站内排名#40
分数34.3
更新时间2026年9月13日
置信度3
AA-GPQA Diamond
站内排名#36
分数89.8
更新时间2026年9月13日
置信度3
AA-HLE
站内排名#12
分数46.2
更新时间2026年9月13日
置信度3
AA-Omniscience IndexV3 计分证据
站内排名#9
分数28.1
更新时间2026年9月13日
置信度3
AA-Omniscience Accuracy
站内排名#12
分数52.1
更新时间2026年9月13日
置信度3
AA-Omniscience Hallucination Rate
站内排名#78
分数50.0
更新时间2026年9月13日
置信度3
GPQA Diamond (Vals)
站内排名#19
分数91.2
更新时间2026年9月13日
置信度3
MMLU-Pro (Vals)
站内排名#14
分数88.7
更新时间2026年9月13日
置信度3

数学

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
基础数学仅先验
竞赛数学仅先验
高阶证明仅先验
应用与工具辅助数学仅先验

多语言

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
跨语言理解仅先验
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验

多模态

V3.0

4 个指标 · 暂定评分

分数56.580% 区间40.4–72.61/4 实测维度Multimodal Grounded score77.5#16 / 56CharXiv88.4#8 / 30
维度与证据
感知与 OCR仅先验
文档与空间理解56.5
1 个基准族 · 1 个指标
charxiv · charxiv · z 1.01 · q 1.00
视觉推理仅先验
视频与落地行动仅先验
Multimodal Grounded score
站内排名#16
分数77.5
更新时间2026年9月13日
置信度3
CharXivV3 计分证据
站内排名#8
分数88.4
更新时间2026年9月13日
置信度3
BabyVision
站内排名#2
分数76.3
更新时间2026年9月13日
置信度3
Design Arena Website
站内排名#22
分数1282.0
更新时间2026年9月13日
置信度3

指令遵循

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化仅先验
多轮与长指令仅先验

OpenRouter 端点

1 个端点

来自 OpenRouter 的第三方端点数据,和 LMSpeed 自测数据分开展示。部分 30 分钟实时性能字段需要配置 OpenRouter API key 后同步才会出现。

Provider endpoint输入输出1 天在线率30m 延迟30m 吞吐上下文 / 输出
Meta
meta
$1.25/M$4.25/M100%undefined tokens / undefined tokens

替代方案与相似模型

别名

meta/muse-spark-1.1muse-spark-1.1

排名基于社区提交的测试数据与定期健康探测,仅供参考,非官方数据。标准基准数据可能包含 BenchLM 等公开来源。

通过 API 获取 LMSpeed 数据

免费

免费的大模型价格、基准测试和服务商数据公开 API

  • 实时价格与可用性
  • 速度与延迟基准测试
  • 300+ 模型,600+ 服务商
  • 每天 1,000 次请求
查看 API 文档