Arcee AI
·Released on 2026年4月1日

Trinity Large Thinking API 基准测试 价格和服务商数据

选择与 Trinity Large Thinking 对比的模型

选择一个模型后会直接打开对应的对比页面。

分享到 X
LLM

页面同时展示实测速度和首字延迟。

Trinity Large Thinking is a powerful open source reasoning model from the team at Arcee AI. It shows strong performance in PinchBench, agentic workloads, and reasoning tasks. Launch video: https://you...

质量
0.0
LMSpeed 评分
速度
#13of 74
108char/s
1.94 s

分类性能

基于独立 benchmark family 的实测能力估计,不确定性单独展示。

覆盖
5 / 8
方法论
V3.0
分类性能基于独立 benchmark family 的实测能力估计,不确定性单独展示。智能体43.9代码49.7综合推理44.4知识56.4数学-多语言-多模态-指令遵循48.2
#1知识56.4暂定评分1/4 实测维度
80% 区间: 40.472.4
broad knowledge56.4
aa_omniscience · artificial_analysis
professional knowledge仅先验
factuality仅先验
retrieval open book仅先验
#2代码49.7暂定评分1/4 实测维度
80% 区间: 33.765.7
code generation49.7
scicode · scicode
repository engineering仅先验
debugging testing仅先验
tooling quality仅先验
#3指令遵循48.2暂定评分1/4 实测维度
80% 区间: 32.264.2
constraint following仅先验
structured output仅先验
novel instruction generalization48.2
ifbench · aa_if_bench
long multiturn instruction仅先验
#4综合推理44.4估算2/4 实测维度
80% 区间: 33.655.2
abstract logic仅先验
scientific causal49.6
critpt · critpt / gpqa · gpqa / hle · hle
multistep constraints仅先验
evidence verification39.2
lcr · lcr
#5智能体43.9估算3/4 实测维度
80% 区间: 34.653.2
planning41.3
deep_planning · gert_labs
tool use52.5
tau · tau2_bench
environment execution38
gdpval_aa · benchlm_agentic_gdpval_aa
recovery reliability仅先验
暂无数据:数学多语言多模态

技术规格

Input and output token limits for this model, plus how it ranks on long-context understanding.

INPUT
262.1Ktokens
314.6 pages of text
OUTPUT
262.1Ktokens
8K128K1M4M
262.1K

能力

Technical Details

输入
输出
发布日期
Apr 2026
Tokenizer
Other
架构
text->text
内容审核
支持参数
frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokenspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p

排名

擅长

表现尚可

相对落后

详细分数

更新时间: 2026年8月25日

速度与延迟

2 个指标

输出速度180.3 tok/s#13 / 74首字延迟0.67 s#15 / 74
输出速度
Output speed
站内排名#13
分数180.3 tok/s
更新时间2026年8月25日
置信度4
首字延迟
Time to first token
站内排名#15
分数0.67 s
更新时间2026年8月25日
置信度4

价格

2 个指标

输入价格$0.235/M#42 / 179输出价格$0.875/M#40 / 179
输入价格
Input price
站内排名#42
分数$0.235/M
更新时间2026年8月25日
置信度4
输出价格
Output price
站内排名#40
分数$0.875/M
更新时间2026年8月25日
置信度4

智能体

V3.0

5 个指标 · 估算

分数43.980% 区间34.6–53.23/4 实测维度Τ²-bench results90.1#34 / 82Gert Labs32.5#44 / 49
维度与证据
规划拆解41.3
1 个基准族 · 1 个指标
deep_planning · gert_labs · z -1.15 · q 1.00
工具调用52.5
1 个基准族 · 1 个指标
tau · tau2_bench · z 0.21 · q 1.00
环境与长程执行38
1 个基准族 · 1 个指标
gdpval_aa · benchlm_agentic_gdpval_aa · z -1.78 · q 1.00
恢复与完成可靠性仅先验
Τ²-bench resultsV3 计分证据
站内排名#34
分数90.1
更新时间2026年8月20日
置信度1
Gert LabsV3 计分证据
站内排名#44
分数32.5
更新时间2026年8月20日
置信度1
GDPval-AA
站内排名#59
分数3.1
更新时间2026年8月20日
置信度1
GDPval-AAV3 计分证据
站内排名#59
分数563.0
更新时间2026年8月20日
置信度1
AA Agentic Index
站内排名#57
分数3.7
更新时间2026年8月20日
置信度1

代码

V3.0

4 个指标 · 暂定评分

分数49.780% 区间33.7–65.71/4 实测维度SciCode36.1%#118 / 204SWE-bench Verified*63.2#5 / 5
维度与证据
代码生成49.7
1 个基准族 · 1 个指标
scicode · scicode · z -0.19 · q 1.00
仓库工程仅先验
调试与测试仅先验
工具化开发与质量仅先验
SciCodeV3 计分证据
站内排名#118
分数36.1%
更新时间2026年8月25日
置信度4
SWE-bench Verified*
站内排名#5
分数63.2
更新时间2026年8月20日
置信度1
AA-SciCodeV3 计分证据
站内排名#85
分数36.1
更新时间2026年8月20日
置信度1
AA Coding Index
站内排名#58
分数25.8
更新时间2026年8月20日
置信度1

综合推理

V3.0

4 个指标 · 估算

分数44.480% 区间33.6–55.22/4 实测维度GPQA75.2%#113 / 211HLE15.8%#93 / 208
维度与证据
抽象逻辑仅先验
科学与因果推理49.6
3 个基准族 · 3 个指标
critpt · critpt · z -0.47 · q 1.00
gpqa · gpqa · z -0.09 · q 1.00
hle · hle · z 0.10 · q 1.00
多步约束仅先验
证据整合与验证39.2
1 个基准族 · 1 个指标
lcr · lcr · z -1.80 · q 1.00
GPQAV3 计分证据
站内排名#113
分数75.2%
更新时间2026年8月25日
置信度4
HLEV3 计分证据
站内排名#93
分数15.8%
更新时间2026年8月25日
置信度4
AA-LCRV3 计分证据
站内排名#88
分数38.3
更新时间2026年8月20日
置信度1
CritPtV3 计分证据
站内排名#70
分数0.9
更新时间2026年8月20日
置信度1

知识

V3.0

7 个指标 · 暂定评分

分数56.480% 区间40.4–72.41/4 实测维度GPQA-D76.3#31 / 31MMLU-Pro (Arcee)83.4#4 / 5
维度与证据
广泛知识56.4
1 个基准族 · 1 个指标
aa_omniscience · artificial_analysis · z 0.77 · q 1.00
专业知识仅先验
事实性仅先验
检索与开放资料运用仅先验
GPQA-D
站内排名#31
分数76.3
更新时间2026年8月20日
置信度1
MMLU-Pro (Arcee)
站内排名#4
分数83.4
更新时间2026年8月20日
置信度1
Artificial Analysis Intelligence IndexV3 计分证据
站内排名#89
分数18.7
更新时间2026年8月20日
置信度1
AA-GPQA Diamond
站内排名#80
分数75.2
更新时间2026年8月20日
置信度1
AA-HLE
站内排名#71
分数15.8
更新时间2026年8月20日
置信度1
AA-Omniscience Accuracy
站内排名#78
分数22.5
更新时间2026年8月19日
置信度1
AA-Omniscience Hallucination Rate
站内排名#29
分数85.9
更新时间2026年8月19日
置信度1

数学

V3.0

1 个指标 · 暂无数据

80% 区间30.8–69.20/4 实测维度AIME25 (Arcee)96.3#2 / 5
维度与证据
基础数学仅先验
竞赛数学仅先验
高阶证明仅先验
应用与工具辅助数学仅先验
AIME25 (Arcee)
站内排名#2
分数96.3
更新时间2026年8月19日
置信度1

多语言

V3.0

0 个指标 · 暂无数据

暂无数据80% 区间30.8–69.20/4 实测维度
维度与证据
跨语言理解仅先验
多语言生成仅先验
推理迁移仅先验
低资源鲁棒性仅先验

多模态

V3.0

1 个指标 · 暂无数据

80% 区间30.8–69.20/4 实测维度Design Arena Website1148.0#59 / 75
维度与证据
感知与 OCR仅先验
文档与空间理解仅先验
视觉推理仅先验
视频与落地行动仅先验
Design Arena Website
站内排名#59
分数1148.0
更新时间2026年8月20日
置信度1

指令遵循

V3.0

1 个指标 · 暂定评分

分数48.280% 区间32.2–64.21/4 实测维度AA-IFBench56.3#53 / 84
维度与证据
约束遵循仅先验
结构化输出仅先验
新指令泛化48.2
1 个基准族 · 1 个指标
ifbench · aa_if_bench · z -0.52 · q 1.00
多轮与长指令仅先验
AA-IFBenchV3 计分证据
站内排名#53
分数56.3
更新时间2026年8月19日
置信度1

OpenRouter 端点

2 个端点

来自 OpenRouter 的第三方端点数据,和 LMSpeed 自测数据分开展示。部分 30 分钟实时性能字段需要配置 OpenRouter API key 后同步才会出现。

Provider endpoint输入输出1 天在线率30m 延迟30m 吞吐上下文 / 输出
Parasail
parasail/fp4
$0.220/M$0.850/M100.0%undefined tokens / undefined tokens
Arcee AI
arcee-ai
$0.250/M$0.800/M99.5%undefined tokens / undefined tokens

替代方案与相似模型

别名

arcee-ai/trinity-large-thinkingarcee-ai/trinity-large-thinking:freekilo/trinity-large-thinkingtrinity-large-thinking

排名基于社区提交的测试数据与定期健康探测,仅供参考,非官方数据。标准基准数据可能包含 BenchLM 等公开来源。

通过 API 获取 LMSpeed 数据

免费

免费的大模型价格、基准测试和服务商数据公开 API

  • 实时价格与可用性
  • 速度与延迟基准测试
  • 300+ 模型,600+ 服务商
  • 每天 1,000 次请求
查看 API 文档