Trinity Large Thinking API 基准测试 价格和服务商数据
选择与 Trinity Large Thinking 对比的模型
选择一个模型后会直接打开对应的对比页面。
页面同时展示实测速度和首字延迟。
Trinity Large Thinking is a powerful open source reasoning model from the team at Arcee AI. It shows strong performance in PinchBench, agentic workloads, and reasoning tasks. Launch video: https://you...
分类性能
基于独立 benchmark family 的实测能力估计,不确定性单独展示。
- 覆盖
- 5 / 8
- 方法论
- V3.0
#1知识56.4暂定评分1/4 实测维度
#2代码49.7暂定评分1/4 实测维度
#3指令遵循48.2暂定评分1/4 实测维度
#4综合推理44.4估算2/4 实测维度
#5智能体43.9估算3/4 实测维度
技术规格
Input and output token limits for this model, plus how it ranks on long-context understanding.
能力
排名
擅长
表现尚可
相对落后
详细分数
更新时间: 2026年8月25日速度与延迟
2 个指标
输出速度180.3 tok/s#13 / 74首字延迟0.67 s#15 / 74
速度与延迟
2 个指标
价格
2 个指标
输入价格$0.235/M#42 / 179输出价格$0.875/M#40 / 179
价格
2 个指标
智能体
V3.05 个指标 · 估算
分数43.980% 区间34.6–53.23/4 实测维度Τ²-bench results90.1#34 / 82Gert Labs32.5#44 / 49
智能体
V3.05 个指标 · 估算
代码
V3.04 个指标 · 暂定评分
分数49.780% 区间33.7–65.71/4 实测维度SciCode36.1%#118 / 204SWE-bench Verified*63.2#5 / 5
代码
V3.04 个指标 · 暂定评分
综合推理
V3.04 个指标 · 估算
分数44.480% 区间33.6–55.22/4 实测维度GPQA75.2%#113 / 211HLE15.8%#93 / 208
综合推理
V3.04 个指标 · 估算
知识
V3.07 个指标 · 暂定评分
分数56.480% 区间40.4–72.41/4 实测维度GPQA-D76.3#31 / 31MMLU-Pro (Arcee)83.4#4 / 5
知识
V3.07 个指标 · 暂定评分
数学
V3.01 个指标 · 暂无数据
80% 区间30.8–69.20/4 实测维度AIME25 (Arcee)96.3#2 / 5
数学
V3.01 个指标 · 暂无数据
多语言
V3.00 个指标 · 暂无数据
暂无数据80% 区间30.8–69.20/4 实测维度
多语言
V3.00 个指标 · 暂无数据
多模态
V3.01 个指标 · 暂无数据
80% 区间30.8–69.20/4 实测维度Design Arena Website1148.0#59 / 75
多模态
V3.01 个指标 · 暂无数据
指令遵循
V3.01 个指标 · 暂定评分
分数48.280% 区间32.2–64.21/4 实测维度AA-IFBench56.3#53 / 84
指令遵循
V3.01 个指标 · 暂定评分
OpenRouter 端点
2 个端点来自 OpenRouter 的第三方端点数据,和 LMSpeed 自测数据分开展示。部分 30 分钟实时性能字段需要配置 OpenRouter API key 后同步才会出现。
| Provider endpoint | 输入 | 输出 | 1 天在线率 | 30m 延迟 | 30m 吞吐 | 上下文 / 输出 |
|---|---|---|---|---|---|---|
Parasail parasail/fp4 | $0.220/M | $0.850/M | 100.0% | — | — | undefined tokens / undefined tokens |
Arcee AI arcee-ai | $0.250/M | $0.800/M | 99.5% | — | — | undefined tokens / undefined tokens |
替代方案与相似模型
Claude Haiku 4.5
claude-haiku-4-5
Anthropic 的 Claude Haiku 4.5是语言模型,专为通用对话与文本生成任务优化。
Kimi K2.5
kimi-k2-5
Moonshot 的 Kimi K2.5是语言模型,专为通用对话与文本生成任务优化。
MiniMax M2.5
minimax-m2-5
MiniMax M2.5是旗舰大语言模型,专为高复杂度通用任务与多步推理优化。
Claude Opus 4.6
claude-opus-4-6
Anthropic 的 Claude Opus 4.6是语言模型,专为通用对话与文本生成任务优化。
DeepSeek V4 Flash
deepseek-v4-flash
DeepSeek V4 Flash是DeepSeek V4 系列的语言模型,专为通用对话与文本生成任务优化。
Claude Opus 4.7
claude-opus-4-7
Anthropic 的 Claude Opus 4.7是旗舰大语言模型,专为高复杂度通用任务与多步推理优化。
