Trinity Large Thinking API Benchmarks, Pricing & Provider Data
Compare Trinity Large Thinking with another model
Choose a model to open its comparison page.
The page also shows measured API speed and first-token latency.
Trinity Large Thinking is a powerful open source reasoning model from the team at Arcee AI. It shows strong performance in PinchBench, agentic workloads, and reasoning tasks. Launch video: https://you...
Производительность по категориям
Оценки наблюдаемой способности; неопределённость независимых семейств бенчмарков показана отдельно.
- Покрытие
- 5 / 8
- Методология
- V3.0
#1Знания56.4Предварительная1/4 Измеренные измерения
#2Программирование49.7Предварительная1/4 Измеренные измерения
#3Следование инструкциям48.2Предварительная1/4 Измеренные измерения
#4Рассуждение44.4Оценка2/4 Измеренные измерения
#5Агенты43.9Оценка3/4 Измеренные измерения
Specifications
Input and output token limits for this model, plus how it ranks on long-context understanding.
Возможности
Technical Details
- Вход
- Выход
- Выпущена
- Apr 2026
- Токенизатор
- Other
- Архитектура
- text->text
- Модерация
- Нет
- Поддерживаемые параметры
- frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokenspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p
Rankings
Excels at
It's decent at
Falls behind in
Подробные оценки
Обновлено: 24 авг. 2026 г.Скорость и задержка
undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}}
Скорость вывода207.3 tok/s#9 / 74Время до первого токена0.71 s#17 / 74
Скорость и задержка
undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}}
Цены
undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}}
Цена входных данных$0.235/M#43 / 180Цена выходных данных$0.875/M#41 / 180
Цены
undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}}
Агенты
V3.0undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}} · Оценка
Оценка43.980% интервал34.6–53.13/4 Измеренные измеренияΤ²-bench results90.1#34 / 82Gert Labs32.5#44 / 49
Агенты
V3.0undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}} · Оценка
Программирование
V3.0undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}} · Предварительная
Оценка49.780% интервал33.7–65.71/4 Измеренные измеренияSciCode36.1%#118 / 204SWE-bench Verified*63.2#5 / 5
Программирование
V3.0undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}} · Предварительная
Рассуждение
V3.0undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}} · Оценка
Оценка44.480% интервал33.6–55.22/4 Измеренные измеренияGPQA75.2%#113 / 211HLE15.8%#93 / 208
Рассуждение
V3.0undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}} · Оценка
Знания
V3.0undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}} · Предварительная
Оценка56.480% интервал40.4–72.41/4 Измеренные измеренияGPQA-D76.3#31 / 31MMLU-Pro (Arcee)83.4#4 / 5
Знания
V3.0undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}} · Предварительная
Математика
V3.0undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}} · Нет данных
80% интервал30.8–69.20/4 Измеренные измеренияAIME25 (Arcee)96.3#2 / 5
Математика
V3.0undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}} · Нет данных
Многоязычность
V3.0undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}} · Нет данных
Нет данных80% интервал30.8–69.20/4 Измеренные измерения
Многоязычность
V3.0undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}} · Нет данных
Мультимодальность
V3.0undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}} · Нет данных
80% интервал30.8–69.20/4 Измеренные измеренияDesign Arena Website1148.0#59 / 75
Мультимодальность
V3.0undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}} · Нет данных
Следование инструкциям
V3.0undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}} · Предварительная
Оценка48.280% интервал32.2–64.21/4 Измеренные измеренияAA-IFBench56.3#53 / 84
Следование инструкциям
V3.0undefined метрика} few undefined метрики} many undefined метрик} other undefined метрики}} · Предварительная
Эндпоинты OpenRouter
2 эндпоинтовСторонние данные эндпоинтов OpenRouter показаны отдельно от измерений LMSpeed. Некоторые 30-минутные live-метрики появляются только после синхронизации с OpenRouter API key.
| Provider endpoint | Вход | Вывод | Доступность 1 день | Задержка 30м | Пропускная способность 30м | Контекст / вывод |
|---|---|---|---|---|---|---|
Parasail parasail/fp4 | $0.220/M | $0.850/M | 100.0% | — | — | undefined токенов / undefined токенов |
Arcee AI arcee-ai | $0.250/M | $0.800/M | 100.0% | — | — | undefined токенов / undefined токенов |
Альтернативы и похожие модели
Claude Haiku 4.5
claude-haiku-4-5
Anthropic Claude Haiku 4.5 delivers fast, low-cost responses while retaining solid instruction following for chat, classification, and lightweight coding.
Kimi K2.5
kimi-k2-5
Moonshot Kimi K2.5 is an open-weight multimodal agent model with native vision and text input, strong coding performance, and a 256K context window.
MiniMax M2.5
minimax-m2-5
MiniMax M2.5 is MiniMax's flagship text model for coding and agents, with SOTA-level programming and agentic performance, improved token efficiency, and fast high-TPS API deployment.
Claude Opus 4.6
claude-opus-4-6
Anthropic Claude Opus 4.6 is the most capable Claude Opus tier, optimized for complex analysis, long-horizon coding, and high-stakes enterprise reasoning workloads.
DeepSeek V4 Flash
deepseek-v4-flash
DeepSeek V4 Flash is a fast, cost-efficient language model in the DeepSeek V4 family, optimized for low-latency chat, coding assistance, and high-throughput API workloads while retaining strong reasoning quality.
Claude Opus 4.7
claude-opus-4-7
Anthropic Claude Opus 4.7 targets frontier-level analysis, complex coding, and autonomous workflows that require deep multi-step reasoning.
