Навигация
Advertise here

Trinity Large Thinking (low) vs Grok 4.20 (medium)

Средний балл практически равен: 6.3 vs 6.3. Trinity Large Thinking (low) имеет более низкую стоимость benchmark: $0.700 vs $1.582. Grok 4.20 (medium) быстрее: 36.73s vs 95.16s, с долей успешных попыток 47.8% vs 58.0%.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-10-01

Сравниваемые модели

Ранг
#222
Общее число выходных токенов
842,200
Время ответа (среднее)
95.16s
Общая стоимость
$0.700
Ранг
#224
Общее число выходных токенов
302,087
Время ответа (среднее)
36.73s
Общая стоимость
$1.582
Рекомендуемая модель Trinity Large Thinking (low)

Здесь у него лучший балл (6.3), при этом он примерно в 2.3 раза дешевле, чем Grok 4.20 (medium).

Подробное сравнение

Метрика Trinity Large Thinking Trinity Large Thinking low Релиз: 2026-07-28 Grok 4.20 Grok 4.20 medium Релиз: 2026-03-31
Оценка 6.3 6.3
Ранг #222 #224
Надежность 10.0 10.0
Стабильность 8.1 8.2
Попытки 69/69 69/69
Тестов верно
Доля успешных попыток 47.8% 58.0%
Нестабильные тесты 6 5
Всего запусков 69 69
Стоимость за результат 9.163 14.374
Общая стоимость $0.700 $1.582
Цена входа $0.250 / 1M $1.250 / 1M
Цена выхода $0.800 / 1M $2.500 / 1M
Общее число входных токенов 347,980 392,127
Выходные токены 121,898 7,754
Токены рассуждений 720,302 294,333
Время ответа (среднее) 95.16s 36.73s
Время ответа (макс.) 540.96s 199.66s
Время ответа (суммарно) 2188.74s 844.68s
Параметры 398B всего (13B активных) ~1T всего (~100B активных)
Доступность Веса доступны Закрытая модель

Генерация showcase моделей

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#222 Trinity Large Thinking

low
Стоимость
$0.021
Время
173.2s
Токены
24,586 tok

#224 SpaceXAI: Grok 4.20

medium
Стоимость
$0.041
Время
110.3s
Токены
16,336 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Trinity Large Thinking 5.3 10.0 33.3% 0 344.45s 5,441 27,039 217,241
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150

Быстрое сравнение

Сменить пару сравнения