Навигация
Advertise here

Trinity Large Thinking (low) vs gpt-oss-120b (medium)

gpt-oss-120b (medium) лидирует по среднему баллу: 6.1 vs 6.0. gpt-oss-120b (medium) имеет более низкую стоимость benchmark: $0.020 vs $0.625. gpt-oss-120b (medium) быстрее: 20.81s vs 96.61s, с долей успешных попыток 47.0% vs 50.0%.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-09-10

Сравниваемые модели

Ранг
#208
Общее число выходных токенов
818,359
Время ответа (среднее)
96.61s
Общая стоимость
$0.625
Ранг
#198
Общее число выходных токенов
98,282
Время ответа (среднее)
20.81s
Общая стоимость
$0.020
Рекомендуемая модель gpt-oss-120b (medium)

Здесь у него лучший балл (6.1), при этом он примерно в 32.8 раза дешевле, чем Trinity Large Thinking (low).

Подробное сравнение

Метрика Trinity Large Thinking Trinity Large Thinking low Релиз: 2026-07-28 gpt-oss-120b gpt-oss-120b medium Релиз: 2025-08-05
Оценка 6.0 6.1
Ранг #208 #198
Надежность 10.0 10.0
Стабильность 8.3 8.0
Попытки 66/66 66/66
Тестов верно
Доля успешных попыток 47.0% 50.0%
Нестабильные тесты 5 5
Всего запусков 66 66
Стоимость за результат 8.221 0.224
Общая стоимость $0.625 $0.020
Цена входа $0.250 / 1M $0.037 / 1M
Цена выхода $0.800 / 1M $0.170 / 1M
Общее число входных токенов 122,854 108,767
Выходные токены 119,810 29,378
Токены рассуждений 698,549 68,904
Время ответа (среднее) 96.61s 20.81s
Время ответа (макс.) 540.96s 68.16s
Время ответа (суммарно) 2125.51s 332.88s
Параметры 398B всего (13B активных) 117B всего (5.1B активных)
Доступность Веса доступны Открытый исходный код

Генерация showcase моделей

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#208 Trinity Large Thinking

low
Стоимость
$0.021
Время
173.2s
Токены
24,586 tok

#198 gpt-oss-120b

medium
Стоимость
$0.001
Время
26.7s
Токены
555 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Trinity Large Thinking 5.3 10.0 33.3% 0 344.45s 5,441 27,039 217,241
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973

Быстрое сравнение

Сменить пару сравнения