Навигация
AI BENCHY
Advertise here

Trinity Large Thinking (low) vs Qwen3.5-Flash (medium)

Qwen3.5-Flash (medium) лидирует по среднему баллу: 6.1 vs 6.0. Qwen3.5-Flash (medium) имеет более низкую стоимость benchmark: $0.142 vs $0.658. Qwen3.5-Flash (medium) быстрее: 84.44s vs 96.61s, с долей успешных попыток 47.0% vs 65.2%.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-08-14

Ранг
#174
Общее число выходных токенов
818,359
Время ответа (среднее)
96.61s
Общая стоимость
$0.658
Ранг
#167
Общее число выходных токенов
512,846
Время ответа (среднее)
84.44s
Общая стоимость
$0.142
Рекомендуемая модель Qwen3.5-Flash (medium)

Здесь у него лучший балл (6.1), при этом он примерно в 4.7 раза дешевле, чем Trinity Large Thinking (low).

Подробное сравнение

Метрика Trinity Large Thinking Trinity Large Thinking low Релиз: 2026-07-28 Qwen3.5-Flash Qwen3.5-Flash medium Релиз: 2026-02-24
Оценка 6.0 6.1
Ранг #174 #167
Надежность 10.0 10.0
Стабильность 8.3 7.8
Попытки 66/66 66/66
Тестов верно
Доля успешных попыток 47.0% 65.2%
Нестабильные тесты 5 6
Всего запусков 66 66
Стоимость за результат 8.221 1.491
Общая стоимость $0.658 $0.142
Цена входа $0.220 / 1M $0.065 / 1M
Цена выхода $0.850 / 1M $0.260 / 1M
Общее число входных токенов 122,854 118,508
Выходные токены 119,810 35,457
Токены рассуждений 698,549 477,389
Время ответа (среднее) 96.61s 84.44s
Время ответа (макс.) 540.96s 515.38s
Время ответа (суммарно) 2125.51s 1773.20s
Параметры 398B всего (13B активных) ~35B всего (~3B активных)
Доступность Веса доступны Закрытая модель

Генерация showcase моделей

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#174 Trinity Large Thinking

low
Стоимость
$0.021
Время
173.2s
Токены
24,586 tok

#167 Qwen3.5-Flash

medium
Стоимость
$0.002
Время
25.8s
Токены
4,294 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Trinity Large Thinking 5.3 10.0 33.3% 0 344.45s 5,441 27,039 217,241
Qwen3.5-Flash 3.7 7.2 22.2% 1 58.87s 6,685 302 90,081

Быстрое сравнение

Сменить пару сравнения