Сравнить Графики Методология

Язык:

❤️ Made by XCS

AI BENCHY Compare

Trinity Large Preview vs Google: Gemini 3.1 Pro Preview

Сравнить:

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-03-06

Метрика	Trinity Large Preview none Релиз: 2026-01-27 Бесплатно доступно	Google: Gemini 3.1 Pro Preview medium Релиз: 2026-02-19
Ранг	#45	#2
Средний балл	4.2	9.4
Стабильность	9.6	10.0
Стоимость за результат	0.000	3.417
Общая стоимость	$0.000	$0.513
Тестов верно
Доля успешных попыток	33.3%	93.8%
Нестабильные тесты	1	0
Всего запусков	48 (16 x 3)	48 (16 x 3)
Выходные токены	1,837	1,521
Токены рассуждений	0	35,656
Время ответа (среднее)	3.15s	16.60s
Время ответа (макс.)	8.91s	40.61s
Время ответа (суммарно)	50.46s	149.36s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Средний балл vs Время ответа (среднее)

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Trinity Large Preview	10.0	10.0	0.0%	0		3.59s	587	0
Google: Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		9.52s	106	2,533

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Trinity Large Preview	10.0	10.0	0.0%	0		8.91s	294	0
Google: Gemini 3.1 Pro Preview	9.0	10.0	100.0%	0		40.61s	432	9,281

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Trinity Large Preview	9.9	10.0	100.0%	0		3.26s	186	0
Google: Gemini 3.1 Pro Preview	9.9	10.0	100.0%	0		7.72s	279	3,904

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Trinity Large Preview	4.0	10.0	33.3%	0		877ms	25	0
Google: Gemini 3.1 Pro Preview	7.0	10.0	66.7%	0		32.73s	18	12,424

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Trinity Large Preview	3.0	9.9	0.0%	0		2.86s	124	0
Google: Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		11.77s	108	1,179

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Trinity Large Preview	3.5	6.7	16.7%	1		1.09s	63	0
Google: Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		9.56s	72	2,236

Puzzle Solving	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Trinity Large Preview	4.0	10.0	33.3%	0		3.30s	291	0
Google: Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		7.15s	232	3,117

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Trinity Large Preview	10.0	10.0	100.0%	0		6.67s	267	0
Google: Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		23.15s	274	982

Быстрое сравнение

Сменить пару сравнения

Trinity Large PreviewnoneБесплатно доступноvsMiniMax M2.5medium Trinity Large PreviewnoneБесплатно доступноvsQwen3 Coder Nextmedium Trinity Large PreviewnoneБесплатно доступноvsgpt-oss-120bmediumБесплатно доступно Trinity Large PreviewnoneБесплатно доступноvsMercury 2medium Trinity Large PreviewnoneБесплатно доступноvsGLM 4.7 Flashmedium Trinity Large PreviewnoneБесплатно доступноvsQwen3.5-35B-A3Bmedium Trinity Large PreviewnoneБесплатно доступноvsGPT-5 Nanomedium Trinity Large PreviewnoneБесплатно доступноvsGPT-5 Minimedium Gemini 3.1 Pro PreviewmediumvsGPT-5.2 Chatnone Trinity Large PreviewnoneБесплатно доступноvsGrok 4.1 Fastmedium Gemini 3.1 Pro PreviewmediumvsGPT-5.3 Chatnone Trinity Large PreviewnoneБесплатно доступноvsKimi K2.5medium