Сравнить Графики Методология

Язык:

❤️ Made by XCS

AI BENCHY Compare

Google: Gemini 3 Flash Preview vs OpenAI: GPT-5.4

Сравнить:

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-03-06

Метрика	Google: Gemini 3 Flash Preview none Релиз: 2025-12-17	OpenAI: GPT-5.4 medium Релиз: 2026-03-05
Ранг	#20	#9
Средний балл	7.2	8.0
Стабильность	9.0	8.5
Стоимость за результат	0.169	6.601
Общая стоимость	$0.019	$0.793
Тестов верно
Доля успешных попыток	75.0%	83.3%
Нестабильные тесты	2	3
Всего запусков	48 (16 x 3)	48 (16 x 3)
Выходные токены	1,411	1,756
Токены рассуждений	0	46,642
Время ответа (среднее)	1.75s	20.05s
Время ответа (макс.)	3.56s	100.41s
Время ответа (суммарно)	15.71s	320.87s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Средний балл vs Время ответа (среднее)

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Google: Gemini 3 Flash Preview	7.0	10.0	66.7%	0		1.59s	208	0
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		5.02s	216	1,466

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Google: Gemini 3 Flash Preview	10.0	1.6	66.7%	1		3.56s	350	0
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		20.57s	301	3,543

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Google: Gemini 3 Flash Preview	9.9	10.0	100.0%	0		1.41s	279	0
OpenAI: GPT-5.4	9.9	10.0	100.0%	0		5.32s	234	804

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Google: Gemini 3 Flash Preview	7.0	10.0	66.7%	0		963ms	18	0
OpenAI: GPT-5.4	4.0	7.2	44.4%	1		74.27s	61	34,748

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Google: Gemini 3 Flash Preview	10.0	10.0	100.0%	0		1.13s	104	0
OpenAI: GPT-5.4	5.0	3.1	33.3%	1		4.92s	145	321

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Google: Gemini 3 Flash Preview	5.5	5.8	66.7%	1		1.58s	74	0
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		3.11s	93	897

Puzzle Solving	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Google: Gemini 3 Flash Preview	7.0	10.0	66.7%	0		1.06s	144	0
OpenAI: GPT-5.4	7.0	7.2	88.9%	1		9.13s	442	3,832

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Google: Gemini 3 Flash Preview	10.0	10.0	100.0%	0		3.35s	234	0
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		13.28s	264	1,031

Быстрое сравнение

Сменить пару сравнения

Gemini 3 Flash PreviewnonevsMiMo-V2-Flashmedium DeepSeek V3.2mediumvsGemini 3 Flash Previewnone Gemini 3.1 Flash Lite PreviewhighvsGPT-5.4medium Gemini 3 Flash PreviewlowvsGPT-5.4medium Gemini 3 Flash PreviewnonevsGLM 5medium Gemini 3 Flash PreviewnonevsStep 3.5 FlashmediumБесплатно доступно Seed-2.0-MinimediumvsGemini 3 Flash Previewnone Gemini 3 Flash PreviewnonevsQwen3.5-Flashmedium Claude Sonnet 4.6mediumvsGemini 3 Flash Previewnone Gemini 3 Flash PreviewnonevsQwen3.5-122B-A10Bmedium Claude Opus 4.6mediumvsGemini 3 Flash Previewnone Gemini 3 Flash PreviewnonevsGPT-5.2medium