AI BENCHY Compare

Google: Gemini 3 Flash Preview vs Grok 4.20 Beta

Сводка

Сравнение benchmark Gemini 3 Flash Preview vs Grok 4.20 Beta: Gemini 3 Flash Preview лидирует по среднему баллу: 9.8 vs 8.5. Gemini 3 Flash Preview имеет более низкую стоимость benchmark: $0.667 vs $0.750. Grok 4.20 Beta быстрее: 9.75s vs 18.64s, с долей успешных попыток 98.4% vs 81.5%.

Рекомендуемая модель: Gemini 3 Flash Preview - У него самый высокий балл в этом сравнении (9.8) и лучший общий баланс стоимости и времени ответа среди всех 2 моделей.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-10

Метрика	Gemini 3 Flash Preview Gemini 3 Flash Preview medium Релиз: 2025-12-17	Grok 4.20 Beta Grok 4.20 Beta medium Релиз: 2026-03-12

Метрика	Gemini 3 Flash Preview Gemini 3 Flash Preview medium Релиз: 2025-12-17	Grok 4.20 Beta Grok 4.20 Beta medium Релиз: 2026-03-12
Оценка	9.8	8.5
Ранг	#1	#14
Надежность	10.0	Н/Д
Стабильность	9.7	9.5
Тестов верно
Доля успешных попыток	98.4%	81.5%
Нестабильные тесты	1	1
Всего запусков	63	52
Стоимость за результат	3.335	4.505
Общая стоимость	$0.667	$0.750
Цена входа	$0.500 / 1M	$5.805 / 1M
Цена выхода	$3.000 / 1M	$5.805 / 1M
Общее число входных токенов	37,017	35,955
Выходные токены	2,006	1,647
Токены рассуждений	214,153	91,565
Время ответа (среднее)	18.64s	9.75s
Время ответа (макс.)	117.26s	31.36s
Время ответа (суммарно)	391.35s	175.48s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#1 Gemini 3 Flash Preview

medium

Cost: $0.010
Time: 17.9s
Tokens: 3,236 tok

#14 Grok 4.20 Beta

medium

Cost: $0.034
Time: 91.0s
Tokens: 13,523 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		3.88s	494	330	3,216
Grok 4.20 Beta	8.7	7.9	91.7%	1		3.16s	2,010	268	7,583

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3 Flash Preview	8.6	7.6	88.9%	1		84.40s	8,122	462	161,084
Grok 4.20 Beta	10.0	10.0	100.0%	0		31.36s	360	81	3,987

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		22.42s	12,873	351	10,485
Grok 4.20 Beta	10.0	10.0	100.0%	0		20.93s	12,909	227	12,212

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		5.43s	7,548	279	4,893
Grok 4.20 Beta	10.0	10.0	100.0%	0		4.01s	7,761	180	5,281

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		15.27s	633	12	21,684
Grok 4.20 Beta	5.3	10.0	33.3%	0		21.33s	1,764	251	40,255

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		5.19s	486	72	1,905
Grok 4.20 Beta	10.0	10.0	100.0%	0		5.78s	825	72	3,440

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		4.04s	615	72	2,709
Grok 4.20 Beta	9.8	10.0	100.0%	0		4.89s	1,362	57	7,123

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		4.05s	558	183	4,365
Grok 4.20 Beta	10.0	10.0	100.0%	0		3.52s	1,689	328	6,300

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		12.60s	5,532	234	1,487
Grok 4.20 Beta	3.0	10.0	0.0%	0		12.39s	7,275	183	5,384

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		5.50s	156	11	2,325
Grok 4.20 Beta	-	-	-	-	-	-	-	-	-

Быстрое сравнение

Сменить пару сравнения