AI BENCHY Compare

Google: Gemini 3.5 Flash vs xAI: Grok Build 0.1

Сводка

Сравнение benchmark Gemini 3.5 Flash vs Grok Build 0.1: Gemini 3.5 Flash лидирует по среднему баллу: 9.8 vs 4.2. Grok Build 0.1 имеет более низкую стоимость benchmark: $0.547 vs $1.115. Gemini 3.5 Flash быстрее: 8.84s vs 28.69s, с долей успешных попыток 96.8% vs 46.0%.

Рекомендуемая модель: Gemini 3.5 Flash - Здесь у него лучший балл (9.8), и он отвечает примерно в 3.2 раза быстрее, чем Grok Build 0.1.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-07-02

Метрика	Gemini 3.5 Flash Gemini 3.5 Flash high Релиз: 2026-05-19	Grok Build 0.1 Grok Build 0.1 none Релиз: 2026-05-21

Метрика	Gemini 3.5 Flash Gemini 3.5 Flash high Релиз: 2026-05-19	Grok Build 0.1 Grok Build 0.1 none Релиз: 2026-05-21
Оценка	9.8	4.2
Ранг	#1	#165
Надежность	10.0	10.0
Стабильность	9.6	7.5
Тестов верно
Доля успешных попыток	96.8%	46.0%
Нестабильные тесты	1	4
Всего запусков	63	57
Стоимость за результат	5.575	7.805
Общая стоимость	$1.115	$0.547
Цена входа	$1.500 / 1M	$1.000 / 1M
Цена выхода	$9.000 / 1M	$2.000 / 1M
Общее число входных токенов	37,594	11,793
Выходные токены	1,975	267,275
Токены рассуждений	115,638	0
Время ответа (среднее)	8.84s	28.69s
Время ответа (макс.)	34.82s	138.35s
Время ответа (суммарно)	185.57s	459.00s

Генерация showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#1 Gemini 3.5 Flash

high

Стоимость: $0.208
Время: 118.2s
Токены: 23,158 tok

#165 xAI: Grok Build 0.1

none

Для этой модели еще не сгенерирован результат showcase.

Стоимость: $0.000
Время: -
Токены: 0 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3.5 Flash	10.0	10.0	100.0%	0		2.57s	492	174	4,997
Grok Build 0.1	8.7	7.9	91.7%	1		6.30s	2,010	11,162	0

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3.5 Flash	10.0	10.0	100.0%	0		22.96s	8,118	456	47,129
Grok Build 0.1	3.3	3.3	33.3%	0		21.41s	1,080	16,568	0

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3.5 Flash	10.0	10.0	100.0%	0		22.37s	12,873	351	16,323
Grok Build 0.1	3.0	10.0	0.0%	0		0ms	0	0	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3.5 Flash	10.0	10.0	100.0%	0		6.43s	7,548	279	8,466
Grok Build 0.1	3.8	5.8	33.3%	1		9.33s	2,532	6,359	0

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3.5 Flash	7.6	7.2	77.8%	1		14.09s	633	12	24,721
Grok Build 0.1	3.6	7.2	22.2%	1		103.71s	1,764	179,469	0

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3.5 Flash	10.0	10.0	100.0%	0		3.63s	486	115	1,650
Grok Build 0.1	4.3	10.0	0.0%	0		12.47s	825	6,647	0

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3.5 Flash	10.0	10.0	100.0%	0		3.35s	615	70	3,799
Grok Build 0.1	9.8	10.0	100.0%	0		7.36s	1,362	8,970	0

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3.5 Flash	10.0	10.0	100.0%	0		3.23s	558	241	4,940
Grok Build 0.1	6.4	7.7	55.6%	1		9.55s	1,689	14,982	0

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3.5 Flash	9.8	10.0	100.0%	0		4.96s	6,115	265	1,608
Grok Build 0.1	3.0	10.0	0.0%	0		0ms	0	0	0

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Gemini 3.5 Flash	10.0	10.0	100.0%	0		3.94s	156	12	2,005
Grok Build 0.1	3.0	10.0	0.0%	0		36.09s	531	23,118	0

Быстрое сравнение

Сменить пару сравнения

Gemini 3.5 FlashhighvsQwen3.7 Maxmedium Gemini 3.5 FlashhighvsGPT-5.5low Claude Fable 5mediumvsGemini 3.5 Flashhigh Gemini 3.5 FlashhighvsGPT-5.5medium Gemini 3.5 FlashhighvsGPT-5.3-Codexmedium Gemini 3.5 FlashhighvsQwen3.6 Max Previewmedium Claude Opus 4.8mediumvsGemini 3.5 Flashhigh Claude Opus 4.7mediumvsGemini 3.5 Flashhigh Gemini 3.5 FlashhighvsGLM 5.2medium Gemini 3.5 FlashhighvsGLM 5medium Gemini 3.5 FlashhighvsGPT-5 Minimedium Gemini 3.5 FlashhighvsGPT-5.4medium