AI BENCHY Compare

Google: Gemini 3.1 Flash Lite vs xAI: Grok Build 0.1

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-22

Метрика	Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite minimal Релиз: 2026-05-08	Grok Build 0.1 Grok Build 0.1 none Релиз: 2026-05-21

Метрика	Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite minimal Релиз: 2026-05-08	Grok Build 0.1 Grok Build 0.1 none Релиз: 2026-05-21
Оценка	6.7	6.6
Ранг	#78	#82
Надежность	10.0	10.0
Стабильность	8.8	8.0
Тестов верно
Доля успешных попыток	56.7%	60.4%
Нестабильные тесты	3	4
Всего запусков	60	57
Стоимость за результат	0.123	7.805
Общая стоимость	$0.013	$0.547
???? ?????	$0.250 / 1M	$1.000 / 1M
???? ??????	$1.500 / 1M	$2.000 / 1M
Выходные токены	2,481	267,275
Токены рассуждений	0	0
Время ответа (среднее)	1.37s	28.69s
Время ответа (макс.)	4.49s	138.35s
Время ответа (суммарно)	27.32s	459.00s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Flash Lite	8.3	10.0	75.0%	0		1.10s	639	0
Grok Build 0.1	8.7	7.9	91.7%	1		6.30s	11,162	0

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Flash Lite	6.8	10.0	50.0%	0		951ms	660	0
Grok Build 0.1	10.0	10.0	100.0%	0		21.41s	16,568	0

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Flash Lite	3.0	10.0	0.0%	0		2.53s	357	0
Grok Build 0.1	0.0	0.0	0.0%	0		0ms	0	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		1.04s	279	0
Grok Build 0.1	4.7	1.6	66.7%	1		9.33s	6,359	0

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Flash Lite	2.9	7.2	11.1%	1		1.02s	15	0
Grok Build 0.1	3.6	7.2	22.2%	1		103.71s	179,469	0

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Flash Lite	4.0	10.0	0.0%	0		791ms	63	0
Grok Build 0.1	4.3	10.0	0.0%	0		12.47s	6,647	0

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		932ms	72	0
Grok Build 0.1	9.8	10.0	100.0%	0		7.36s	8,970	0

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Flash Lite	6.0	4.6	66.7%	2		2.15s	153	0
Grok Build 0.1	6.4	7.7	55.6%	1		9.55s	14,982	0

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		3.51s	234	0
Grok Build 0.1	0.0	0.0	0.0%	0		0ms	0	0

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Flash Lite	3.0	10.0	0.0%	0		724ms	9	0
Grok Build 0.1	3.0	10.0	0.0%	0		36.09s	23,118	0

Быстрое сравнение

Сменить пару сравнения

Gemini 3.1 Flash LiteminimalvsKimi K2.5medium DeepSeek V4 ProhighvsGemini 3.1 Flash Liteminimal Gemini 3.1 Flash LiteminimalvsGrok 4.20medium Qwen3.6 27BmediumvsGrok Build 0.1none DeepSeek V4 ProhighvsGrok Build 0.1none Kimi K2.5mediumvsGrok Build 0.1none Gemini 3.1 Flash LiteminimalvsQwen3.6 27Bmedium Gemini 3.1 Flash LiteminimalvsGPT-5.5none Gemini 3.1 Flash LiteminimalvsGPT-5 Minimedium Gemini 3.1 Flash LiteminimalvsMiMo-V2-Omnimedium Gemini 3.1 Flash LiteminimalvsQwen3.5 Plus 2026-02-15none DeepSeek V3.2mediumvsGemini 3.1 Flash Liteminimal