AI BENCHY Compare

OpenAI: GPT-5 Mini vs xAI: Grok Build 0.1

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-22

Метрика	GPT-5 Mini GPT-5 Mini medium Релиз: 2025-08-07	Grok Build 0.1 Grok Build 0.1 none Релиз: 2026-05-21

Метрика	GPT-5 Mini GPT-5 Mini medium Релиз: 2025-08-07	Grok Build 0.1 Grok Build 0.1 none Релиз: 2026-05-21
Оценка	6.9	6.6
Ранг	#73	#82
Надежность	10.0	10.0
Стабильность	8.7	8.0
Тестов верно
Доля успешных попыток	60.0%	60.4%
Нестабильные тесты	3	4
Всего запусков	60	57
Стоимость за результат	1.494	7.805
Общая стоимость	$0.150	$0.547
???? ?????	$0.250 / 1M	$1.000 / 1M
???? ??????	$2.000 / 1M	$2.000 / 1M
Выходные токены	6,636	267,275
Токены рассуждений	63,722	0
Время ответа (среднее)	23.99s	28.69s
Время ответа (макс.)	88.15s	138.35s
Время ответа (суммарно)	479.86s	459.00s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Mini	7.1	7.6	66.7%	1		13.86s	1,715	6,378
Grok Build 0.1	8.7	7.9	91.7%	1		6.30s	11,162	0

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Mini	10.0	10.0	100.0%	0		30.74s	580	12,544
Grok Build 0.1	10.0	10.0	100.0%	0		21.41s	16,568	0

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Mini	10.0	10.0	100.0%	0		88.15s	754	11,520
Grok Build 0.1	0.0	0.0	0.0%	0		0ms	0	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Mini	10.0	10.0	100.0%	0		12.58s	453	3,200
Grok Build 0.1	4.7	1.6	66.7%	1		9.33s	6,359	0

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Mini	3.6	7.2	22.2%	1		44.63s	293	14,016
Grok Build 0.1	3.6	7.2	22.2%	1		103.71s	179,469	0

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Mini	4.5	10.0	0.0%	0		13.50s	349	1,856
Grok Build 0.1	4.3	10.0	0.0%	0		12.47s	6,647	0

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Mini	7.9	6.5	83.3%	1		15.66s	318	4,992
Grok Build 0.1	9.8	10.0	100.0%	0		7.36s	8,970	0

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Mini	5.6	9.8	33.3%	0		14.09s	1,527	5,760
Grok Build 0.1	6.4	7.7	55.6%	1		9.55s	14,982	0

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Mini	10.0	10.0	100.0%	0		18.64s	487	1,600
Grok Build 0.1	0.0	0.0	0.0%	0		0ms	0	0

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Mini	3.0	10.0	0.0%	0		9.99s	160	1,856
Grok Build 0.1	3.0	10.0	0.0%	0		36.09s	23,118	0

Быстрое сравнение

Сменить пару сравнения

Qwen3.6 27BmediumvsGrok Build 0.1none DeepSeek V4 ProhighvsGrok Build 0.1none Kimi K2.5mediumvsGrok Build 0.1none Gemini 3.1 Flash LiteminimalvsGrok Build 0.1none Claude Sonnet 4.6nonevsGPT-5 Minimedium GPT-5 MinimediumvsQwen3.6 Max Previewnone Gemma 4 31BnoneБесплатно доступноvsGPT-5 Minimedium Gemini 3.1 Flash LiteminimalvsGPT-5 Minimedium DeepSeek V4 ProhighvsGPT-5 Minimedium Ring-2.6-1TnonevsGPT-5 Minimedium Grok Build 0.1nonevsMiMo-V2-Omnimedium Mercury 2mediumvsGrok Build 0.1none