AI BENCHY Compare

OpenAI: GPT-5 Nano vs xAI: Grok 4.20

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-21

Метрика	GPT-5 Nano GPT-5 Nano medium Релиз: 2025-08-07	Grok 4.20 Grok 4.20 medium Релиз: 2026-03-31

Метрика	GPT-5 Nano GPT-5 Nano medium Релиз: 2025-08-07	Grok 4.20 Grok 4.20 medium Релиз: 2026-03-31
Оценка	6.2	6.9
Ранг	#92	#74
Надежность	10.0	10.0
Стабильность	7.0	8.3
Тестов верно
Доля успешных попыток	57.9%	63.2%
Нестабильные тесты	7	4
Всего запусков	57	57
Стоимость за результат	0.856	7.559
Общая стоимость	$0.069	$0.756
???? ?????	$0.050 / 1M	$1.250 / 1M
???? ??????	$0.400 / 1M	$2.500 / 1M
Выходные токены	5,214	1,784
Токены рассуждений	162,432	128,233
Время ответа (среднее)	42.13s	14.53s
Время ответа (макс.)	204.02s	63.48s
Время ответа (суммарно)	505.59s	276.06s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Nano	6.5	7.9	58.3%	1		25.50s	1,221	21,184
Grok 4.20	8.2	7.9	83.3%	1		3.95s	287	8,312

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Nano	6.7	3.5	66.7%	1		40.73s	480	12,992
Grok 4.20	4.3	1.1	66.7%	1		24.33s	250	12,804

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Nano	10.0	10.0	100.0%	0		65.96s	578	17,984
Grok 4.20	10.0	10.0	100.0%	0		17.40s	232	9,556

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Nano	3.7	1.7	50.0%	2		21.42s	453	10,560
Grok 4.20	10.0	10.0	100.0%	0		4.17s	180	5,333

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Nano	5.2	4.4	55.6%	2		204.02s	237	64,448
Grok 4.20	5.3	10.0	33.3%	0		27.03s	375	49,339

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Nano	4.1	10.0	0.0%	0		17.51s	202	4,608
Grok 4.20	3.9	2.6	33.3%	1		24.48s	65	6,440

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Nano	9.8	10.0	100.0%	0		11.90s	382	4,096
Grok 4.20	7.3	6.0	83.3%	1		4.42s	40	5,474

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Nano	5.3	7.2	44.4%	1		19.81s	869	13,440
Grok 4.20	7.7	10.0	66.7%	0		6.20s	149	7,913

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Nano	10.0	10.0	100.0%	0		33.30s	558	6,976
Grok 4.20	3.0	10.0	0.0%	0		13.68s	197	6,620

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5 Nano	3.0	10.0	0.0%	0		20.13s	234	6,144
Grok 4.20	3.0	10.0	0.0%	0		63.48s	9	16,442

Быстрое сравнение

Сменить пару сравнения

DeepSeek V4 ProhighvsGrok 4.20medium Gemma 4 26B A4BnoneБесплатно доступноvsGPT-5 Nanomedium Gemma 4 31BnoneБесплатно доступноvsGrok 4.20medium Gemini 2.5 FlashnonevsGPT-5 Nanomedium Gemini 3.1 Flash LiteminimalvsGrok 4.20medium GPT-5 NanomediumvsMiMo-V2-Omninone DeepSeek V4 PrononevsGPT-5 Nanomedium GPT-5.5nonevsGrok 4.20medium Gemini 3.1 Flash LitenonevsGrok 4.20medium GPT-5 NanomediumvsGLM 5none Seed-2.0-LitenonevsGPT-5 Nanomedium GPT-5 NanomediumvsGLM 5V Turbonone