OpenAI: GPT-5.3 Chat vs xAI: Grok 4.20

GPT-5.3 Chat лидирует по среднему баллу: 7.5 vs 7.1. GPT-5.3 Chat имеет более низкую стоимость benchmark: $0.571 vs $0.777. GPT-5.3 Chat быстрее: 6.88s vs 29.47s, с долей успешных попыток 68.2% vs 63.6%.

Рекомендуемая модельGPT-5.3 ChatЗдесь у него лучший балл (7.5), и он отвечает примерно в 4.3 раза быстрее, чем Grok 4.20 (medium).

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-07-25

Метрика	GPT-5.3 Chat GPT-5.3 Chat none Релиз: 2026-03-03	Grok 4.20 Grok 4.20 medium Релиз: 2026-03-31

Метрика	GPT-5.3 Chat GPT-5.3 Chat none Релиз: 2026-03-03	Grok 4.20 Grok 4.20 medium Релиз: 2026-03-31
Оценка	7.5	7.1
Ранг	#62	#83
Надежность	10.0	10.0
Стабильность	8.2	8.5
Тестов верно
Доля успешных попыток	68.2%	63.6%
Нестабильные тесты	5	4
Всего запусков	66	66
Стоимость за результат	4.387	9.709
Общая стоимость	$0.571	$0.777
Цена входа	$1.750 / 1M	$1.250 / 1M
Цена выхода	$14.000 / 1M	$2.500 / 1M
Общее число входных токенов	78,990	102,791
Выходные токены	30,854	5,363
Токены рассуждений	0	253,977
Время ответа (среднее)	6.88s	29.47s
Время ответа (макс.)	18.33s	199.66s
Время ответа (суммарно)	151.31s	648.35s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#62 GPT-5.3 Chat

none

Стоимость: $0.008
Время: 8.1s
Токены: 634 tok

#83 xAI: Grok 4.20

medium

Стоимость: $0.041
Время: 110.3s
Токены: 16,336 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Категория:

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	6.7	8.1	58.3%	1		3.86s	606	3,167	0
Grok 4.20	8.2	7.9	83.3%	1		3.95s	2,010	287	8,312

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	5.6	4.7	55.6%	2		10.52s	7,302	6,632	0
Grok 4.20	6.3	6.6	55.6%	1		109.93s	8,307	268	103,150

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	10.0	10.0	100.0%	0		15.07s	55,800	6,851	0
Grok 4.20	8.7	6.9	83.3%	1		42.25s	71,267	3,776	44,009

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.21s	7,140	942	0
Grok 4.20	10.0	10.0	100.0%	0		4.17s	7,761	180	5,333

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	3.5	4.4	33.3%	2		13.01s	723	8,264	0
Grok 4.20	5.3	10.0	33.3%	0		27.03s	1,764	375	49,339

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	4.6	10.0	0.0%	0		1.99s	477	319	0
Grok 4.20	3.9	2.6	33.3%	1		24.48s	825	65	6,440

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	9.8	10.0	100.0%	0		3.51s	660	1,491	0
Grok 4.20	9.8	10.0	100.0%	0		4.26s	1,362	57	6,419

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.99s	642	1,758	0
Grok 4.20	7.7	10.0	66.7%	0		6.22s	1,689	149	7,913

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	10.0	10.0	100.0%	0		8.36s	5,445	861	0
Grok 4.20	3.0	10.0	0.0%	0		13.68s	7,275	197	6,620

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	3.0	10.0	0.0%	0		4.38s	195	569	0
Grok 4.20	3.0	10.0	0.0%	0		63.48s	531	9	16,442

Быстрое сравнение

Сменить пару сравнения

Kimi K2.7 CodemediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsQwen3.5 Plus 2026-02-15medium Nemotron 3 UltramediumБесплатно доступноvsGPT-5.3 Chatnone Qwen3.7 PlusnonevsGrok 4.20medium GPT-5.3 ChatnonevsQwen3.5-27Bmedium GPT-5.3 ChatnonevsGrok Build 0.1medium LongCat 2.0mediumvsGPT-5.3 Chatnone MiniMax M3mediumvsGPT-5.3 Chatnone KAT-Coder-Pro V2.5highvsGrok 4.20medium Gemini 3.5 FlashnonevsGrok 4.20medium Gemini 3 Flash PreviewlowvsGPT-5.3 Chatnone Step 3.7 FlashlowvsGrok 4.20medium