AI BENCHY Compare

OpenAI: GPT-5.3 Chat vs xAI: Grok 4.3

Сводка

Сравнение benchmark GPT-5.3 Chat vs Grok 4.3: Grok 4.3 лидирует по среднему баллу: 7.7 vs 7.5. GPT-5.3 Chat имеет более низкую стоимость benchmark: $0.433 vs $0.614. GPT-5.3 Chat быстрее: 6.34s vs 47.51s, с долей успешных попыток 66.7% vs 71.4%.

Рекомендуемая модель: GPT-5.3 Chat - Его балл близок к лучшему здесь (7.5 против 7.7), и он отвечает примерно в 7.5 раза быстрее, чем Grok 4.3.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-12

Метрика	GPT-5.3 Chat GPT-5.3 Chat none Релиз: 2026-03-03	Grok 4.3 Grok 4.3 medium Релиз: 2026-05-01

Метрика	GPT-5.3 Chat GPT-5.3 Chat none Релиз: 2026-03-03	Grok 4.3 Grok 4.3 medium Релиз: 2026-05-01
Оценка	7.5	7.7
Ранг	#47	#40
Надежность	10.0	10.0
Стабильность	8.1	8.5
Тестов верно
Доля успешных попыток	66.7%	71.4%
Нестабильные тесты	5	4
Всего запусков	63	63
Стоимость за результат	3.605	4.724
Общая стоимость	$0.433	$0.614
Цена входа	$1.750 / 1M	$1.250 / 1M
Цена выхода	$14.000 / 1M	$2.500 / 1M
Общее число входных токенов	34,209	44,472
Выходные токены	26,617	1,981
Токены рассуждений	0	221,382
Время ответа (среднее)	6.34s	47.51s
Время ответа (макс.)	18.33s	216.69s
Время ответа (суммарно)	133.13s	997.68s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#47 GPT-5.3 Chat

none

Cost: $0.008
Time: 8.1s
Tokens: 634 tok

#40 xAI: Grok 4.3

medium

Cost: $0.009
Time: 19.0s
Tokens: 3,661 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	6.7	8.1	58.3%	1		3.86s	606	3,167	0
Grok 4.3	10.0	10.0	100.0%	0		8.83s	2,010	88	8,207

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	5.6	4.7	55.6%	2		10.52s	7,302	6,632	0
Grok 4.3	5.9	7.7	44.4%	1		41.23s	8,340	1,028	31,226

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	10.0	10.0	100.0%	0		11.96s	11,019	2,614	0
Grok 4.3	10.0	10.0	100.0%	0		63.99s	12,909	234	15,301

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.21s	7,140	942	0
Grok 4.3	10.0	10.0	100.0%	0		18.97s	7,761	180	9,546

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	3.5	4.4	33.3%	2		13.01s	723	8,264	0
Grok 4.3	5.3	7.2	44.4%	1		181.74s	1,764	14	111,300

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	4.6	10.0	0.0%	0		1.99s	477	319	0
Grok 4.3	5.4	2.5	66.7%	1		24.70s	825	70	5,020

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	9.8	10.0	100.0%	0		3.51s	660	1,491	0
Grok 4.3	9.8	10.0	100.0%	0		18.58s	1,362	57	8,713

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.99s	642	1,758	0
Grok 4.3	5.9	7.2	55.6%	1		22.52s	1,689	128	14,468

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	10.0	10.0	100.0%	0		8.36s	5,445	861	0
Grok 4.3	10.0	10.0	100.0%	0		17.66s	7,263	168	4,615

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.3 Chat	3.0	10.0	0.0%	0		4.38s	195	569	0
Grok 4.3	3.0	10.0	0.0%	0		44.47s	549	14	12,986

Быстрое сравнение

Сменить пару сравнения

Step 3.7 FlashlowvsGrok 4.3medium Mercury 2mediumvsGPT-5.3 Chatnone Kimi K2.5mediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsQwen3.6 Flashmedium DeepSeek V3.2mediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsGrok Build 0.1medium Seed-2.0-MinimediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsMiMo-V2.5-Promedium MiniMax M3mediumvsGPT-5.3 Chatnone Gemini 3 Flash PreviewlowvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsGrok 4.20medium GPT-5.3 ChatnonevsStep 3.7 Flashlow