AI BENCHY Compare

OpenAI: GPT-5.3-Codex vs Z.ai: GLM 5

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-04-14

Метрика	GPT-5.3-Codex GPT-5.3-Codex medium Релиз: 2026-02-05	GLM 5 GLM 5 none Релиз: 2026-02-12

Метрика	GPT-5.3-Codex GPT-5.3-Codex medium Релиз: 2026-02-05	GLM 5 GLM 5 none Релиз: 2026-02-12
Оценка	8.6	6.6
Ранг	#5	#50
Стабильность	8.7	9.6
Тестов верно
Доля успешных попыток	83.3%	51.9%
Нестабильные тесты	3	1
Всего запусков	54	54
Стоимость за результат	4.405	0.217
Общая стоимость	$0.573	$0.020
???? ?????	$1.750 / 1M	$0.720 / 1M
???? ??????	$14.000 / 1M	$2.300 / 1M
Выходные токены	2,279	1,959
Токены рассуждений	35,179	0
Время ответа (среднее)	15.38s	4.23s
Время ответа (макс.)	100.93s	11.07s
Время ответа (суммарно)	276.91s	46.51s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3-Codex	8.7	7.9	91.7%	1		4.16s	240	1,722
GLM 5	4.8	10.0	25.0%	0		2.37s	275	0

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3-Codex	10.0	10.0	100.0%	0		8.95s	491	1,530
GLM 5	5.6	3.5	33.3%	1		8.84s	408	0

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3-Codex	10.0	10.0	100.0%	0		19.56s	364	2,731
GLM 5	3.0	10.0	0.0%	0		4.98s	406	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.07s	234	728
GLM 5	10.0	10.0	100.0%	0		5.78s	203	0

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3-Codex	5.9	7.2	55.6%	1		64.31s	64	25,308
GLM 5	3.0	10.0	0.0%	0		2.24s	19	0

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3-Codex	4.6	10.0	0.0%	0		4.87s	187	331
GLM 5	10.0	10.0	100.0%	0		3.27s	103	0

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.04s	93	693
GLM 5	10.0	10.0	100.0%	0		1.48s	61	0

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3-Codex	9.0	7.9	88.9%	1		5.12s	352	1,644
GLM 5	7.7	10.0	66.7%	0		2.05s	264	0

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3-Codex	10.0	10.0	100.0%	0		6.37s	254	492
GLM 5	10.0	10.0	100.0%	0		11.07s	220	0

Быстрое сравнение

Сменить пару сравнения

Grok 4.1 FastmediumvsGLM 5none Nemotron 3 SupermediumБесплатно доступноvsGLM 5none Mercury 2mediumvsGLM 5none Gemini 3 Flash PreviewlowvsGPT-5.3-Codexmedium Grok 4.20mediumvsGLM 5none Kimi K2.5mediumvsGLM 5none GPT-5 MinimediumvsGLM 5none GPT-5 NanomediumvsGLM 5none Gemini 3 Flash PreviewnonevsGPT-5.3-Codexmedium Gemini 3.1 Flash Lite PreviewlowvsGPT-5.3-Codexmedium GPT-5.4 MinimediumvsGLM 5none Gemini 3.1 Flash Lite PreviewnonevsGPT-5.3-Codexmedium