AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.2

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-28

Метрика	Claude Opus 4.8 Claude Opus 4.8 none Релиз: 2026-05-28	GPT-5.2 GPT-5.2 medium Релиз: 2025-12-11

Метрика	Claude Opus 4.8 Claude Opus 4.8 none Релиз: 2026-05-28	GPT-5.2 GPT-5.2 medium Релиз: 2025-12-11
Оценка	7.3	7.3
Ранг	#63	#61
Надежность	10.0	10.0
Стабильность	9.2	8.3
Тестов верно
Доля успешных попыток	65.0%	70.0%
Нестабильные тесты	2	4
Всего запусков	60	60
Стоимость за результат	4.324	4.094
Общая стоимость	$0.519	$0.492
Цена входа	$5.000 / 1M	$1.750 / 1M
Цена выхода	$25.000 / 1M	$14.000 / 1M
Выходные токены	8,098	2,880
Токены рассуждений	0	28,289
Время ответа (среднее)	3.51s	16.50s
Время ответа (макс.)	17.73s	77.80s
Время ответа (суммарно)	70.19s	214.45s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.8	6.5	10.0	50.0%	0		3.40s	1,472	0
GPT-5.2	6.5	8.0	58.3%	1		7.81s	567	2,002

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.8	6.8	10.0	50.0%	0		3.59s	1,323	0
GPT-5.2	10.0	10.0	100.0%	0		23.15s	490	8,269

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.8	9.5	10.0	100.0%	0		17.73s	3,259	0
GPT-5.2	10.0	10.0	100.0%	0		14.06s	291	1,757

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.8	7.3	5.8	83.3%	1		1.77s	308	0
GPT-5.2	10.0	10.0	100.0%	0		3.15s	234	420

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.8	5.3	7.2	44.4%	1		1.66s	61	0
GPT-5.2	5.9	7.2	55.6%	1		77.80s	42	10,342

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		3.48s	230	0
GPT-5.2	3.7	9.7	0.0%	0		4.32s	162	269

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.8	9.9	10.0	100.0%	0		1.37s	95	0
GPT-5.2	9.9	10.0	100.0%	0		3.12s	94	614

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.8	7.7	10.0	66.7%	0		2.74s	783	0
GPT-5.2	7.5	7.3	77.8%	1		5.80s	735	924

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		5.35s	355	0
GPT-5.2	4.7	1.6	66.7%	1		10.30s	239	469

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.8	3.0	10.0	0.0%	0		3.41s	212	0
GPT-5.2	3.0	10.0	0.0%	0		28.18s	26	3,223

Быстрое сравнение

Сменить пару сравнения

Claude Opus 4.8nonevsQwen3.5-35B-A3Bmedium Claude Opus 4.8nonevsRing-2.6-1Tmedium Claude Opus 4.8nonevsGPT-5.4 Minimedium Claude Opus 4.8nonevsGLM 5V Turbomedium Ring-2.6-1TnonevsGPT-5.2medium Claude Opus 4.8nonevsGPT-5.4 Nanomedium Gemini 3.1 Flash LitelowvsGPT-5.2medium Claude Opus 4.8nonevsStep 3.5 Flashmedium Claude Opus 4.8nonevsGPT-5 Minimedium Claude Opus 4.8nonevsKimi K2.6mediumБесплатно доступно Claude Opus 4.8nonevsMiMo-V2.5medium Gemini 3.1 Flash Lite PreviewnonevsGPT-5.2medium