AI BENCHY Compare

Anthropic: Claude Opus 4.6 vs OpenAI: GPT-5.2

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-04-30

Метрика	Claude Opus 4.6 Claude Opus 4.6 medium Релиз: 2026-02-05	GPT-5.2 GPT-5.2 medium Релиз: 2025-12-11

Метрика	Claude Opus 4.6 Claude Opus 4.6 medium Релиз: 2026-02-05	GPT-5.2 GPT-5.2 medium Релиз: 2025-12-11
Оценка	7.6	7.5
Ранг	#49	#53
Надежность	Н/Д	Н/Д
Стабильность	9.1	8.1
Тестов верно
Доля успешных попыток	70.4%	72.2%
Нестабильные тесты	2	4
Всего запусков	54	54
Стоимость за результат	12.047	3.193
Общая стоимость	$1.446	$0.352
???? ?????	$5.000 / 1M	$1.750 / 1M
???? ??????	$25.000 / 1M	$14.000 / 1M
Выходные токены	29,829	2,705
Токены рассуждений	18,938	18,977
Время ответа (среднее)	21.08s	14.04s
Время ответа (макс.)	83.40s	77.80s
Время ответа (суммарно)	231.84s	154.41s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.6	6.4	5.8	66.7%	2		7.45s	986	1,071
GPT-5.2	6.5	8.0	58.3%	1		7.81s	567	2,002

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.6	10.0	10.0	100.0%	0		23.11s	3,486	1,504
GPT-5.2	10.0	10.0	100.0%	0		15.12s	467	2,166

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.6	10.0	10.0	100.0%	0		76.66s	8,178	5,194
GPT-5.2	10.0	10.0	100.0%	0		14.06s	291	1,757

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.6	10.0	10.0	100.0%	0		7.37s	691	757
GPT-5.2	10.0	10.0	100.0%	0		3.15s	234	420

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.6	3.0	10.0	0.0%	0		83.40s	14,642	8,687
GPT-5.2	5.9	7.2	55.6%	1		77.80s	42	10,342

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.6	10.0	10.0	100.0%	0		5.04s	188	292
GPT-5.2	3.7	9.7	0.0%	0		4.32s	162	269

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.6	10.0	10.0	100.0%	0		2.43s	266	467
GPT-5.2	9.9	10.0	100.0%	0		3.12s	94	614

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.6	7.7	10.0	66.7%	0		4.60s	531	637
GPT-5.2	7.7	7.3	77.8%	1		5.47s	609	938

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.6	10.0	10.0	100.0%	0		9.73s	861	329
GPT-5.2	4.7	1.6	66.7%	1		10.30s	239	469

Быстрое сравнение

Сменить пару сравнения

GPT-5.2mediumvsQwen3.6 Max Previewnone Claude Sonnet 4.6nonevsGPT-5.2medium Claude Opus 4.6mediumvsQwen3.6 Max Previewnone Claude Opus 4.6mediumvsDeepSeek V4 Flashhigh Claude Opus 4.6mediumvsGPT-5.3 Chatnone Claude Opus 4.6mediumvsGemini 3.1 Flash Lite Previewnone Claude Opus 4.6mediumvsGPT-5.2 Chatnone DeepSeek V4 FlashhighvsGPT-5.2medium Gemini 3.1 Flash Lite PreviewnonevsGPT-5.2medium Claude Opus 4.6mediumvsGemini 3.1 Flash Lite Previewlow Claude Opus 4.6mediumvsGemini 3 Flash Previewnone Claude Opus 4.6mediumvsHY3 PreviewlowБесплатно доступно