AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.2 Chat

Сводка

Сравнение benchmark Claude Opus 4.8 (medium) vs GPT-5.2 Chat: Claude Opus 4.8 (medium) лидирует по среднему баллу: 8.8 vs 8.5. GPT-5.2 Chat имеет более низкую стоимость benchmark: $0.393 vs $1.107. GPT-5.2 Chat быстрее: 7.13s vs 9.72s, с долей успешных попыток 84.1% vs 74.6%.

Рекомендуемая модель: GPT-5.2 Chat - Его балл близок к лучшему здесь (8.5 против 8.8), при этом он примерно в 2.8 раза дешевле, чем Claude Opus 4.8 (medium).

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-07-10

Метрика	Claude Opus 4.8 Claude Opus 4.8 medium Релиз: 2026-05-28	GPT-5.2 Chat GPT-5.2 Chat none Релиз: 2025-12-11

Метрика	Claude Opus 4.8 Claude Opus 4.8 medium Релиз: 2026-05-28	GPT-5.2 Chat GPT-5.2 Chat none Релиз: 2025-12-11
Оценка	8.8	8.5
Ранг	#15	#22
Надежность	10.0	10.0
Стабильность	9.6	8.9
Тестов верно
Доля успешных попыток	84.1%	74.6%
Нестабильные тесты	1	3
Всего запусков	63	63
Стоимость за результат	6.512	2.803
Общая стоимость	$1.107	$0.393
Цена входа	$5.000 / 1M	$1.750 / 1M
Цена выхода	$25.000 / 1M	$14.000 / 1M
Общее число входных токенов	61,007	34,212
Выходные токены	26,495	23,744
Токены рассуждений	5,901	0
Время ответа (среднее)	9.72s	7.13s
Время ответа (макс.)	38.03s	38.52s
Время ответа (суммарно)	204.19s	149.69s

Генерация showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#15 Claude Opus 4.8

medium

Стоимость: $0.057
Время: 23.1s
Токены: 2,412 tok

#22 GPT-5.2 Chat

none

Стоимость: $0.010
Время: 15.3s
Токены: 797 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	834	1,179	478
GPT-5.2 Chat	8.7	7.9	91.7%	1		3.40s	606	1,807	0

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		15.33s	10,590	9,945	1,381
GPT-5.2 Chat	8.8	7.8	88.9%	1		9.82s	7,305	6,731	0

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	9.8	10.0	100.0%	0		38.03s	23,561	5,260	1,588
GPT-5.2 Chat	10.0	10.0	100.0%	0		9.12s	11,019	1,243	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	7.1	5.6	83.3%	1		12.29s	10,503	481	312
GPT-5.2 Chat	10.0	10.0	100.0%	0		3.05s	7,140	980	0

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	5.3	10.0	33.3%	0		14.59s	975	7,477	900
GPT-5.2 Chat	5.3	10.0	33.3%	0		17.78s	723	7,810	0

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		2.46s	708	237	0
GPT-5.2 Chat	4.4	3.0	33.3%	1		3.20s	477	335	0

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		3.32s	909	373	320
GPT-5.2 Chat	9.8	10.0	100.0%	0		5.51s	660	1,441	0

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	894	791	483
GPT-5.2 Chat	7.7	10.0	66.7%	0		4.10s	642	1,603	0

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		8.96s	11,775	301	225
GPT-5.2 Chat	10.0	10.0	100.0%	0		4.68s	5,445	555	0

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	3.0	10.0	0.0%	0		6.14s	258	451	214
GPT-5.2 Chat	3.0	10.0	0.0%	0		6.89s	195	1,239	0

Быстрое сравнение

Сменить пару сравнения

Seed-2.0-LitemediumvsGPT-5.2 Chatnone GPT-5.2 ChatnonevsStep 3.7 Flashmedium GPT-5.2 ChatnonevsGLM 5medium GPT-5.2 ChatnonevsGrok 4.5medium GPT-5.2 ChatnonevsGLM 5.2medium DeepSeek V4 FlashhighvsGPT-5.2 Chatnone Claude Opus 4.7mediumvsGPT-5.2 Chatnone Gemini 2.5 FlashmediumvsGPT-5.2 Chatnone GPT-5.2 ChatnonevsQwen3.7 Plusmedium Nemotron 3 Ultra 550b A55bmediumБесплатно доступноvsGPT-5.2 Chatnone GPT-5.2 ChatnonevsQwen3.6 Max Previewmedium Claude Opus 4.8mediumvsGemini 3.5 Flashlow