AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.5

Сводка

Сравнение benchmark Claude Opus 4.8 (medium) vs GPT-5.5 (medium): GPT-5.5 (medium) лидирует по среднему баллу: 9.0 vs 8.8. Claude Opus 4.8 (medium) имеет более низкую стоимость benchmark: $1.107 vs $3.679. Claude Opus 4.8 (medium) быстрее: 9.72s vs 37.98s, с долей успешных попыток 84.1% vs 87.3%.

Рекомендуемая модель: Claude Opus 4.8 (medium) - Его балл близок к лучшему здесь (8.8 против 9.0), при этом он примерно в 3.3 раза дешевле, чем GPT-5.5 (medium).

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-07-10

Метрика	Claude Opus 4.8 Claude Opus 4.8 medium Релиз: 2026-05-28	GPT-5.5 GPT-5.5 medium Релиз: 2026-04-24

Метрика	Claude Opus 4.8 Claude Opus 4.8 medium Релиз: 2026-05-28	GPT-5.5 GPT-5.5 medium Релиз: 2026-04-24
Оценка	8.8	9.0
Ранг	#15	#12
Надежность	10.0	10.0
Стабильность	9.6	8.9
Тестов верно
Доля успешных попыток	84.1%	87.3%
Нестабильные тесты	1	3
Всего запусков	63	63
Стоимость за результат	6.512	21.638
Общая стоимость	$1.107	$3.679
Цена входа	$5.000 / 1M	$5.000 / 1M
Цена выхода	$25.000 / 1M	$30.000 / 1M
Общее число входных токенов	61,007	34,212
Выходные токены	26,495	1,985
Токены рассуждений	5,901	114,925
Время ответа (среднее)	9.72s	37.98s
Время ответа (макс.)	38.03s	332.10s
Время ответа (суммарно)	204.19s	797.60s

Генерация showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#15 Claude Opus 4.8

medium

Стоимость: $0.057
Время: 23.1s
Токены: 2,412 tok

#12 GPT-5.5

medium

Стоимость: $0.112
Время: 71.9s
Токены: 3,807 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	834	1,179	478
GPT-5.5	10.0	10.0	100.0%	0		4.66s	606	250	1,335

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		15.33s	10,590	9,945	1,381
GPT-5.5	8.8	7.8	88.9%	1		59.77s	7,305	362	24,959

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	9.8	10.0	100.0%	0		38.03s	23,561	5,260	1,588
GPT-5.5	10.0	10.0	100.0%	0		19.29s	11,019	312	2,841

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	7.1	5.6	83.3%	1		12.29s	10,503	481	312
GPT-5.5	10.0	10.0	100.0%	0		4.18s	7,140	234	593

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	5.3	10.0	33.3%	0		14.59s	975	7,477	900
GPT-5.5	5.3	7.2	44.4%	1		164.14s	723	67	79,625

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		2.46s	708	237	0
GPT-5.5	10.0	10.0	100.0%	0		4.16s	477	138	223

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		3.32s	909	373	320
GPT-5.5	10.0	10.0	100.0%	0		3.36s	660	93	538

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	894	791	483
GPT-5.5	10.0	10.0	100.0%	0		6.76s	642	241	2,225

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		8.96s	11,775	301	225
GPT-5.5	10.0	10.0	100.0%	0		10.57s	5,445	258	832

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	3.0	10.0	0.0%	0		6.14s	258	451	214
GPT-5.5	2.8	1.6	33.3%	1		37.86s	195	30	1,754

Быстрое сравнение

Сменить пару сравнения

Gemini 3.5 FlashlowvsGPT-5.5medium Claude Opus 4.8mediumvsGPT-5.2 Chatnone Claude Opus 4.8mediumvsGemini 3.5 Flashlow Claude Opus 4.8mediumvsGPT-5.5low Claude Opus 4.8mediumvsGPT-5.6 Solhigh Claude Opus 4.8mediumvsDeepSeek V4 Flashhigh Claude Opus 4.8mediumvsGPT-5.6 Terrahigh Claude Opus 4.8mediumvsGPT-5.6 Sollow DeepSeek V4 FlashhighvsGPT-5.5medium Claude Opus 4.8mediumvsGLM 5.2high Gemini 3.5 FlashhighvsGPT-5.5medium GPT-5.5mediumvsGLM 5.2high