AI BENCHY Compare

Anthropic: Claude Opus 4.7 vs OpenAI: GPT-5.5

Сводка

Сравнение benchmark Claude Opus 4.7 vs GPT-5.5: GPT-5.5 лидирует по среднему баллу: 9.0 vs 7.4. Claude Opus 4.7 имеет более низкую стоимость benchmark: $0.505 vs $3.679. Claude Opus 4.7 быстрее: 3.02s vs 37.98s, с долей успешных попыток 76.2% vs 87.3%.

Рекомендуемая модель: Claude Opus 4.7 - Он дает лучший общий компромисс: конкурентный балл (7.4), ниже стоимость, чем у GPT-5.5, и сбалансированное время ответа.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-18

Метрика	Claude Opus 4.7 Claude Opus 4.7 none Релиз: 2026-04-16	GPT-5.5 GPT-5.5 medium Релиз: 2026-04-24

Метрика	Claude Opus 4.7 Claude Opus 4.7 none Релиз: 2026-04-16	GPT-5.5 GPT-5.5 medium Релиз: 2026-04-24
Оценка	7.4	9.0
Ранг	#49	#9
Надежность	10.0	10.0
Стабильность	9.0	8.9
Тестов верно
Доля успешных попыток	76.2%	87.3%
Нестабильные тесты	0	3
Всего запусков	57	63
Стоимость за результат	3.154	21.638
Общая стоимость	$0.505	$3.679
Цена входа	$5.000 / 1M	$5.000 / 1M
Цена выхода	$25.000 / 1M	$30.000 / 1M
Общее число входных токенов	69,576	34,212
Выходные токены	6,265	1,985
Токены рассуждений	0	114,925
Время ответа (среднее)	3.02s	37.98s
Время ответа (макс.)	18.27s	332.10s
Время ответа (суммарно)	57.44s	797.60s

Генерация showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#49 Claude Opus 4.7

none

Стоимость: $0.051
Время: 24.2s
Токены: 2,181 tok

#9 GPT-5.5

medium

Стоимость: $0.112
Время: 71.9s
Токены: 3,807 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.7	8.3	10.0	75.0%	0		2.12s	894	522	0
GPT-5.5	10.0	10.0	100.0%	0		4.66s	606	250	1,335

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.7	3.3	3.3	33.3%	0		2.84s	1,176	494	0
GPT-5.5	8.8	7.8	88.9%	1		59.77s	7,305	362	24,959

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.7	9.5	10.0	100.0%	0		18.27s	37,740	3,504	0
GPT-5.5	10.0	10.0	100.0%	0		19.29s	11,019	312	2,841

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.7	10.0	10.0	100.0%	0		2.15s	10,533	324	0
GPT-5.5	10.0	10.0	100.0%	0		4.18s	7,140	234	593

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.7	7.7	10.0	66.7%	0		1.19s	1,020	78	0
GPT-5.5	5.3	7.2	44.4%	1		164.14s	723	67	79,625

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.7	10.0	10.0	100.0%	0		3.47s	723	257	0
GPT-5.5	10.0	10.0	100.0%	0		4.16s	477	138	223

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.7	10.0	10.0	100.0%	0		1.46s	939	114	0
GPT-5.5	10.0	10.0	100.0%	0		3.36s	660	93	538

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.7	10.0	10.0	100.0%	0		2.46s	939	597	0
GPT-5.5	10.0	10.0	100.0%	0		6.76s	642	241	2,225

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.7	10.0	10.0	100.0%	0		4.74s	15,339	372	0
GPT-5.5	10.0	10.0	100.0%	0		10.57s	5,445	258	832

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.7	3.0	10.0	0.0%	0		1.46s	273	3	0
GPT-5.5	2.8	1.6	33.3%	1		37.86s	195	30	1,754

Быстрое сравнение

Сменить пару сравнения

Gemini 3.5 FlashlowvsGPT-5.5medium DeepSeek V4 FlashhighvsGPT-5.5medium Gemini 3.5 FlashhighvsGPT-5.5medium GPT-5.5mediumvsStep 3.7 Flashlow DeepSeek V4 ProhighvsGPT-5.5medium Gemini 3 Flash PreviewlowvsGPT-5.5medium Claude Sonnet 4.6nonevsGPT-5.5medium Claude Opus 4.8nonevsGPT-5.5medium DeepSeek V4 PrononevsGPT-5.5medium GPT-5.5mediumvsQwen3.7 Plusnone GPT-5.5mediumvsGLM 5.2none GPT-5.5mediumvsStep 3.7 Flashhigh