AI BENCHY Compare

Anthropic: Claude Opus 4.7 vs OpenAI: GPT-5.4

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-04-16

Метрика	Claude Opus 4.7 Claude Opus 4.7 none Релиз: 2026-04-16	GPT-5.4 GPT-5.4 medium Релиз: 2026-03-05

Метрика	Claude Opus 4.7 Claude Opus 4.7 none Релиз: 2026-04-16	GPT-5.4 GPT-5.4 medium Релиз: 2026-03-05
Оценка	9.2	8.2
Ранг	#4	#16
Стабильность	10.0	8.7
Тестов верно
Доля успешных попыток	88.9%	79.6%
Нестабильные тесты	0	3
Всего запусков	54	54
Стоимость за результат	3.155	6.399
Общая стоимость	$0.505	$0.832
???? ?????	$5.000 / 1M	$2.500 / 1M
???? ??????	$25.000 / 1M	$15.000 / 1M
Выходные токены	6,326	2,169
Токены рассуждений	0	48,732
Время ответа (среднее)	3.13s	18.63s
Время ответа (макс.)	18.27s	100.41s
Время ответа (суммарно)	56.33s	335.26s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.7	8.3	10.0	75.0%	0		2.12s	522	0
GPT-5.4	8.3	10.0	75.0%	0		4.11s	240	1,511

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.7	10.0	10.0	100.0%	0		2.84s	494	0
GPT-5.4	10.0	10.0	100.0%	0		13.03s	389	2,045

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.7	9.5	10.0	100.0%	0		18.27s	3,504	0
GPT-5.4	10.0	10.0	100.0%	0		20.57s	301	3,543

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.7	10.0	10.0	100.0%	0		2.15s	324	0
GPT-5.4	10.0	10.0	100.0%	0		5.32s	234	804

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.7	7.7	10.0	66.7%	0		1.19s	78	0
GPT-5.4	5.3	7.2	44.4%	1		74.27s	61	34,748

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.7	10.0	10.0	100.0%	0		3.47s	257	0
GPT-5.4	4.7	3.1	33.3%	1		4.92s	145	321

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.7	10.0	10.0	100.0%	0		1.46s	114	0
GPT-5.4	10.0	10.0	100.0%	0		3.11s	93	897

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.7	10.0	10.0	100.0%	0		2.58s	661	0
GPT-5.4	8.2	7.2	88.9%	1		9.13s	442	3,832

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Claude Opus 4.7	10.0	10.0	100.0%	0		4.74s	372	0
GPT-5.4	10.0	10.0	100.0%	0		13.28s	264	1,031

Быстрое сравнение

Сменить пару сравнения

Gemini 3 Flash PreviewnonevsGPT-5.4medium Gemini 3.1 Flash Lite PreviewlowvsGPT-5.4medium Gemini 3.1 Flash Lite PreviewnonevsGPT-5.4medium Claude Opus 4.7nonevsGemini 3 Flash Previewlow Claude Opus 4.7nonevsGemini 3.1 Pro Previewmedium Claude Opus 4.7nonevsSeed-2.0-Litemedium Gemini 3 Flash PreviewlowvsGPT-5.4medium Claude Opus 4.7nonevsGPT-5.3-Codexmedium Claude Opus 4.7nonevsQwen3.5 Plus 2026-02-15medium Claude Opus 4.7nonevsQwen3.6 Plus PreviewmediumБесплатно доступно Claude Opus 4.7nonevsQwen3.5-27Bmedium Claude Opus 4.7nonevsGemini 3 PRO Previewmedium