Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Anthropic: Claude Opus 4.7 vs OpenAI: GPT-5.4

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-04

Метрика Claude Opus 4.7 Claude Opus 4.7 medium Релиз: 2026-04-16 GPT-5.4 GPT-5.4 medium Релиз: 2026-03-05
Оценка 8.7 8.0
Ранг #11 #21
Надежность 10.0 10.0
Стабильность 9.6 8.6
Тестов верно
Доля успешных попыток 82.5% 76.2%
Нестабильные тесты 1 4
Всего запусков 63 63
Стоимость за результат 3.991 8.640
Общая стоимость $0.679 $1.210
Цена входа $5.000 / 1M $2.500 / 1M
Цена выхода $25.000 / 1M $15.000 / 1M
Общее число входных токенов 65,406 34,108
Выходные токены 11,858 2,242
Токены рассуждений 2,198 72,707
Время ответа (среднее) 4.73s 22.35s
Время ответа (макс.) 23.18s 100.41s
Время ответа (суммарно) 94.51s 469.29s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Claude Opus 4.7 8.3 10.0 75.0% 0 1.85s 894 348 0
GPT-5.4 8.3 10.0 75.0% 0 4.11s 606 240 1,511
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Claude Opus 4.7 10.0 10.0 100.0% 0 21.45s 24,501 2,369 1,084
GPT-5.4 10.0 10.0 100.0% 0 20.57s 11,019 301 3,543
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Claude Opus 4.7 10.0 10.0 100.0% 0 2.37s 10,533 324 0
GPT-5.4 10.0 10.0 100.0% 0 5.32s 7,140 234 804
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Claude Opus 4.7 7.7 10.0 66.7% 0 1.17s 630 51 0
GPT-5.4 5.3 7.2 44.4% 1 74.27s 619 61 34,748
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Claude Opus 4.7 10.0 10.0 100.0% 0 2.87s 723 256 0
GPT-5.4 4.7 3.1 33.3% 1 4.92s 477 145 321
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Claude Opus 4.7 10.0 10.0 100.0% 0 1.57s 939 114 0
GPT-5.4 10.0 10.0 100.0% 0 3.11s 660 93 897
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Claude Opus 4.7 10.0 10.0 100.0% 0 2.43s 939 370 0
GPT-5.4 8.2 7.2 88.9% 1 9.14s 642 441 3,815
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Claude Opus 4.7 10.0 10.0 100.0% 0 4.17s 15,339 373 0
GPT-5.4 10.0 10.0 100.0% 0 13.28s 5,445 264 1,031
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Claude Opus 4.7 3.0 10.0 0.0% 0 2.25s 273 24 0
GPT-5.4 3.0 10.0 0.0% 0 13.95s 195 30 1,821

Быстрое сравнение

Сменить пару сравнения