Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Anthropic: Claude Sonnet 4.6 vs OpenAI: GPT-5.4 Mini

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-03-21

Метрика Claude Sonnet 4.6 Claude Sonnet 4.6 medium Релиз: 2026-02-17 GPT-5.4 Mini GPT-5.4 Mini medium Релиз: 2026-03-17
Оценка 7.9 7.1
Ранг #21 #36
Стабильность 9.5 7.2
Тестов верно
Доля успешных попыток 72.6% 68.6%
Нестабильные тесты 1 6
Всего запусков 51 51
Стоимость за результат 8.531 3.610
Общая стоимость $1.024 $0.289
???? ????? $3.000 / 1M $0.750 / 1M
???? ?????? $15.000 / 1M $4.500 / 1M
Выходные токены 35,174 1,708
Токены рассуждений 24,687 58,019
Время ответа (среднее) 10.09s 15.66s
Время ответа (макс.) 46.35s 102.91s
Время ответа (суммарно) 90.85s 266.14s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Sonnet 4.6 6.5 10.0 50.0% 0 2.98s 1,046 1,093
GPT-5.4 Mini 8.6 7.9 91.7% 1 4.05s 296 2,876
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Sonnet 4.6 10.0 10.0 100.0% 0 46.35s 5,871 3,962
GPT-5.4 Mini 10.0 10.0 100.0% 0 17.81s 317 4,317
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Sonnet 4.6 10.0 10.0 100.0% 0 13.90s 649 742
GPT-5.4 Mini 10.0 10.0 100.0% 0 2.43s 234 650
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Sonnet 4.6 2.9 7.2 11.1% 1 0ms 25,790 16,919
GPT-5.4 Mini 4.1 4.4 44.5% 2 65.31s 60 43,286
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Sonnet 4.6 10.0 10.0 100.0% 0 4.94s 256 433
GPT-5.4 Mini 4.5 10.0 0.0% 0 3.72s 150 510
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Sonnet 4.6 10.0 10.0 100.0% 0 2.61s 318 552
GPT-5.4 Mini 7.4 6.5 66.7% 1 2.50s 129 1,337
Puzzle Solving Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Sonnet 4.6 10.0 10.0 100.0% 0 4.80s 589 635
GPT-5.4 Mini 6.8 7.9 55.6% 1 4.33s 271 2,449
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Sonnet 4.6 10.0 10.0 100.0% 0 7.48s 655 351
GPT-5.4 Mini 4.7 1.6 66.7% 1 9.62s 251 2,594

Быстрое сравнение

Сменить пару сравнения