Навигация
AI BENCHY
Advertise here

AI BENCHY Compare

OpenAI: GPT-5.2 Chat vs OpenAI: GPT-5.4

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-01

Метрика GPT-5.2 Chat GPT-5.2 Chat none Релиз: 2025-12-11 GPT-5.4 GPT-5.4 medium Релиз: 2026-03-05
Оценка 7.9 7.9
Ранг #32 #29
Надежность 10.0 10.0
Стабильность 8.9 8.5
Тестов верно
Доля успешных попыток 73.3% 75.0%
Нестабильные тесты 3 4
Всего запусков 60 60
Стоимость за результат 2.703 8.765
Общая стоимость $0.352 $1.140
Цена входа $1.750 / 1M $2.500 / 1M
Цена выхода $14.000 / 1M $15.000 / 1M
Выходные токены 21,144 2,221
Токены рассуждений 0 68,486
Время ответа (среднее) 6.82s 22.31s
Время ответа (макс.) 38.52s 100.41s
Время ответа (суммарно) 136.34s 446.17s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
GPT-5.2 Chat 8.7 7.9 91.7% 1 3.40s 1,807 0
GPT-5.4 8.3 10.0 75.0% 0 4.11s 240 1,511
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
GPT-5.2 Chat 8.2 6.7 83.3% 1 8.05s 4,131 0
GPT-5.4 8.2 6.7 83.3% 1 54.98s 412 19,995
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
GPT-5.2 Chat 10.0 10.0 100.0% 0 9.12s 1,243 0
GPT-5.4 10.0 10.0 100.0% 0 20.57s 301 3,543
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
GPT-5.2 Chat 10.0 10.0 100.0% 0 3.05s 980 0
GPT-5.4 10.0 10.0 100.0% 0 5.32s 234 804
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
GPT-5.2 Chat 5.3 10.0 33.3% 0 17.78s 7,810 0
GPT-5.4 5.3 7.2 44.4% 1 74.27s 61 34,748
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
GPT-5.2 Chat 4.4 3.0 33.3% 1 3.20s 335 0
GPT-5.4 4.7 3.1 33.3% 1 4.92s 145 321
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
GPT-5.2 Chat 9.8 10.0 100.0% 0 5.51s 1,441 0
GPT-5.4 10.0 10.0 100.0% 0 3.11s 93 897
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
GPT-5.2 Chat 7.7 10.0 66.7% 0 4.10s 1,603 0
GPT-5.4 8.2 7.2 88.9% 1 9.14s 441 3,815
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
GPT-5.2 Chat 10.0 10.0 100.0% 0 4.68s 555 0
GPT-5.4 10.0 10.0 100.0% 0 13.28s 264 1,031
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
GPT-5.2 Chat 3.0 10.0 0.0% 0 6.89s 1,239 0
GPT-5.4 3.0 10.0 0.0% 0 13.95s 30 1,821

Быстрое сравнение

Сменить пару сравнения