Навигация
AI BENCHY
Advertise here

Kwaipilot: KAT-Coder-Air V2.5 vs OpenAI: GPT-5.4 Mini

GPT-5.4 Mini лидирует по среднему баллу: 5.9 vs 5.6. KAT-Coder-Air V2.5 (high) имеет более низкую стоимость benchmark: $0.077 vs $0.095. GPT-5.4 Mini быстрее: 1.53s vs 15.90s, с долей успешных попыток 43.9% vs 33.3%.

Рекомендуемая модельGPT-5.4 MiniЗдесь у него лучший балл (5.9), и он отвечает примерно в 10.4 раза быстрее, чем KAT-Coder-Air V2.5 (high).

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-07-21

Метрика KAT-Coder-Air V2.5 KAT-Coder-Air V2.5 high Релиз: 2026-07-14 GPT-5.4 Mini GPT-5.4 Mini none Релиз: 2026-03-17
Оценка 5.6 5.9
Ранг #150 #142
Надежность 9.9 10.0
Стабильность 7.7 8.9
Тестов верно
Доля успешных попыток 43.9% 33.3%
Нестабильные тесты 6 3
Всего запусков 66 66
Стоимость за результат 1.097 1.580
Общая стоимость $0.077 $0.095
Цена входа $0.150 / 1M $0.750 / 1M
Цена выхода $0.600 / 1M $4.500 / 1M
Общее число входных токенов 50,470 79,067
Выходные токены 3,957 7,880
Токены рассуждений 111,374 0
Время ответа (среднее) 15.90s 1.53s
Время ответа (макс.) 118.35s 9.92s
Время ответа (суммарно) 349.71s 33.74s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#150 KAT-Coder-Air V2.5

high
Неверный SVG
Стоимость
$0.000
Время
300.0s
Токены
0 tok

#142 GPT-5.4 Mini

none
Стоимость
$0.010
Время
11.7s
Токены
2,151 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
KAT-Coder-Air V2.5 4.3 7.3 11.1% 1 39.07s 6,948 1,166 55,883
GPT-5.4 Mini 5.5 10.0 33.3% 0 913ms 7,305 401 0

Быстрое сравнение

Сменить пару сравнения