Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Kwaipilot: KAT-Coder-Air V2.5 vs OpenAI: GPT-5.4

GPT-5.4 лидирует по среднему баллу: 5.8 vs 5.4. KAT-Coder-Air V2.5 (low) имеет более низкую стоимость benchmark: $0.041 vs $0.397. GPT-5.4 быстрее: 2.07s vs 10.09s, с долей успешных попыток 45.5% vs 34.9%.

Рекомендуемая модельGPT-5.4Здесь у него лучший балл (5.8), и он отвечает примерно в 4.9 раза быстрее, чем KAT-Coder-Air V2.5 (low).

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-07-18

Метрика KAT-Coder-Air V2.5 KAT-Coder-Air V2.5 low Релиз: 2026-07-14 GPT-5.4 GPT-5.4 none Релиз: 2026-03-05
Оценка 5.4 5.8
Ранг #154 #135
Надежность 9.9 10.0
Стабильность 7.4 9.2
Тестов верно
Доля успешных попыток 45.5% 34.9%
Нестабильные тесты 7 2
Всего запусков 66 66
Стоимость за результат 0.585 5.663
Общая стоимость $0.041 $0.397
Цена входа $0.150 / 1M $2.500 / 1M
Цена выхода $0.600 / 1M $15.000 / 1M
Общее число входных токенов 61,085 108,632
Выходные токены 5,905 8,321
Токены рассуждений 46,990 0
Время ответа (среднее) 10.09s 2.07s
Время ответа (макс.) 86.23s 15.63s
Время ответа (суммарно) 222.03s 45.51s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#154 KAT-Coder-Air V2.5

low
Стоимость
$0.004
Время
29.9s
Токены
6,008 tok

#135 GPT-5.4

none
Стоимость
$0.026
Время
18.1s
Токены
1,792 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
KAT-Coder-Air V2.5 3.5 7.3 11.1% 1 11.06s 7,893 2,001 13,623
GPT-5.4 5.5 10.0 33.3% 0 1.62s 7,305 516 0

Быстрое сравнение

Сменить пару сравнения