Навигация
AI BENCHY
Advertise here

Kwaipilot: KAT-Coder-Air V2.5 vs Mistral: Mistral Small 4

KAT-Coder-Air V2.5 (medium) лидирует по среднему баллу: 5.6 vs 5.1. Mistral Small 4 имеет более низкую стоимость benchmark: $0.022 vs $0.048. Mistral Small 4 быстрее: 1.20s vs 8.42s, с долей успешных попыток 45.5% vs 25.8%.

Рекомендуемая модельMistral Small 4Его балл близок к лучшему здесь (5.1 против 5.6), при этом он примерно в 2.2 раза дешевле, чем KAT-Coder-Air V2.5 (medium).

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-07-18

Метрика KAT-Coder-Air V2.5 KAT-Coder-Air V2.5 medium Релиз: 2026-07-14 Mistral Small 4 Mistral Small 4 none Релиз: 2026-03-16
Оценка 5.6 5.1
Ранг #145 #161
Надежность 9.9 10.0
Стабильность 8.9 9.6
Тестов верно
Доля успешных попыток 45.5% 25.8%
Нестабильные тесты 3 1
Всего запусков 66 66
Стоимость за результат 0.593 0.432
Общая стоимость $0.048 $0.022
Цена входа $0.150 / 1M $0.150 / 1M
Цена выхода $0.600 / 1M $0.600 / 1M
Общее число входных токенов 51,472 104,708
Выходные токены 7,822 9,812
Токены рассуждений 58,352 0
Время ответа (среднее) 8.42s 1.20s
Время ответа (макс.) 48.19s 13.16s
Время ответа (суммарно) 185.24s 26.38s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#145 KAT-Coder-Air V2.5

medium
Стоимость
$0.003
Время
23.7s
Токены
4,924 tok

#161 Mistral Small 4

none
Стоимость
$0.002
Время
10.4s
Токены
2,370 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
KAT-Coder-Air V2.5 3.6 7.0 22.2% 1 23.37s 7,893 5,199 29,973
Mistral Small 4 3.7 9.7 0.0% 0 901ms 7,636 619 0

Быстрое сравнение

Сменить пару сравнения