Навигация
AI BENCHY
Advertise here

Inception: Mercury 2 vs Kwaipilot: KAT-Coder-Air V2.5

KAT-Coder-Air V2.5 (low) лидирует по среднему баллу: 5.4 vs 4.6. Mercury 2 имеет более низкую стоимость benchmark: $0.030 vs $0.041. Mercury 2 быстрее: 829ms vs 10.09s, с долей успешных попыток 22.7% vs 45.5%.

Рекомендуемая модельKAT-Coder-Air V2.5 (low)У него самый высокий балл в этом сравнении (5.4) и лучший общий баланс стоимости и времени ответа среди всех 2 моделей.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-07-18

Метрика Mercury 2 Mercury 2 none Релиз: 2026-02-24 KAT-Coder-Air V2.5 KAT-Coder-Air V2.5 low Релиз: 2026-07-14
Оценка 4.6 5.4
Ранг #185 #154
Надежность 10.0 9.9
Стабильность 9.2 7.4
Тестов верно
Доля успешных попыток 22.7% 45.5%
Нестабильные тесты 2 7
Всего запусков 66 66
Стоимость за результат 0.734 0.585
Общая стоимость $0.030 $0.041
Цена входа $0.250 / 1M $0.150 / 1M
Цена выхода $0.750 / 1M $0.600 / 1M
Общее число входных токенов 88,704 61,085
Выходные токены 9,564 5,905
Токены рассуждений 0 46,990
Время ответа (среднее) 829ms 10.09s
Время ответа (макс.) 4.52s 86.23s
Время ответа (суммарно) 18.24s 222.03s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#185 Mercury 2

none
Стоимость
$0.002
Время
1.8s
Токены
1,514 tok

#154 KAT-Coder-Air V2.5

low
Стоимость
$0.004
Время
29.9s
Токены
6,008 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Mercury 2 3.4 9.6 0.0% 0 1.03s 7,229 3,088 0
KAT-Coder-Air V2.5 3.5 7.3 11.1% 1 11.06s 7,893 2,001 13,623

Быстрое сравнение

Сменить пару сравнения