Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Сравниваемые модели

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-04-27

Метрика DeepSeek V4 Pro DeepSeek V4 Pro high Релиз: 2026-04-24 DeepSeek V4 Flash DeepSeek V4 Flash high Релиз: 2026-04-24 DeepSeek V3.2 DeepSeek V3.2 medium Релиз: 2025-12-01 Kimi K2.6 Kimi K2.6 medium Релиз: 2026-04-20
Оценка 6.8 7.8 8.0 7.7
Ранг #63 #41 #37 #46
Надежность 8.4 10.0 Н/Д Н/Д
Стабильность 8.0 7.8 8.2 8.3
Тестов верно
Доля успешных попыток 73.2% 79.6% 79.6% 74.1%
Нестабильные тесты 4 5 4 4
Всего запусков 54 54 52 54
Стоимость за результат 1.825 0.277 0.231 6.563
Общая стоимость $0.201 $0.031 $0.028 $0.722
???? ????? $0.435 / 1M $0.140 / 1M $0.252 / 1M $0.745 / 1M
???? ?????? $0.870 / 1M $0.280 / 1M $0.378 / 1M $4.655 / 1M
Выходные токены 11,876 1,765 7,554 80,759
Токены рассуждений 45,999 90,299 45,588 179,814
Время ответа (среднее) 60.02s 45.41s 43.49s 45.20s
Время ответа (макс.) 358.35s 218.13s 180.92s 215.85s
Время ответа (суммарно) 1080.31s 817.30s 782.73s 768.37s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Pro 7.4 10.0 75.0% 0 16.53s 71 3,617
DeepSeek V4 Flash 8.3 10.0 75.0% 0 28.51s 140 7,770
DeepSeek V3.2 8.4 9.9 75.0% 0 30.72s 3,773 7,523
Kimi K2.6 7.0 8.0 66.7% 1 11.59s 7,115 8,934
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Pro 2.6 0.0 50.0% 1 51.77s 105 2,641
DeepSeek V4 Flash 10.0 10.0 100.0% 0 62.48s 369 9,361
DeepSeek V3.2 4.7 1.6 66.7% 1 180.92s 626 6,792
Kimi K2.6 10.0 10.0 100.0% 0 106.96s 3,236 18,817
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Pro 6.6 10.0 100.0% 0 64.72s 183 1,946
DeepSeek V4 Flash 10.0 10.0 100.0% 0 76.57s 465 7,347
DeepSeek V3.2 10.0 10.0 100.0% 0 93.11s 571 6,296
Kimi K2.6 10.0 10.0 100.0% 0 40.96s 711 13,876
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Pro 8.8 10.0 100.0% 0 23.62s 229 1,710
DeepSeek V4 Flash 10.0 10.0 100.0% 0 28.03s 201 1,179
DeepSeek V3.2 10.0 10.0 100.0% 0 36.09s 207 7,693
Kimi K2.6 10.0 10.0 100.0% 0 20.38s 316 11,305
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Pro 3.0 6.9 16.7% 1 205.66s 10,529 28,089
DeepSeek V4 Flash 4.1 4.4 44.5% 2 100.31s 27 59,249
DeepSeek V3.2 5.3 7.2 44.4% 1 21.78s 15 4,933
Kimi K2.6 5.3 7.2 44.4% 1 202.38s 47,035 98,262
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Pro 6.1 3.1 66.7% 1 25.09s 76 1,152
DeepSeek V4 Flash 6.1 3.1 66.7% 1 25.15s 79 632
DeepSeek V3.2 5.4 2.5 66.7% 1 31.30s 68 2,366
Kimi K2.6 10.0 10.0 100.0% 0 17.83s 3,981 4,472
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Pro 10.0 10.0 100.0% 0 41.16s 205 2,416
DeepSeek V4 Flash 10.0 10.0 100.0% 0 15.36s 63 1,622
DeepSeek V3.2 10.0 10.0 100.0% 0 35.78s 1,397 2,845
Kimi K2.6 10.0 10.0 100.0% 0 12.53s 3,977 5,269
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Pro 6.9 7.0 83.3% 1 34.92s 106 3,835
DeepSeek V4 Flash 6.4 4.5 77.8% 2 25.53s 193 2,597
DeepSeek V3.2 8.2 7.2 88.9% 1 36.87s 390 6,281
Kimi K2.6 5.0 5.2 44.5% 2 25.59s 14,140 17,868
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Pro 10.0 10.0 100.0% 0 21.33s 372 593
DeepSeek V4 Flash 10.0 10.0 100.0% 0 74.73s 228 542
DeepSeek V3.2 10.0 10.0 100.0% 0 34.81s 507 859
Kimi K2.6 10.0 10.0 100.0% 0 8.92s 248 1,011

Быстрое сравнение

Сменить пару сравнения