Навигация
AI BENCHY
Your ad here

AI BENCHY Compare

MoonshotAI: Kimi K2.5 vs xAI: Grok 4.20

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-04-02

Метрика Kimi K2.5 Kimi K2.5 medium Релиз: 2026-01-27 Grok 4.20 Grok 4.20 medium Релиз: 2026-03-31
Оценка 7.2 7.1
Ранг #39 #40
Стабильность 7.2 8.2
Тестов верно
Доля успешных попыток 72.6% 66.7%
Нестабильные тесты 6 4
Всего запусков 51 51
Стоимость за результат 2.232 7.358
Общая стоимость $0.201 $0.663
???? ????? $0.383 / 1M $2.000 / 1M
???? ?????? $1.909 / 1M $6.000 / 1M
Выходные токены 40,907 1,494
Токены рассуждений 75,121 97,078
Время ответа (среднее) 64.59s 9.50s
Время ответа (макс.) 137.29s 29.87s
Время ответа (суммарно) 645.93s 161.54s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Kimi K2.5 7.3 5.8 83.3% 2 51.38s 2,789 8,880
Grok 4.20 8.2 7.9 83.3% 1 3.36s 280 8,476
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Kimi K2.5 10.0 10.0 100.0% 0 71.37s 703 3,713
Grok 4.20 10.0 10.0 100.0% 0 17.40s 232 9,556
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Kimi K2.5 10.0 10.0 100.0% 0 49.78s 563 7,940
Grok 4.20 10.0 10.0 100.0% 0 4.17s 180 5,333
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Kimi K2.5 3.5 4.4 33.3% 2 137.29s 20,753 30,564
Grok 4.20 5.3 10.0 33.3% 0 27.03s 375 49,339
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Kimi K2.5 6.5 3.4 66.7% 1 69.73s 3,815 4,262
Grok 4.20 5.8 2.8 66.7% 1 7.09s 47 4,252
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Kimi K2.5 10.0 10.0 100.0% 0 92.47s 5,371 6,547
Grok 4.20 7.3 5.9 83.3% 1 4.42s 40 5,474
Puzzle Solving Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Kimi K2.5 5.3 7.3 44.4% 1 45.40s 6,671 12,403
Grok 4.20 6.4 7.7 55.6% 1 3.89s 143 8,028
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Kimi K2.5 10.0 10.0 100.0% 0 31.74s 242 812
Grok 4.20 3.0 10.0 0.0% 0 13.68s 197 6,620

Быстрое сравнение

Сменить пару сравнения