Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

xAI: Grok 4.20 vs Xiaomi: MiMo-V2.5

Сводка

Сравнение benchmark Grok 4.20 vs MiMo-V2.5: Grok 4.20 лидирует по среднему баллу: 7.3 vs 6.7. MiMo-V2.5 имеет более низкую стоимость benchmark: $0.063 vs $0.609. MiMo-V2.5 быстрее: 27.11s vs 27.68s, с долей успешных попыток 63.5% vs 69.8%.

Рекомендуемая модель: MiMo-V2.5 - Его балл близок к лучшему здесь (6.7 против 7.3), при этом он примерно в 9.8 раза дешевле, чем Grok 4.20.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-18

Метрика Grok 4.20 Grok 4.20 medium Релиз: 2026-03-31 MiMo-V2.5 MiMo-V2.5 medium Релиз: 2026-04-22
Оценка 7.3 6.7
Ранг #53 #76
Надежность 10.0 10.0
Стабильность 8.8 8.1
Тестов верно
Доля успешных попыток 63.5% 69.8%
Нестабильные тесты 3 5
Всего запусков 63 63
Стоимость за результат 8.309 2.966
Общая стоимость $0.609 $0.063
Цена входа $1.250 / 1M $0.140 / 1M
Цена выхода $2.500 / 1M $0.280 / 1M
Общее число входных токенов 44,433 41,838
Выходные токены 1,819 2,827
Токены рассуждений 219,524 198,898
Время ответа (среднее) 27.68s 27.11s
Время ответа (макс.) 199.66s 162.44s
Время ответа (суммарно) 581.26s 569.38s

Генерация showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#53 xAI: Grok 4.20

medium
Стоимость
$0.041
Время
110.3s
Токены
16,336 tok

#76 MiMo-V2.5

medium
Стоимость
$0.002
Время
54.8s
Токены
5,247 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Grok 4.20 8.2 7.9 83.3% 1 3.95s 2,010 287 8,312
MiMo-V2.5 10.0 10.0 100.0% 0 4.14s 621 281 1,739
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150
MiMo-V2.5 6.2 4.7 66.7% 2 97.14s 7,422 557 81,977
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Grok 4.20 10.0 10.0 100.0% 0 17.40s 12,909 232 9,556
MiMo-V2.5 10.0 10.0 100.0% 0 16.86s 15,060 363 7,609
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Grok 4.20 10.0 10.0 100.0% 0 4.17s 7,761 180 5,333
MiMo-V2.5 2.7 5.7 16.7% 1 6.33s 7,746 306 5,714
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Grok 4.20 5.3 10.0 33.3% 0 27.03s 1,764 375 49,339
MiMo-V2.5 5.3 10.0 33.3% 0 34.53s 735 507 49,478
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Grok 4.20 3.9 2.6 33.3% 1 24.48s 825 65 6,440
MiMo-V2.5 5.4 2.5 66.7% 1 5.37s 492 121 418
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Grok 4.20 9.8 10.0 100.0% 0 4.26s 1,362 57 6,419
MiMo-V2.5 9.9 10.0 100.0% 0 1.80s 672 88 801
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Grok 4.20 7.7 10.0 66.7% 0 6.22s 1,689 149 7,913
MiMo-V2.5 8.2 7.2 88.9% 1 20.25s 660 279 33,254
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Grok 4.20 3.0 10.0 0.0% 0 13.68s 7,275 197 6,620
MiMo-V2.5 10.0 10.0 100.0% 0 7.29s 8,220 303 2,424
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Grok 4.20 3.0 10.0 0.0% 0 63.48s 531 9 16,442
MiMo-V2.5 3.0 10.0 0.0% 0 51.29s 210 22 15,484

Быстрое сравнение

Сменить пару сравнения