AI BENCHY Compare

xAI: Grok Build 0.1 vs Xiaomi: MiMo-V2-Pro

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-29

Метрика	Grok Build 0.1 Grok Build 0.1 medium Релиз: 2026-05-21	MiMo-V2-Pro MiMo-V2-Pro medium Релиз: 2026-03-18

Метрика	Grok Build 0.1 Grok Build 0.1 medium Релиз: 2026-05-21	MiMo-V2-Pro MiMo-V2-Pro medium Релиз: 2026-03-18
Оценка	7.7	7.6
Ранг	#45	#52
Надежность	10.0	9.6
Стабильность	9.9	7.9
Тестов верно
Доля успешных попыток	65.0%	76.7%
Нестабильные тесты	0	5
Всего запусков	60	60
Стоимость за результат	5.606	2.450
Общая стоимость	$0.729	$0.294
Цена входа	$1.000 / 1M	$1.000 / 1M
Цена выхода	$2.000 / 1M	$3.000 / 1M
Выходные токены	2,258	2,518
Токены рассуждений	341,381	81,801
Время ответа (среднее)	42.39s	22.16s
Время ответа (макс.)	252.69s	136.29s
Время ответа (суммарно)	847.76s	443.22s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Grok Build 0.1	8.3	10.0	75.0%	0		7.43s	220	12,162
MiMo-V2-Pro	10.0	10.0	100.0%	0		2.86s	251	1,154

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Grok Build 0.1	7.0	9.5	50.0%	0		62.62s	614	64,815
MiMo-V2-Pro	7.5	6.0	83.3%	1		94.21s	527	37,424

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Grok Build 0.1	10.0	10.0	100.0%	0		32.81s	231	16,917
MiMo-V2-Pro	4.7	1.6	66.7%	1		64.71s	380	14,186

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Grok Build 0.1	10.0	10.0	100.0%	0		10.72s	180	8,876
MiMo-V2-Pro	7.3	5.8	83.3%	1		17.20s	260	7,484

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Grok Build 0.1	5.3	10.0	33.3%	0		158.00s	492	175,294
MiMo-V2-Pro	5.3	10.0	33.3%	0		8.82s	170	2,158

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Grok Build 0.1	4.4	9.9	0.0%	0		18.41s	76	6,345
MiMo-V2-Pro	10.0	10.0	100.0%	0		4.92s	184	400

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Grok Build 0.1	9.8	10.0	100.0%	0		12.36s	57	9,599
MiMo-V2-Pro	9.9	10.0	100.0%	0		3.36s	83	667

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Grok Build 0.1	7.7	10.0	66.7%	0		18.26s	195	20,841
MiMo-V2-Pro	6.4	4.4	77.8%	2		5.08s	372	1,622

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Grok Build 0.1	10.0	10.0	100.0%	0		13.12s	180	4,969
MiMo-V2-Pro	10.0	10.0	100.0%	0		8.19s	263	864

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Grok Build 0.1	3.0	10.0	0.0%	0		53.51s	13	21,563
MiMo-V2-Pro	3.0	10.0	0.0%	0		82.71s	28	15,842

Быстрое сравнение

Сменить пару сравнения

Gemini 3 Flash PreviewnonevsGrok Build 0.1medium DeepSeek V4 FlashhighБесплатно доступноvsGrok Build 0.1medium Gemini 3.1 Flash Lite PreviewlowvsGrok Build 0.1medium Gemini 3.1 Flash Lite PreviewlowvsMiMo-V2-Promedium DeepSeek V4 FlashhighБесплатно доступноvsMiMo-V2-Promedium Gemini 3 Flash PreviewnonevsMiMo-V2-Promedium Gemini 3.1 Flash Lite PreviewnonevsMiMo-V2-Promedium Gemini 3.1 Flash LitelowvsMiMo-V2-Promedium GPT-5.3 ChatnonevsMiMo-V2-Promedium Gemini 3.1 Flash Lite PreviewnonevsGrok Build 0.1medium GPT-5.2 ChatnonevsGrok Build 0.1medium Step 3.7 FlashlowvsMiMo-V2-Promedium