AI BENCHY Compare

OpenAI: GPT-5.3 Chat vs Xiaomi: MiMo-V2-Pro

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-03-20

Метрика	GPT-5.3 Chat GPT-5.3 Chat none Релиз: 2026-03-03	MiMo-V2-Pro MiMo-V2-Pro medium Релиз: 2026-03-18

Метрика	GPT-5.3 Chat GPT-5.3 Chat none Релиз: 2026-03-03	MiMo-V2-Pro MiMo-V2-Pro medium Релиз: 2026-03-18
Оценка	7.6	8.0
Ранг	#27	#20
Стабильность	8.6	8.5
Тестов верно
Доля успешных попыток	66.7%	76.5%
Нестабильные тесты	3	3
Всего запусков	51	45
Стоимость за результат	3.177	1.110
Общая стоимость	$0.318	$0.123
???? ?????	$1.750 / 1M	$1.000 / 1M
???? ??????	$14.000 / 1M	$3.000 / 1M
Выходные токены	19,348	1,875
Токены рассуждений	0	26,959
Время ответа (среднее)	5.68s	9.78s
Время ответа (макс.)	18.33s	64.71s
Время ответа (суммарно)	96.58s	156.45s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3 Chat	6.7	8.1	58.3%	1		3.86s	3,167	0
MiMo-V2-Pro	10.0	10.0	100.0%	0		3.06s	223	1,107

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3 Chat	10.0	10.0	100.0%	0		11.96s	2,614	0
MiMo-V2-Pro	4.7	1.6	66.7%	1		64.71s	380	14,186

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.21s	942	0
MiMo-V2-Pro	7.3	5.8	83.3%	1		17.20s	260	7,484

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3 Chat	3.5	4.4	33.3%	2		13.01s	8,264	0
MiMo-V2-Pro	5.3	10.0	33.3%	0		6.00s	155	1,048

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3 Chat	4.6	10.0	0.0%	0		1.99s	319	0
MiMo-V2-Pro	10.0	10.0	100.0%	0		4.06s	198	424

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3 Chat	8.3	10.0	50.0%	0		3.29s	1,455	0
MiMo-V2-Pro	9.9	10.0	100.0%	0		3.36s	83	667

Puzzle Solving	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.93s	1,726	0
MiMo-V2-Pro	7.0	7.2	55.6%	1		4.71s	313	1,179

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.3 Chat	10.0	10.0	100.0%	0		8.36s	861	0
MiMo-V2-Pro	10.0	10.0	100.0%	0		8.19s	263	864

Быстрое сравнение

Сменить пару сравнения

Gemini 3 Flash PreviewnonevsMiMo-V2-Promedium Gemini 3.1 Flash Lite PreviewlowvsMiMo-V2-Promedium GPT-5.3 ChatnonevsMiMo-V2-Flashmedium Claude Opus 4.6mediumvsGPT-5.3 Chatnone Gemini 3.1 Flash Lite PreviewnonevsMiMo-V2-Promedium GPT-5.2 ChatnonevsMiMo-V2-Promedium Seed-2.0-MinimediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsQwen3.5-35B-A3Bmedium GPT-5.3 ChatnonevsStep 3.5 FlashmediumБесплатно доступно GPT-5.3 ChatnonevsGrok 4.20 Betamedium Kimi K2.5mediumvsGPT-5.3 Chatnone Claude Sonnet 4.6mediumvsGPT-5.3 Chatnone