AI BENCHY Compare

Mistral: Mistral Small 4 vs OpenAI: gpt-oss-120b

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-01

Метрика	Mistral Small 4 Mistral Small 4 medium Релиз: 2026-03-16	gpt-oss-120b gpt-oss-120b medium Релиз: 2025-08-05 Бесплатно доступно

Метрика	Mistral Small 4 Mistral Small 4 medium Релиз: 2026-03-16	gpt-oss-120b gpt-oss-120b medium Релиз: 2025-08-05 Бесплатно доступно
Оценка	5.7	5.8
Ранг	#99	#91
Надежность	Н/Д	Н/Д
Стабильность	6.8	7.2
Тестов верно
Доля успешных попыток	50.0%	51.9%
Нестабильные тесты	7	6
Всего запусков	54	54
Стоимость за результат	0.674	0.144
Общая стоимость	$0.034	$0.011
???? ?????	$0.150 / 1M	$0.000 / 1M
???? ??????	$0.600 / 1M	$0.000 / 1M
Выходные токены	15,084	13,493
Токены рассуждений	39,408	36,879
Время ответа (среднее)	5.64s	16.08s
Время ответа (макс.)	30.49s	50.92s
Время ответа (суммарно)	101.52s	176.88s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	5.6	3.8	66.7%	3		2.67s	4,055	4,778
gpt-oss-120b	6.7	9.9	50.0%	0		10.21s	3,518	2,177

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	6.7	3.5	66.7%	1		30.49s	2,796	11,296
gpt-oss-120b	4.3	1.1	66.7%	1		26.33s	228	2,549

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	3.0	10.0	0.0%	0		25.25s	2,612	10,700
gpt-oss-120b	10.0	10.0	100.0%	0		31.18s	694	5,072

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	7.3	5.9	83.3%	1		1.23s	335	723
gpt-oss-120b	6.4	5.9	66.7%	1		1.98s	241	1,114

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	5.3	7.2	44.4%	1		6.11s	2,621	6,904
gpt-oss-120b	2.9	4.4	22.2%	2		50.92s	6,784	20,606

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	4.8	10.0	0.0%	0		2.05s	821	828
gpt-oss-120b	4.3	10.0	0.0%	0		7.90s	107	387

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	7.3	5.8	83.3%	1		1.38s	540	1,031
gpt-oss-120b	9.9	10.0	100.0%	0		7.63s	126	1,799

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	3.4	9.7	0.0%	0		2.00s	983	2,338
gpt-oss-120b	3.2	4.7	22.2%	2		11.80s	1,508	2,092

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	10.0	10.0	100.0%	0		3.50s	321	810
gpt-oss-120b	9.8	10.0	100.0%	0		6.91s	287	1,083

Быстрое сравнение

Сменить пару сравнения

Kimi K2.6nonevsgpt-oss-120bmediumБесплатно доступно gpt-oss-120bmediumБесплатно доступноvsQwen3.5-122B-A10Bnone gpt-oss-120bmediumБесплатно доступноvsQwen3.5 Plus 2026-04-20none gpt-oss-120bmediumБесплатно доступноvsMiMo-V2.5-Pronone gpt-oss-120bmediumБесплатно доступноvsQwen3.6 Flashnone Mistral Small 4mediumvsGLM 4.7 Flashnone gpt-oss-120bmediumБесплатно доступноvsGLM 5.1none Mistral Small 4mediumvsKimi K2.5none Mistral Small 4mediumvsGLM 5.1none Mistral Small 4mediumvsQwen3.6 Flashnone Mistral Small 4mediumvsGLM 5 Turbonone Mistral Small 4mediumvsMiMo-V2.5-Pronone