AI BENCHY Compare

Mistral: Mistral Small 4 vs OpenAI: gpt-oss-120b

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-01

Метрика	Mistral Small 4 Mistral Small 4 none Релиз: 2026-03-16	gpt-oss-120b gpt-oss-120b medium Релиз: 2025-08-05 Бесплатно доступно

Метрика	Mistral Small 4 Mistral Small 4 none Релиз: 2026-03-16	gpt-oss-120b gpt-oss-120b medium Релиз: 2025-08-05 Бесплатно доступно
Оценка	5.2	5.8
Ранг	#115	#91
Надежность	Н/Д	Н/Д
Стабильность	9.5	7.2
Тестов верно
Доля успешных попыток	31.5%	51.9%
Нестабильные тесты	1	6
Всего запусков	54	54
Стоимость за результат	0.118	0.144
Общая стоимость	$0.006	$0.011
???? ?????	$0.150 / 1M	$0.000 / 1M
???? ??????	$0.600 / 1M	$0.000 / 1M
Выходные токены	2,207	13,493
Токены рассуждений	0	36,879
Время ответа (среднее)	665ms	16.08s
Время ответа (макс.)	1.72s	50.92s
Время ответа (суммарно)	11.97s	176.88s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	3.4	7.9	16.7%	1		395ms	182	0
gpt-oss-120b	6.7	9.9	50.0%	0		10.21s	3,518	2,177

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	4.5	9.0	0.0%	0		1.28s	583	0
gpt-oss-120b	4.3	1.1	66.7%	1		26.33s	228	2,549

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	3.0	10.0	0.0%	0		1.72s	496	0
gpt-oss-120b	10.0	10.0	100.0%	0		31.18s	694	5,072

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	10.0	10.0	100.0%	0		822ms	261	0
gpt-oss-120b	6.4	5.9	66.7%	1		1.98s	241	1,114

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	5.3	10.0	33.3%	0		367ms	28	0
gpt-oss-120b	2.9	4.4	22.2%	2		50.92s	6,784	20,606

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	4.0	10.0	0.0%	0		729ms	205	0
gpt-oss-120b	4.3	10.0	0.0%	0		7.90s	107	387

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	6.5	10.0	50.0%	0		380ms	69	0
gpt-oss-120b	9.9	10.0	100.0%	0		7.63s	126	1,799

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	3.1	9.9	0.0%	0		589ms	170	0
gpt-oss-120b	3.2	4.7	22.2%	2		11.80s	1,508	2,092

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	10.0	10.0	100.0%	0		1.40s	213	0
gpt-oss-120b	9.8	10.0	100.0%	0		6.91s	287	1,083

Быстрое сравнение

Сменить пару сравнения

Kimi K2.6nonevsgpt-oss-120bmediumБесплатно доступно Mistral Small 4nonevsNemotron 3 Nano Omni 30b A3b ReasoningmediumБесплатно доступно Mistral Small 4nonevsElephant Alphamedium gpt-oss-120bmediumБесплатно доступноvsQwen3.5-122B-A10Bnone gpt-oss-120bmediumБесплатно доступноvsQwen3.5 Plus 2026-04-20none MiniMax M2.7mediumvsMistral Small 4none gpt-oss-120bmediumБесплатно доступноvsMiMo-V2.5-Pronone gpt-oss-120bmediumБесплатно доступноvsQwen3.6 Flashnone gpt-oss-120bmediumБесплатно доступноvsGLM 5.1none gpt-oss-120bmediumБесплатно доступноvsOwl Alphanone gpt-oss-120bmediumБесплатно доступноvsMiMo-V2-Pronone DeepSeek V3.2nonevsgpt-oss-120bmediumБесплатно доступно