AI BENCHY Compare

Mistral: Mistral Small 4 vs OpenAI: gpt-oss-120b

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-04-11

Метрика	Mistral Small 4 Mistral Small 4 medium Релиз: 2026-03-16	gpt-oss-120b gpt-oss-120b none Релиз: 2025-08-05 Бесплатно доступно

Метрика	Mistral Small 4 Mistral Small 4 medium Релиз: 2026-03-16	gpt-oss-120b gpt-oss-120b none Релиз: 2025-08-05 Бесплатно доступно
Оценка	5.7	5.2
Ранг	#69	#79
Стабильность	6.8	7.9
Тестов верно
Доля успешных попыток	50.0%	38.9%
Нестабильные тесты	7	5
Всего запусков	54	54
Стоимость за результат	0.674	0.221
Общая стоимость	$0.034	$0.009
???? ?????	$0.150 / 1M	$0.039 / 1M
???? ??????	$0.600 / 1M	$0.190 / 1M
Выходные токены	15,084	44,652
Токены рассуждений	39,408	0
Время ответа (среднее)	5.64s	11.96s
Время ответа (макс.)	30.49s	68.97s
Время ответа (суммарно)	101.52s	179.34s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	5.6	3.8	66.7%	3		2.67s	4,055	4,778
gpt-oss-120b	6.6	8.0	58.3%	1		6.03s	4,867	0

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	6.7	3.5	66.7%	1		30.49s	2,796	11,296
gpt-oss-120b	4.3	1.1	66.7%	1		9.57s	3,232	0

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	3.0	10.0	0.0%	0		25.25s	2,612	10,700
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	7.3	5.9	83.3%	1		1.23s	335	723
gpt-oss-120b	6.5	10.0	50.0%	0		7.12s	598	0

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	5.3	7.2	44.4%	1		6.11s	2,621	6,904
gpt-oss-120b	3.0	10.0	0.0%	0		34.98s	29,483	0

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	4.8	10.0	0.0%	0		2.05s	821	828
gpt-oss-120b	4.6	10.0	0.0%	0		2.83s	586	0

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	7.3	5.8	83.3%	1		1.38s	540	1,031
gpt-oss-120b	8.4	6.9	83.3%	1		5.10s	1,982	0

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	3.4	9.7	0.0%	0		2.00s	983	2,338
gpt-oss-120b	4.5	4.8	44.5%	2		6.86s	3,904	0

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mistral Small 4	10.0	10.0	100.0%	0		3.50s	321	810
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0

Быстрое сравнение

Сменить пару сравнения

Mistral Small 4mediumvsQwen3.5-122B-A10Bnone MiniMax M2.7mediumvsgpt-oss-120bnoneБесплатно доступно Mistral Small 4mediumvsGLM 4.7 Flashnone Mistral Small 4mediumvsGLM 5.1none Mistral Small 4mediumvsKimi K2.5none Mistral Small 4mediumvsGLM 5 Turbonone Mistral Small 4mediumvsQwen3.5-27Bnone Mistral Small 4mediumvsGPT-5.4none Trinity Large PreviewnoneБесплатно доступноvsMistral Small 4medium Mistral Small 4mediumvsMiMo-V2-Pronone Mistral Small 4mediumvsGrok 4.20none DeepSeek V3.2nonevsMistral Small 4medium