AI BENCHY Compare

Inception: Mercury 2 vs OpenAI: gpt-oss-120b

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-22

Метрика	Mercury 2 Mercury 2 medium Релиз: 2026-02-24	gpt-oss-120b gpt-oss-120b none Релиз: 2025-08-05 Бесплатно доступно

Метрика	Mercury 2 Mercury 2 medium Релиз: 2026-02-24	gpt-oss-120b gpt-oss-120b none Релиз: 2025-08-05 Бесплатно доступно
Оценка	6.3	5.2
Ранг	#90	#129
Надежность	10.0	10.0
Стабильность	8.4	8.7
Тестов верно
Доля успешных попыток	50.0%	36.8%
Нестабильные тесты	4	3
Всего запусков	60	57
Стоимость за результат	0.687	0.201
Общая стоимость	$0.055	$0.011
???? ?????	$0.250 / 1M	$0.000 / 1M
???? ??????	$0.750 / 1M	$0.000 / 1M
Выходные токены	4,015	51,505
Токены рассуждений	58,382	0
Время ответа (среднее)	2.27s	21.86s
Время ответа (макс.)	14.63s	113.71s
Время ответа (суммарно)	43.15s	349.78s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	6.9	9.9	50.0%	0		1.12s	2,546	2,609
gpt-oss-120b	6.5	10.0	50.0%	0		32.84s	8,676	0

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	7.2	6.5	66.7%	1		2.29s	270	8,514
gpt-oss-120b	4.3	1.1	66.7%	1		9.57s	3,232	0

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	10.0	10.0	100.0%	0		3.28s	268	4,887
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	7.3	5.9	83.3%	1		1.11s	183	1,656
gpt-oss-120b	6.5	10.0	50.0%	0		7.12s	598	0

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	2.9	7.2	11.1%	1		6.48s	41	30,754
gpt-oss-120b	3.0	10.0	0.0%	0		34.98s	29,483	0

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	4.8	10.0	0.0%	0		821ms	137	542
gpt-oss-120b	4.8	10.0	0.0%	0		10.79s	615	0

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	10.0	10.0	100.0%	0		1.07s	14	958
gpt-oss-120b	9.8	10.0	100.0%	0		5.10s	1,982	0

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	3.8	7.3	22.2%	1		934ms	354	2,758
gpt-oss-120b	4.4	4.5	44.5%	2		9.51s	3,781	0

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	10.0	10.0	100.0%	0		1.89s	180	1,956
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	3.0	10.0	0.0%	0		2.58s	22	3,748
gpt-oss-120b	3.0	10.0	0.0%	0		47.29s	3,138	0

Быстрое сравнение

Сменить пару сравнения

Mercury 2mediumvsGLM 5none Gemma 4 26B A4BnoneБесплатно доступноvsMercury 2medium Gemini 2.5 FlashnonevsMercury 2medium Mercury 2mediumvsMiMo-V2-Omninone Mercury 2mediumvsQwen3.5 Plus 2026-02-15none MiniMax M2.7mediumvsgpt-oss-120bnoneБесплатно доступно gpt-oss-120bnoneБесплатно доступноvsElephant Alphamedium Mistral Small 4mediumvsgpt-oss-120bnoneБесплатно доступно DeepSeek V4 PrononevsMercury 2medium MiniMax M2.5mediumБесплатно доступноvsgpt-oss-120bnoneБесплатно доступно Mercury 2mediumvsGPT-5.5none Gemini 3.1 Flash LitenonevsMercury 2medium