AI BENCHY Compare

Inception: Mercury 2 vs OpenAI: gpt-oss-120b

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-03

Метрика	Mercury 2 Mercury 2 none Релиз: 2026-02-24	gpt-oss-120b gpt-oss-120b medium Релиз: 2025-08-05 Бесплатно доступно

Метрика	Mercury 2 Mercury 2 none Релиз: 2026-02-24	gpt-oss-120b gpt-oss-120b medium Релиз: 2025-08-05 Бесплатно доступно
Оценка	4.6	5.9
Ранг	#153	#103
Надежность	10.0	10.0
Стабильность	9.1	7.9
Тестов верно
Доля успешных попыток	25.0%	50.0%
Нестабильные тесты	2	5
Всего запусков	60	60
Стоимость за результат	0.216	0.151
Общая стоимость	$0.009	$0.012
Цена входа	$0.250 / 1M	$0.039 / 1M
Цена выхода	$0.750 / 1M	$0.180 / 1M
Общее число входных токенов	25,515	36,355
Выходные токены	3,001	17,495
Токены рассуждений	0	46,878
Время ответа (среднее)	614ms	22.41s
Время ответа (макс.)	1.27s	68.16s
Время ответа (суммарно)	12.28s	291.35s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mercury 2	3.0	10.0	0.0%	0		483ms	631	286	0
gpt-oss-120b	6.7	9.9	50.0%	0		10.21s	1,314	3,518	2,177

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mercury 2	3.5	9.4	0.0%	0		831ms	4,631	1,650	0
gpt-oss-120b	3.9	5.6	33.3%	1		47.24s	5,053	847	8,618

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mercury 2	3.0	10.0	0.0%	0		606ms	4,821	131	0
gpt-oss-120b	10.0	10.0	100.0%	0		31.18s	11,535	694	5,072

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mercury 2	7.3	5.9	83.3%	1		667ms	6,362	180	0
gpt-oss-120b	6.4	5.9	66.7%	1		1.98s	7,476	241	1,114

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mercury 2	5.3	7.2	44.4%	1		534ms	784	46	0
gpt-oss-120b	2.9	4.4	22.2%	2		50.92s	1,266	6,784	20,606

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mercury 2	4.8	10.0	0.0%	0		628ms	495	159	0
gpt-oss-120b	4.3	10.0	0.0%	0		7.90s	659	107	387

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mercury 2	6.5	10.0	50.0%	0		551ms	691	82	0
gpt-oss-120b	9.9	10.0	100.0%	0		7.63s	1,036	126	1,799

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mercury 2	3.1	10.0	0.0%	0		535ms	694	251	0
gpt-oss-120b	5.3	7.2	44.4%	1		21.71s	1,190	1,790	2,264

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mercury 2	10.0	10.0	100.0%	0		1.27s	6,193	197	0
gpt-oss-120b	9.8	10.0	100.0%	0		6.91s	6,514	287	1,083

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mercury 2	3.0	10.0	0.0%	0		548ms	213	19	0
gpt-oss-120b	3.0	10.0	0.0%	0		26.51s	312	3,101	3,758

Быстрое сравнение

Сменить пару сравнения

gpt-oss-120bmediumБесплатно доступноvsQwen3.5-Flashnone gpt-oss-120bmediumБесплатно доступноvsGLM 5V Turbonone Seed-2.0-Litenonevsgpt-oss-120bmediumБесплатно доступно gpt-oss-120bmediumБесплатно доступноvsGLM 5.1none DeepSeek V4 Prononevsgpt-oss-120bmediumБесплатно доступно gpt-oss-120bmediumБесплатно доступноvsQwen3.5 Plus 2026-04-20none Mercury 2nonevsQwen3 Coder Nextmedium gpt-oss-120bmediumБесплатно доступноvsQwen3.5-35B-A3Bnone Mercury 2nonevsGLM 4.7 Flashmedium gpt-oss-120bmediumБесплатно доступноvsQwen3.5-27Bnone gpt-oss-120bmediumБесплатно доступноvsQwen3.6 27Bnone DeepSeek V4 Prohighvsgpt-oss-120bmediumБесплатно доступно