AI BENCHY Compare

Inception: Mercury 2 vs OpenAI: GPT-5 Nano

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-04-04

Метрика	Mercury 2 Mercury 2 medium Релиз: 2026-02-24	GPT-5 Nano GPT-5 Nano medium Релиз: 2025-08-07

Метрика	Mercury 2 Mercury 2 medium Релиз: 2026-02-24	GPT-5 Nano GPT-5 Nano medium Релиз: 2025-08-07
Оценка	6.3	6.2
Ранг	#52	#54
Стабильность	8.5	6.7
Тестов верно
Доля успешных попыток	51.0%	58.8%
Нестабильные тесты	3	7
Всего запусков	51	51
Стоимость за результат	0.634	0.864
Общая стоимость	$0.045	$0.061
???? ?????	$0.250 / 1M	$0.050 / 1M
???? ??????	$0.750 / 1M	$0.400 / 1M
Выходные токены	3,723	4,500
Токены рассуждений	46,120	143,296
Время ответа (среднее)	2.25s	44.47s
Время ответа (макс.)	14.63s	204.02s
Время ответа (суммарно)	35.99s	444.74s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	6.9	9.9	50.0%	0		1.12s	2,546	2,609
GPT-5 Nano	6.5	7.9	58.3%	1		25.50s	1,221	21,184

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	10.0	10.0	100.0%	0		3.28s	268	4,887
GPT-5 Nano	10.0	10.0	100.0%	0		65.96s	578	17,984

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	7.3	5.9	83.3%	1		1.11s	183	1,656
GPT-5 Nano	3.7	1.7	50.0%	2		21.42s	453	10,560

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	2.9	7.2	11.1%	1		6.48s	41	30,754
GPT-5 Nano	5.2	4.4	55.6%	2		204.02s	237	64,448

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	4.8	10.0	0.0%	0		821ms	137	542
GPT-5 Nano	4.1	10.0	0.0%	0		17.51s	202	4,608

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	10.0	10.0	100.0%	0		1.07s	14	958
GPT-5 Nano	8.5	6.8	83.3%	1		11.90s	382	4,096

Puzzle Solving	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	3.9	7.5	22.2%	1		934ms	354	2,758
GPT-5 Nano	5.3	7.2	44.4%	1		19.81s	869	13,440

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	10.0	10.0	100.0%	0		1.89s	180	1,956
GPT-5 Nano	10.0	10.0	100.0%	0		33.30s	558	6,976

Быстрое сравнение

Сменить пару сравнения

Gemma 4 26B A4BnonevsGPT-5 Nanomedium Gemma 4 26B A4BnonevsMercury 2medium DeepSeek V3.2nonevsMercury 2medium DeepSeek V3.2nonevsGPT-5 Nanomedium Mercury 2mediumvsMiMo-V2-Omninone GPT-5 NanomediumvsMiMo-V2-Omninone GPT-5 NanomediumvsQwen3.5-Flashnone GPT-5 NanomediumvsGLM 5V Turbonone Seed-2.0-LitenonevsGPT-5 Nanomedium Mercury 2mediumvsQwen3.5-Flashnone Mercury 2mediumvsGLM 5V Turbonone Seed-2.0-LitenonevsMercury 2medium