AI BENCHY Compare

Inception: Mercury 2 vs Qwen: Qwen3.5-122B-A10B

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-01

Метрика	Mercury 2 Mercury 2 medium Релиз: 2026-02-24	Qwen3.5-122B-A10B Qwen3.5-122B-A10B none Релиз: 2026-02-24

Метрика	Mercury 2 Mercury 2 medium Релиз: 2026-02-24	Qwen3.5-122B-A10B Qwen3.5-122B-A10B none Релиз: 2026-02-24
Оценка	6.5	5.4
Ранг	#93	#131
Надежность	10.0	10.0
Стабильность	8.8	9.5
Тестов верно
Доля успешных попыток	51.7%	33.3%
Нестабильные тесты	3	1
Всего запусков	60	60
Стоимость за результат	0.611	0.380
Общая стоимость	$0.055	$0.019
Цена входа	$0.250 / 1M	$0.260 / 1M
Цена выхода	$0.750 / 1M	$2.080 / 1M
Выходные токены	4,022	3,374
Токены рассуждений	58,405	0
Время ответа (среднее)	2.27s	3.38s
Время ответа (макс.)	14.63s	46.00s
Время ответа (суммарно)	43.20s	67.55s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	6.9	9.9	50.0%	0		1.12s	2,546	2,609
Qwen3.5-122B-A10B	4.8	10.0	25.0%	0		1.59s	312	0

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	7.2	6.5	66.7%	1		2.29s	270	8,514
Qwen3.5-122B-A10B	4.0	5.5	33.3%	1		2.14s	684	0

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	10.0	10.0	100.0%	0		3.28s	268	4,887
Qwen3.5-122B-A10B	3.0	10.0	0.0%	0		46.00s	1,137	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	7.3	5.9	83.3%	1		1.11s	183	1,656
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		1.01s	243	0

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	2.9	7.2	11.1%	1		6.48s	41	30,754
Qwen3.5-122B-A10B	5.3	10.0	33.3%	0		465ms	15	0

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	4.8	10.0	0.0%	0		821ms	137	542
Qwen3.5-122B-A10B	5.0	10.0	0.0%	0		1.12s	66	0

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	10.0	10.0	100.0%	0		1.07s	14	958
Qwen3.5-122B-A10B	6.3	10.0	50.0%	0		513ms	69	0

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	5.4	10.0	33.3%	0		949ms	361	2,781
Qwen3.5-122B-A10B	3.8	10.0	0.0%	0		1.00s	575	0

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	10.0	10.0	100.0%	0		1.89s	180	1,956
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		2.04s	264	0

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Mercury 2	3.0	10.0	0.0%	0		2.58s	22	3,748
Qwen3.5-122B-A10B	3.0	10.0	0.0%	0		295ms	9	0

Быстрое сравнение

Сменить пару сравнения

MiniMax M2.7mediumvsQwen3.5-122B-A10Bnone Elephant AlphamediumvsQwen3.5-122B-A10Bnone Mistral Small 4mediumvsQwen3.5-122B-A10Bnone Mercury 2mediumvsGPT-5.5none Gemini 3.1 Flash LitenonevsMercury 2medium DeepSeek V4 ProhighvsMercury 2medium MiniMax M2.5mediumvsQwen3.5-122B-A10Bnone Mercury 2mediumvsQwen3.5 Plus 2026-02-15none Gemini 2.5 FlashnonevsMercury 2medium Gemini 3.1 Flash LiteminimalvsMercury 2medium Mercury 2mediumvsGLM 5none Gemma 4 31BnoneБесплатно доступноvsMercury 2medium