AI BENCHY Compare

OpenAI: GPT-5.4 Mini vs Qwen: Qwen3.5-9B

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-03-17

Метрика	GPT-5.4 Mini GPT-5.4 Mini none Релиз: 2026-03-17	Qwen3.5-9B Qwen3.5-9B none Релиз: 2026-03-02

Метрика	GPT-5.4 Mini GPT-5.4 Mini none Релиз: 2026-03-17	Qwen3.5-9B Qwen3.5-9B none Релиз: 2026-03-02
Ранг	#66	#67
Оценка	4.8	4.8
Стабильность	8.6	10.0
Стоимость за результат	0.737	0.111
Общая стоимость	$0.030	$0.005
Тестов верно
Доля успешных попыток	31.4%	23.5%
Нестабильные тесты	3	0
Всего запусков	51	51
Выходные токены	2,085	2,945
Токены рассуждений	0	0
Время ответа (среднее)	1.17s	1.22s
Время ответа (макс.)	2.52s	5.91s
Время ответа (суммарно)	19.82s	20.74s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.4 Mini	3.1	8.1	8.3%	1		929ms	654	0
Qwen3.5-9B	3.1	9.9	0.0%	0		1.71s	582	0

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.4 Mini	3.0	10.0	0.0%	0		2.52s	298	0
Qwen3.5-9B	3.0	10.0	0.0%	0		5.91s	1,255	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.4 Mini	10.0	10.0	100.0%	0		1.30s	222	0
Qwen3.5-9B	10.0	10.0	100.0%	0		847ms	249	0

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.4 Mini	3.5	4.4	33.3%	2		937ms	88	0
Qwen3.5-9B	3.0	10.0	0.0%	0		464ms	24	0

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.4 Mini	4.8	10.0	0.0%	0		1.82s	174	0
Qwen3.5-9B	4.4	9.9	0.0%	0		552ms	99	0

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.4 Mini	6.3	10.0	50.0%	0		728ms	101	0
Qwen3.5-9B	6.5	10.0	50.0%	0		514ms	75	0

Puzzle Solving	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.4 Mini	5.4	10.0	33.3%	0		860ms	293	0
Qwen3.5-9B	3.2	9.9	0.0%	0		683ms	388	0

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.4 Mini	3.0	10.0	0.0%	0		2.32s	255	0
Qwen3.5-9B	10.0	10.0	100.0%	0		1.27s	273	0

Быстрое сравнение

Сменить пару сравнения

GPT-5.4 MininonevsQwen3 Coder Nextmedium Qwen3.5-9BnonevsGLM 4.7 Flashmedium GPT-5.4 MininonevsGLM 4.7 Flashmedium GPT-5.4 MininonevsQwen3.5-9Bmedium Mistral Small 4mediumvsGPT-5.4 Mininone Mistral Small 4mediumvsQwen3.5-9Bnone MiniMax M2.5mediumБесплатно доступноvsGPT-5.4 Mininone MiniMax M2.5mediumБесплатно доступноvsQwen3.5-9Bnone gpt-oss-120bmediumБесплатно доступноvsQwen3.5-9Bnone GPT-5.4 MininonevsGrok 4.20 Multi-Agent Betamedium Qwen3.5-9BnonevsGrok 4.20 Multi-Agent Betamedium GPT-5 NanomediumvsQwen3.5-9Bnone