AI BENCHY Compare

OpenAI: GPT-5.4 Mini vs Qwen: Qwen3.5-9B

Сводка

Сравнение benchmark GPT-5.4 Mini vs Qwen3.5-9B: GPT-5.4 Mini лидирует по среднему баллу: 5.3 vs 3.8. Qwen3.5-9B имеет более низкую стоимость benchmark: $0.036 vs $0.038. GPT-5.4 Mini быстрее: 1.13s vs 82.24s, с долей успешных попыток 30.2% vs 27.0%.

Рекомендуемая модель: GPT-5.4 Mini - Здесь у него лучший балл (5.3), и он отвечает примерно в 72.5 раза быстрее, чем Qwen3.5-9B.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-18

Метрика	GPT-5.4 Mini GPT-5.4 Mini none Релиз: 2026-03-17	Qwen3.5-9B Qwen3.5-9B medium Релиз: 2026-03-02

Метрика	GPT-5.4 Mini GPT-5.4 Mini none Релиз: 2026-03-17	Qwen3.5-9B Qwen3.5-9B medium Релиз: 2026-03-02
Оценка	5.3	3.8
Ранг	#124	#165
Надежность	10.0	6.7
Стабильность	8.8	8.0
Тестов верно
Доля успешных попыток	30.2%	27.0%
Нестабильные тесты	3	5
Всего запусков	63	63
Стоимость за результат	0.743	1.187
Общая стоимость	$0.038	$0.036
Цена входа	$0.750 / 1M	$0.100 / 1M
Цена выхода	$4.500 / 1M	$0.150 / 1M
Общее число входных токенов	34,244	17,070
Выходные токены	2,541	29,045
Токены рассуждений	0	209,516
Время ответа (среднее)	1.13s	82.24s
Время ответа (макс.)	2.52s	226.38s
Время ответа (суммарно)	23.82s	1315.88s

Генерация showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#124 GPT-5.4 Mini

none

Стоимость: $0.010
Время: 11.7s
Токены: 2,151 tok

#165 Qwen3.5-9B

medium

Стоимость: $0.001
Время: 35.9s
Токены: 3,030 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.4 Mini	3.1	8.1	8.3%	1		929ms	606	654	0
Qwen3.5-9B	5.1	5.8	50.0%	2		34.44s	369	2,621	12,411

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.4 Mini	5.5	10.0	33.3%	0		913ms	7,305	401	0
Qwen3.5-9B	2.9	10.0	0.0%	0		100.88s	2,396	7,890	41,129

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.4 Mini	3.0	10.0	0.0%	0		2.52s	11,019	298	0
Qwen3.5-9B	3.0	10.0	0.0%	0		0ms	0	0	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.4 Mini	10.0	10.0	100.0%	0		1.30s	7,140	222	0
Qwen3.5-9B	3.6	5.6	33.3%	1		87.31s	4,722	1,383	32,113

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.4 Mini	3.5	4.4	33.3%	2		937ms	723	88	0
Qwen3.5-9B	3.6	7.2	22.2%	1		137.75s	295	11,549	48,475

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.4 Mini	4.8	10.0	0.0%	0		1.82s	477	174	0
Qwen3.5-9B	2.8	1.6	33.3%	1		226.38s	180	0	30,695

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.4 Mini	6.3	10.0	50.0%	0		728ms	660	101	0
Qwen3.5-9B	6.5	10.0	50.0%	0		5.75s	381	491	1,824

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.4 Mini	5.4	10.0	33.3%	0		836ms	642	305	0
Qwen3.5-9B	3.0	10.0	0.0%	0		32.27s	376	1,593	12,026

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.4 Mini	3.0	10.0	0.0%	0		2.32s	5,477	255	0
Qwen3.5-9B	10.0	10.0	100.0%	0		4.31s	8,283	444	1,149

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.4 Mini	3.0	10.0	0.0%	0		1.33s	195	43	0
Qwen3.5-9B	3.0	10.0	0.0%	0		177.02s	68	3,074	29,694

Быстрое сравнение

Сменить пару сравнения

MiniMax M2.7mediumvsGPT-5.4 Mininone Mistral Small 4mediumvsGPT-5.4 Mininone gpt-oss-120bnoneБесплатно доступноvsQwen3.5-9Bmedium Granite 4.1 8BnonevsQwen3.5-9Bmedium CobuddymediumvsGPT-5.4 Mininone North Mini CodemediumБесплатно доступноvsGPT-5.4 Mininone MiniMax M2.5mediumvsGPT-5.4 Mininone Qwen3.5-9BmediumvsGrok 4.20none GPT-5.4 MininonevsQwen3 Coder Nextmedium Gemini 3.1 Flash LiteminimalvsGPT-5.4 Mininone Mercury 2nonevsQwen3.5-9Bmedium Ling-2.6-1TnonevsQwen3.5-9Bmedium