AI BENCHY Compare

OpenAI: GPT-5.4 vs Qwen: Qwen3.5-9B

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-03-12

Метрика	GPT-5.4 GPT-5.4 none Релиз: 2026-03-05	Qwen3.5-9B Qwen3.5-9B medium Релиз: 2026-03-02

Метрика	GPT-5.4 GPT-5.4 none Релиз: 2026-03-05	Qwen3.5-9B Qwen3.5-9B medium Релиз: 2026-03-02
Ранг	#51	#66
Средний балл	4.5	2.6
Стабильность	8.9	7.4
Стоимость за результат	1.562	0.779
Общая стоимость	$0.094	$0.024
Тестов верно
Доля успешных попыток	41.7%	35.4%
Нестабильные тесты	2	5
Всего запусков	48	48
Выходные токены	1,819	17,930
Токены рассуждений	0	139,706
Время ответа (среднее)	1.48s	71.44s
Время ответа (макс.)	2.89s	226.38s
Время ответа (суммарно)	23.64s	928.77s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Средний балл vs Время ответа (среднее)

Общее число выходных токенов

Средний балл vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.4	10.0	7.3	11.1%	1		1.41s	388	0
Qwen3.5-9B	4.0	7.2	55.6%	1		31.54s	2,410	10,913

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.4	10.0	10.0	0.0%	0		2.89s	291	0
Qwen3.5-9B	10.0	10.0	0.0%	0		0ms	0	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.4	9.9	10.0	100.0%	0		1.04s	222	0
Qwen3.5-9B	5.0	5.6	33.3%	1		87.31s	1,383	32,113

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.4	4.0	7.2	44.4%	1		1.07s	50	0
Qwen3.5-9B	10.0	7.2	22.2%	1		137.75s	11,549	48,475

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.4	3.0	9.9	0.0%	0		1.78s	184	0
Qwen3.5-9B	10.0	1.6	33.3%	1		226.38s	0	30,695

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.4	5.5	10.0	50.0%	0		1.07s	81	0
Qwen3.5-9B	5.5	5.8	66.7%	1		17.15s	599	4,517

Puzzle Solving	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.4	4.0	9.8	33.3%	0		1.52s	357	0
Qwen3.5-9B	10.0	10.0	0.0%	0		33.38s	1,545	11,844

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
GPT-5.4	10.0	10.0	100.0%	0		2.75s	246	0
Qwen3.5-9B	10.0	10.0	100.0%	0		4.31s	444	1,149

Быстрое сравнение

Сменить пару сравнения

MiniMax M2.5mediumvsGPT-5.4none Qwen3.5-9BmediumvsMiMo-V2-Flashnone Qwen3.5-9BmediumvsGrok 4.1 Fastnone GPT-5.4nonevsGrok 4.20 Multi-Agent Betamedium Mercury 2nonevsQwen3.5-9Bmedium Nemotron 3 Super 120b A12bnoneБесплатно доступноvsQwen3.5-9Bmedium Mercury 2mediumvsGPT-5.4none GPT-5.4nonevsQwen3 Coder Nextmedium GPT-5.4nonevsQwen3.5-35B-A3Bmedium Qwen3.5-9BmediumvsGLM 4.7 Flashnone Nemotron 3 Super 120b A12bmediumБесплатно доступноvsGPT-5.4none GPT-5.4nonevsGLM 4.7 Flashmedium