Сравнить Графики Методология

Язык:

❤️ Made by XCS

AI BENCHY Compare

OpenAI: GPT-5.4 vs Qwen: Qwen3.5 Plus 2026-02-15

Сравнить:

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-03-06

Метрика	OpenAI: GPT-5.4 medium Релиз: 2026-03-05	Qwen: Qwen3.5 Plus 2026-02-15 none Релиз: 2026-02-15
Ранг	#9	#29
Средний балл	8.0	6.2
Стабильность	8.5	9.6
Стоимость за результат	6.601	0.172
Общая стоимость	$0.793	$0.016
Тестов верно
Доля успешных попыток	83.3%	58.3%
Нестабильные тесты	3	1
Всего запусков	48 (16 x 3)	48 (16 x 3)
Выходные токены	1,756	2,015
Токены рассуждений	46,642	0
Время ответа (среднее)	20.05s	2.65s
Время ответа (макс.)	100.41s	6.65s
Время ответа (суммарно)	320.87s	26.52s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Средний балл vs Время ответа (среднее)

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		5.02s	216	1,466
Qwen: Qwen3.5 Plus 2026-02-15	4.0	10.0	33.3%	0		2.74s	514	0

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		20.57s	301	3,543
Qwen: Qwen3.5 Plus 2026-02-15	10.0	10.0	0.0%	0		6.65s	314	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
OpenAI: GPT-5.4	9.9	10.0	100.0%	0		5.32s	234	804
Qwen: Qwen3.5 Plus 2026-02-15	9.9	10.0	100.0%	0		1.89s	243	0

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
OpenAI: GPT-5.4	4.0	7.2	44.4%	1		74.27s	61	34,748
Qwen: Qwen3.5 Plus 2026-02-15	4.0	10.0	33.3%	0		1.17s	17	0

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
OpenAI: GPT-5.4	5.0	3.1	33.3%	1		4.92s	145	321
Qwen: Qwen3.5 Plus 2026-02-15	4.0	3.0	33.3%	1		2.26s	117	0

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		3.11s	93	897
Qwen: Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		1.67s	72	0

Puzzle Solving	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
OpenAI: GPT-5.4	7.0	7.2	88.9%	1		9.13s	442	3,832
Qwen: Qwen3.5 Plus 2026-02-15	7.0	10.0	66.7%	0		2.82s	516	0

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		13.28s	264	1,031
Qwen: Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		3.33s	222	0

Быстрое сравнение

Сменить пару сравнения

Qwen3.5 Plus 2026-02-15nonevsGrok 4.1 Fastmedium Gemini 3.1 Flash Lite PreviewhighvsGPT-5.4medium Gemini 3 Flash PreviewlowvsGPT-5.4medium Kimi K2.5mediumvsQwen3.5 Plus 2026-02-15none GPT-5 MinimediumvsQwen3.5 Plus 2026-02-15none GPT-5.2mediumvsQwen3.5 Plus 2026-02-15none Claude Opus 4.6mediumvsQwen3.5 Plus 2026-02-15none GPT-5 NanomediumvsQwen3.5 Plus 2026-02-15none Seed-2.0-MinimediumvsQwen3.5 Plus 2026-02-15none Gemini 3.1 Flash Lite PreviewlowvsGPT-5.4medium Gemini 3 Flash PreviewnonevsGPT-5.4medium Mercury 2mediumvsQwen3.5 Plus 2026-02-15none