AI BENCHY Compare

Qwen: Qwen3.5 Plus 2026-02-15 vs Grok 4.1 Fast

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-29

Метрика	Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 none Релиз: 2026-02-15	Grok 4.1 Fast Grok 4.1 Fast medium Релиз: 2025-11-19

Метрика	Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 none Релиз: 2026-02-15	Grok 4.1 Fast Grok 4.1 Fast medium Релиз: 2025-11-19
Оценка	6.4	6.5
Ранг	#94	#93
Надежность	10.0	10.0
Стабильность	9.3	7.3
Тестов верно
Доля успешных попыток	48.3%	61.4%
Нестабильные тесты	2	6
Всего запусков	60	57
Стоимость за результат	0.195	0.642
Общая стоимость	$0.018	$0.058
Цена входа	$0.260 / 1M	$0.000 / 1M
Цена выхода	$1.560 / 1M	$0.000 / 1M
Выходные токены	2,474	2,006
Токены рассуждений	0	96,334
Время ответа (среднее)	2.40s	23.85s
Время ответа (макс.)	6.65s	121.79s
Время ответа (суммарно)	33.56s	286.16s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	4.8	10.0	25.0%	0		1.91s	517	0
Grok 4.1 Fast	8.7	7.9	91.7%	1		3.81s	108	4,741

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	4.9	6.9	16.7%	1		2.54s	467	0
Grok 4.1 Fast	2.3	1.1	33.3%	1		23.58s	821	6,703

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	3.0	10.0	0.0%	0		6.65s	314	0
Grok 4.1 Fast	10.0	10.0	100.0%	0		37.64s	261	12,272

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		1.89s	243	0
Grok 4.1 Fast	10.0	10.0	100.0%	0		6.63s	180	5,409

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	5.3	10.0	33.3%	0		1.17s	17	0
Grok 4.1 Fast	5.8	4.4	66.7%	2		121.79s	11	37,657

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	4.4	3.0	33.3%	1		2.26s	117	0
Grok 4.1 Fast	4.2	9.9	0.0%	0		16.25s	127	3,456

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		1.67s	72	0
Grok 4.1 Fast	6.5	10.0	50.0%	0		4.63s	54	3,326

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	7.7	10.0	66.7%	0		2.71s	494	0
Grok 4.1 Fast	5.3	7.2	44.4%	1		7.40s	169	5,904

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		3.33s	222	0
Grok 4.1 Fast	2.8	1.6	33.3%	1		27.71s	260	11,485

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	3.0	10.0	0.0%	0		1.11s	11	0
Grok 4.1 Fast	3.0	10.0	0.0%	0		25.52s	15	5,381

Быстрое сравнение

Сменить пару сравнения

Mercury 2mediumvsQwen3.5 Plus 2026-02-15none GPT-5 NanomediumvsQwen3.5 Plus 2026-02-15none Kimi K2.5mediumvsQwen3.5 Plus 2026-02-15none Gemini 3.1 Flash LiteminimalvsQwen3.5 Plus 2026-02-15none Nemotron 3 SupermediumБесплатно доступноvsQwen3.5 Plus 2026-02-15none gpt-oss-120bmediumБесплатно доступноvsQwen3.5 Plus 2026-02-15none Owl AlphamediumvsQwen3.5 Plus 2026-02-15none Qwen3.5 Plus 2026-02-15nonevsMiMo-V2-Omnimedium Qwen3.5 Plus 2026-02-15nonevsGrok 4.20medium DeepSeek V4 ProhighvsQwen3.5 Plus 2026-02-15none CobuddymediumvsQwen3.5 Plus 2026-02-15none Qwen3.5 Plus 2026-02-15nonevsMiMo-V2-Flashmedium