AI BENCHY Compare

Qwen: Qwen3.5 Plus 2026-02-15 vs Z.ai: GLM 5.1

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-04-07

Метрика	Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 none Релиз: 2026-02-15	GLM 5.1 GLM 5.1 medium Релиз: 2026-04-07

Метрика	Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 none Релиз: 2026-02-15	GLM 5.1 GLM 5.1 medium Релиз: 2026-04-07
Оценка	6.8	8.0
Ранг	#48	#23
Стабильность	9.6	9.0
Тестов верно
Доля успешных попыток	54.9%	76.5%
Нестабильные тесты	1	2
Всего запусков	51	51
Стоимость за результат	0.172	1.270
Общая стоимость	$0.016	$0.153
???? ?????	$0.260 / 1M	$1.000 / 1M
???? ??????	$1.560 / 1M	$3.200 / 1M
Выходные токены	2,018	6,666
Токены рассуждений	0	35,313
Время ответа (среднее)	2.51s	18.23s
Время ответа (макс.)	6.65s	43.11s
Время ответа (суммарно)	27.60s	291.73s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	4.8	10.0	25.0%	0		1.91s	517	0
GLM 5.1	10.0	10.0	100.0%	0		8.31s	401	5,122

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	3.0	10.0	0.0%	0		6.65s	314	0
GLM 5.1	9.5	10.0	100.0%	0		43.11s	327	4,206

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		1.89s	243	0
GLM 5.1	10.0	10.0	100.0%	0		9.33s	991	4,552

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	5.3	10.0	33.3%	0		1.17s	17	0
GLM 5.1	5.3	10.0	33.3%	0		29.77s	969	11,314

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	4.4	3.0	33.3%	1		2.26s	117	0
GLM 5.1	10.0	10.0	100.0%	0		20.95s	2,875	2,875

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		1.67s	72	0
GLM 5.1	6.4	5.8	66.7%	1		7.47s	204	1,617

Puzzle Solving	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	7.7	10.0	66.7%	0		2.82s	516	0
GLM 5.1	8.2	7.2	88.9%	1		23.85s	899	5,627

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		3.33s	222	0
GLM 5.1	3.0	10.0	0.0%	0		0ms	0	0

Быстрое сравнение

Сменить пару сравнения

Gemini 3 Flash PreviewnonevsGLM 5.1medium Gemini 3.1 Flash Lite PreviewlowvsGLM 5.1medium GPT-5 MinimediumvsQwen3.5 Plus 2026-02-15none Nemotron 3 SupermediumБесплатно доступноvsQwen3.5 Plus 2026-02-15none Qwen3.5 Plus 2026-02-15nonevsGrok 4.1 Fastmedium Hunter AlphamediumvsQwen3.5 Plus 2026-02-15none Gemini 3.1 Flash Lite PreviewnonevsGLM 5.1medium GPT-5.2 ChatnonevsGLM 5.1medium GPT-5.4 MinimediumvsQwen3.5 Plus 2026-02-15none Qwen3.5 Plus 2026-02-15nonevsGrok 4.20medium Kimi K2.5mediumvsQwen3.5 Plus 2026-02-15none GPT-5.3 ChatnonevsGLM 5.1medium