AI BENCHY Compare

Qwen: Qwen3.5-35B-A3B vs Z.ai: GLM 5.1

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-29

Метрика	Qwen3.5-35B-A3B Qwen3.5-35B-A3B medium Релиз: 2026-02-24	GLM 5.1 GLM 5.1 medium Релиз: 2026-04-07

Метрика	Qwen3.5-35B-A3B Qwen3.5-35B-A3B medium Релиз: 2026-02-24	GLM 5.1 GLM 5.1 medium Релиз: 2026-04-07
Оценка	7.3	7.4
Ранг	#68	#56
Надежность	10.0	5.0
Стабильность	7.5	8.3
Тестов верно
Доля успешных попыток	73.3%	71.7%
Нестабильные тесты	6	4
Всего запусков	60	60
Стоимость за результат	4.865	2.382
Общая стоимость	$0.536	$0.286
Цена входа	$0.139 / 1M	$0.980 / 1M
Цена выхода	$1.000 / 1M	$3.080 / 1M
Выходные токены	31,242	11,511
Токены рассуждений	330,546	71,979
Время ответа (среднее)	69.66s	33.45s
Время ответа (макс.)	409.98s	172.60s
Время ответа (суммарно)	1393.17s	635.63s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		21.13s	798	42,652
GLM 5.1	10.0	10.0	100.0%	0		8.31s	401	5,122

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5-35B-A3B	6.5	10.0	50.0%	0		244.54s	14,456	88,431
GLM 5.1	4.7	1.6	66.7%	2		145.56s	4,727	34,384

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5-35B-A3B	4.7	1.6	66.7%	1		75.34s	775	12,485
GLM 5.1	9.5	10.0	100.0%	0		43.11s	327	4,206

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5-35B-A3B	7.3	5.9	83.3%	1		59.33s	235	19,493
GLM 5.1	10.0	10.0	100.0%	0		9.33s	991	4,552

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5-35B-A3B	4.1	4.4	44.5%	2		88.34s	41	46,368
GLM 5.1	5.3	10.0	33.3%	0		29.77s	969	11,314

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5-35B-A3B	2.8	1.6	33.3%	1		30.30s	20	3,753
GLM 5.1	10.0	10.0	100.0%	0		20.95s	2,875	2,875

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		24.45s	97	17,361
GLM 5.1	6.4	5.8	66.7%	1		7.47s	204	1,617

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5-35B-A3B	8.2	7.2	88.9%	1		33.13s	3,592	26,585
GLM 5.1	8.2	7.2	88.9%	1		31.64s	935	5,730

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		4.65s	309	1,365
GLM 5.1	3.0	10.0	0.0%	0		0ms	0	0

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Qwen3.5-35B-A3B	3.0	10.0	0.0%	0		177.35s	10,919	72,053
GLM 5.1	3.0	10.0	0.0%	0		29.40s	82	2,179

Быстрое сравнение

Сменить пару сравнения

Gemini 3.1 Flash LitelowvsGLM 5.1medium GPT-5.3 ChatnonevsGLM 5.1medium Claude Opus 4.8nonevsQwen3.5-35B-A3Bmedium Ring-2.6-1TnonevsQwen3.5-35B-A3Bmedium Step 3.7 FlashlowvsGLM 5.1medium Gemini 3.1 Flash Lite PreviewnonevsGLM 5.1medium Qwen3.5-35B-A3BmediumvsStep 3.7 Flashhigh Qwen3.5-35B-A3BmediumvsStep 3.7 Flashlow Claude Opus 4.8nonevsGLM 5.1medium GPT-5.3 ChatnonevsQwen3.5-35B-A3Bmedium Gemini 3.1 Flash LitelowvsQwen3.5-35B-A3Bmedium Ring-2.6-1TnonevsGLM 5.1medium