AI BENCHY Compare

Qwen: Qwen3.6 35B A3B vs xAI: Grok 4.20

Сводка

Сравнение benchmark Qwen3.6 35B A3B vs Grok 4.20: Grok 4.20 лидирует по среднему баллу: 5.4 vs 4.6. Qwen3.6 35B A3B имеет более низкую стоимость benchmark: $0.031 vs $0.057. Grok 4.20 быстрее: 1.11s vs 3.73s, с долей успешных попыток 30.2% vs 33.3%.

Рекомендуемая модель: Grok 4.20 - Здесь у него лучший балл (5.4), и он отвечает примерно в 3.4 раза быстрее, чем Qwen3.6 35B A3B.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-10

Метрика	Qwen3.6 35B A3B Qwen3.6 35B A3B none Релиз: 2026-04-20	Grok 4.20 Grok 4.20 none Релиз: 2026-03-31

Метрика	Qwen3.6 35B A3B Qwen3.6 35B A3B none Релиз: 2026-04-20	Grok 4.20 Grok 4.20 none Релиз: 2026-03-31
Оценка	4.6	5.4
Ранг	#154	#128
Надежность	10.0	Н/Д
Стабильность	8.0	10.0
Тестов верно
Доля успешных попыток	30.2%	33.3%
Нестабильные тесты	5	0
Всего запусков	63	54
Стоимость за результат	0.754	1.570
Общая стоимость	$0.031	$0.057
Цена входа	$0.140 / 1M	$1.250 / 1M
Цена выхода	$1.000 / 1M	$2.500 / 1M
Общее число входных токенов	19,329	41,313
Выходные токены	27,755	1,923
Токены рассуждений	0	0
Время ответа (среднее)	3.73s	1.11s
Время ответа (макс.)	22.52s	6.04s
Время ответа (суммарно)	70.86s	19.96s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#154 Qwen3.6 35B A3B

none

Cost: $0.008
Time: 30.1s
Tokens: 6,317 tok

#128 xAI: Grok 4.20

none

Cost: $0.004
Time: 6.5s
Tokens: 1,367 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Qwen3.6 35B A3B	3.6	7.6	16.7%	1		2.10s	696	1,571	0
Grok 4.20	4.8	10.0	25.0%	0		501ms	1,986	267	0

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Qwen3.6 35B A3B	5.5	10.0	33.3%	0		8.77s	7,911	11,161	0
Grok 4.20	3.4	9.3	0.0%	0		1.22s	1,074	312	0

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Qwen3.6 35B A3B	3.0	10.0	0.0%	0		0ms	0	0	0
Grok 4.20	3.0	10.0	0.0%	0		6.04s	17,673	282	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		1.46s	7,788	248	0
Grok 4.20	10.0	10.0	100.0%	0		522ms	7,749	207	0

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Qwen3.6 35B A3B	3.5	4.4	33.3%	2		7.45s	781	11,381	0
Grok 4.20	3.0	10.0	0.0%	0		687ms	1,746	325	0

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Qwen3.6 35B A3B	4.4	3.0	33.3%	1		3.51s	520	1,545	0
Grok 4.20	4.8	10.0	0.0%	0		659ms	819	83	0

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Qwen3.6 35B A3B	6.2	5.8	66.7%	1		1.86s	709	1,264	0
Grok 4.20	6.3	10.0	50.0%	0		445ms	1,350	60	0

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Qwen3.6 35B A3B	3.2	9.9	0.0%	0		1.07s	714	573	0
Grok 4.20	5.3	10.0	33.3%	0		473ms	1,671	198	0

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Qwen3.6 35B A3B	3.0	10.0	0.0%	0		0ms	0	0	0
Grok 4.20	10.0	10.0	100.0%	0		4.63s	7,245	189	0

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Qwen3.6 35B A3B	3.0	10.0	0.0%	0		414ms	210	12	0
Grok 4.20	-	-	-	-	-	-	-	-	-

Быстрое сравнение

Сменить пару сравнения

MiniMax M2.5mediumvsGrok 4.20none MiniMax M2.7mediumvsGrok 4.20none Mistral Small 4mediumvsGrok 4.20none CobuddymediumvsGrok 4.20none Qwen3.6 35B A3BnonevsGLM 4.7 Flashmedium Nemotron 3 SupermediumБесплатно доступноvsGrok 4.20none DeepSeek V4 ProhighvsGrok 4.20none gpt-oss-120bmediumБесплатно доступноvsGrok 4.20none Mistral Small 4mediumvsQwen3.6 35B A3Bnone MiniMax M2.7mediumvsQwen3.6 35B A3Bnone MiniMax M2.5mediumvsQwen3.6 35B A3Bnone Qwen3 Coder NextmediumvsGrok 4.20none