AI BENCHY Compare

OpenAI: GPT-5.2 Chat vs Qwen: Qwen3.6 Plus

Сводка

Сравнение benchmark GPT-5.2 Chat vs Qwen3.6 Plus: GPT-5.2 Chat лидирует по среднему баллу: 8.5 vs 7.8. Qwen3.6 Plus имеет более низкую стоимость benchmark: $0.294 vs $0.393. GPT-5.2 Chat быстрее: 7.13s vs 30.70s, с долей успешных попыток 74.6% vs 69.8%.

Рекомендуемая модель: GPT-5.2 Chat - Здесь у него лучший балл (8.5), и он отвечает примерно в 4.3 раза быстрее, чем Qwen3.6 Plus.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-07-02

Метрика	GPT-5.2 Chat GPT-5.2 Chat none Релиз: 2025-12-11	Qwen3.6 Plus Qwen3.6 Plus medium Релиз: 2026-04-20

Метрика	GPT-5.2 Chat GPT-5.2 Chat none Релиз: 2025-12-11	Qwen3.6 Plus Qwen3.6 Plus medium Релиз: 2026-04-20
Оценка	8.5	7.8
Ранг	#19	#31
Надежность	10.0	10.0
Стабильность	8.9	9.3
Тестов верно
Доля успешных попыток	74.6%	69.8%
Нестабильные тесты	3	2
Всего запусков	63	63
Стоимость за результат	2.803	0.831
Общая стоимость	$0.393	$0.294
Цена входа	$1.750 / 1M	$0.325 / 1M
Цена выхода	$14.000 / 1M	$1.950 / 1M
Общее число входных токенов	34,212	41,565
Выходные токены	23,744	1,853
Токены рассуждений	0	141,973
Время ответа (среднее)	7.13s	30.70s
Время ответа (макс.)	38.52s	201.68s
Время ответа (суммарно)	149.69s	613.99s

Генерация showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#19 GPT-5.2 Chat

none

Стоимость: $0.010
Время: 15.3s
Токены: 797 tok

#31 Qwen3.6 Plus

medium

Стоимость: $0.024
Время: 219.0s
Токены: 12,235 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2 Chat	8.7	7.9	91.7%	1		3.40s	606	1,807	0
Qwen3.6 Plus	10.0	10.0	100.0%	0		9.90s	672	207	7,557

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2 Chat	8.8	7.8	88.9%	1		9.82s	7,305	6,731	0
Qwen3.6 Plus	6.1	7.8	44.4%	1		153.12s	7,098	58	50,586

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2 Chat	10.0	10.0	100.0%	0		9.12s	11,019	1,243	0
Qwen3.6 Plus	10.0	10.0	100.0%	0		34.95s	14,934	452	13,073

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2 Chat	10.0	10.0	100.0%	0		3.05s	7,140	980	0
Qwen3.6 Plus	10.0	10.0	100.0%	0		14.95s	7,782	270	10,706

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2 Chat	5.3	10.0	33.3%	0		17.78s	723	7,810	0
Qwen3.6 Plus	2.9	7.2	11.1%	1		29.59s	771	56	33,464

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2 Chat	4.4	3.0	33.3%	1		3.20s	477	335	0
Qwen3.6 Plus	5.1	10.0	0.0%	0		27.05s	516	111	5,232

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2 Chat	9.8	10.0	100.0%	0		5.51s	660	1,441	0
Qwen3.6 Plus	10.0	10.0	100.0%	0		7.54s	699	102	5,552

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2 Chat	7.7	10.0	66.7%	0		4.10s	642	1,603	0
Qwen3.6 Plus	10.0	10.0	100.0%	0		6.34s	696	309	6,712

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2 Chat	10.0	10.0	100.0%	0		4.68s	5,445	555	0
Qwen3.6 Plus	10.0	10.0	100.0%	0		5.87s	8,193	267	1,330

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2 Chat	3.0	10.0	0.0%	0		6.89s	195	1,239	0
Qwen3.6 Plus	3.0	10.0	0.0%	0		47.51s	204	21	7,761

Быстрое сравнение

Сменить пару сравнения

Seed-2.0-LitemediumvsGPT-5.2 Chatnone GPT-5.2 ChatnonevsStep 3.7 Flashmedium GPT-5.2 ChatnonevsGLM 5medium Claude Opus 4.8lowvsQwen3.6 Plusmedium Qwen3.6 PlusmediumvsStep 3.7 Flashlow GPT-5.2 ChatnonevsGLM 5.2medium DeepSeek V4 FlashhighvsGPT-5.2 Chatnone Claude Opus 4.7mediumvsGPT-5.2 Chatnone DeepSeek V4 ProhighvsQwen3.6 Plusmedium Gemini 2.5 FlashmediumvsGPT-5.2 Chatnone GPT-5.2 ChatnonevsQwen3.7 Plusmedium GPT-5.3 ChatnonevsQwen3.6 Plusmedium