AI BENCHY Compare

OpenAI: GPT-5.2 vs Qwen: Qwen3.7 Plus

Сводка

Сравнение benchmark GPT-5.2 vs Qwen3.7 Plus: GPT-5.2 лидирует по среднему баллу: 8.4 vs 8.2. Qwen3.7 Plus имеет более низкую стоимость benchmark: $0.177 vs $0.548. GPT-5.2 быстрее: 16.88s vs 38.95s, с долей успешных попыток 71.4% vs 77.8%.

Рекомендуемая модель: Qwen3.7 Plus - Его балл близок к лучшему здесь (8.2 против 8.4), при этом он примерно в 3.1 раза дешевле, чем GPT-5.2.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-18

Метрика	GPT-5.2 GPT-5.2 medium Релиз: 2025-12-11	Qwen3.7 Plus Qwen3.7 Plus medium Релиз: 2026-06-03

Метрика	GPT-5.2 GPT-5.2 medium Релиз: 2025-12-11	Qwen3.7 Plus Qwen3.7 Plus medium Релиз: 2026-06-03
Оценка	8.4	8.2
Ранг	#22	#25
Надежность	10.0	10.0
Стабильность	8.4	9.1
Тестов верно
Доля успешных попыток	71.4%	77.8%
Нестабильные тесты	4	2
Всего запусков	63	63
Стоимость за результат	4.209	1.474
Общая стоимость	$0.548	$0.177
Цена входа	$1.750 / 1M	$0.320 / 1M
Цена выхода	$14.000 / 1M	$1.280 / 1M
Общее число входных токенов	33,967	40,939
Выходные токены	2,901	2,125
Токены рассуждений	31,932	125,754
Время ответа (среднее)	16.88s	38.95s
Время ответа (макс.)	77.80s	178.04s
Время ответа (суммарно)	236.34s	817.85s

Генерация showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#22 GPT-5.2

medium

Стоимость: $0.047
Время: 49.2s
Токены: 3,396 tok

#25 Qwen3.7 Plus

medium

Стоимость: $0.018
Время: 193.2s
Токены: 10,821 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2	6.5	8.0	58.3%	1		7.81s	606	567	2,002
Qwen3.7 Plus	10.0	10.0	100.0%	0		8.58s	672	195	5,065

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2	10.0	10.0	100.0%	0		22.73s	7,302	511	11,912
Qwen3.7 Plus	6.1	6.6	55.6%	1		108.60s	6,472	414	43,576

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2	10.0	10.0	100.0%	0		14.06s	11,019	291	1,757
Qwen3.7 Plus	10.0	10.0	100.0%	0		65.24s	14,934	366	10,132

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2	10.0	10.0	100.0%	0		3.15s	7,140	234	420
Qwen3.7 Plus	10.0	10.0	100.0%	0		21.75s	7,782	270	6,713

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2	5.9	7.2	55.6%	1		77.80s	473	42	10,342
Qwen3.7 Plus	3.6	7.2	22.2%	1		45.35s	771	57	27,073

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2	3.7	9.7	0.0%	0		4.32s	477	162	269
Qwen3.7 Plus	10.0	10.0	100.0%	0		25.48s	516	123	3,998

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2	9.9	10.0	100.0%	0		3.12s	660	94	614
Qwen3.7 Plus	10.0	10.0	100.0%	0		16.13s	699	102	5,013

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2	7.5	7.3	77.8%	1		5.80s	642	735	924
Qwen3.7 Plus	10.0	10.0	100.0%	0		16.38s	696	280	7,312

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2	4.7	1.6	66.7%	1		10.30s	5,453	239	469
Qwen3.7 Plus	10.0	10.0	100.0%	0		15.02s	8,193	292	1,831

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
GPT-5.2	3.0	10.0	0.0%	0		28.18s	195	26	3,223
Qwen3.7 Plus	3.0	10.0	0.0%	0		91.07s	204	26	15,041

Быстрое сравнение

Сменить пару сравнения

DeepSeek V4 FlashhighvsQwen3.7 Plusmedium DeepSeek V4 FlashhighvsGPT-5.2medium GPT-5.2 ChatnonevsQwen3.7 Plusmedium Qwen3.7 PlusmediumvsStep 3.7 Flashlow DeepSeek V4 ProhighvsQwen3.7 Plusmedium GPT-5.3 ChatnonevsQwen3.7 Plusmedium GPT-5.2mediumvsStep 3.7 Flashlow DeepSeek V4 ProhighvsGPT-5.2medium Gemini 3 Flash PreviewlowvsQwen3.7 Plusmedium Gemini 3.5 FlashlowvsGPT-5.2medium Claude Sonnet 4.6nonevsQwen3.7 Plusmedium Claude Opus 4.8nonevsQwen3.7 Plusmedium