AI BENCHY Compare

DeepSeek: DeepSeek V3.2 vs OpenAI: gpt-oss-120b

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-01

Метрика	DeepSeek V3.2 DeepSeek V3.2 none Релиз: 2025-12-01	gpt-oss-120b gpt-oss-120b medium Релиз: 2025-08-05 Бесплатно доступно

Метрика	DeepSeek V3.2 DeepSeek V3.2 none Релиз: 2025-12-01	gpt-oss-120b gpt-oss-120b medium Релиз: 2025-08-05 Бесплатно доступно
Оценка	5.6	5.9
Ранг	#120	#103
Надежность	10.0	10.0
Стабильность	8.3	7.9
Тестов верно
Доля успешных попыток	41.7%	50.0%
Нестабильные тесты	6	5
Всего запусков	60	60
Стоимость за результат	0.222	0.151
Общая стоимость	$0.018	$0.012
Цена входа	$0.252 / 1M	$0.000 / 1M
Цена выхода	$0.378 / 1M	$0.000 / 1M
Выходные токены	11,159	17,495
Токены рассуждений	0	46,878
Время ответа (среднее)	14.43s	22.41s
Время ответа (макс.)	115.89s	68.16s
Время ответа (суммарно)	288.55s	291.35s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
DeepSeek V3.2	3.2	8.2	8.3%	1		9.35s	1,073	0
gpt-oss-120b	6.7	9.9	50.0%	0		10.21s	3,518	2,177

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
DeepSeek V3.2	3.1	5.4	16.7%	1		20.87s	4,522	0
gpt-oss-120b	3.9	5.6	33.3%	1		47.24s	847	8,618

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
DeepSeek V3.2	6.5	10.0	0.0%	0		115.89s	2,887	0
gpt-oss-120b	10.0	10.0	100.0%	0		31.18s	694	5,072

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
DeepSeek V3.2	6.3	5.8	66.7%	1		9.42s	1,710	0
gpt-oss-120b	6.4	5.9	66.7%	1		1.98s	241	1,114

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
DeepSeek V3.2	2.9	6.9	11.1%	1		4.17s	21	0
gpt-oss-120b	2.9	4.4	22.2%	2		50.92s	6,784	20,606

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
DeepSeek V3.2	6.8	10.0	66.7%	1		9.32s	43	0
gpt-oss-120b	4.3	10.0	0.0%	0		7.90s	107	387

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
DeepSeek V3.2	10.0	10.0	100.0%	0		1.52s	66	0
gpt-oss-120b	9.9	10.0	100.0%	0		7.63s	126	1,799

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
DeepSeek V3.2	8.3	10.0	77.8%	1		6.91s	298	0
gpt-oss-120b	5.3	7.2	44.4%	1		21.71s	1,790	2,264

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
DeepSeek V3.2	10.0	10.0	100.0%	0		11.85s	522	0
gpt-oss-120b	9.8	10.0	100.0%	0		6.91s	287	1,083

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
DeepSeek V3.2	3.0	10.0	0.0%	0		17.23s	17	0
gpt-oss-120b	3.0	10.0	0.0%	0		26.51s	3,101	3,758

Быстрое сравнение

Сменить пару сравнения

gpt-oss-120bmediumБесплатно доступноvsQwen3.5-Flashnone gpt-oss-120bmediumБесплатно доступноvsGLM 5V Turbonone Seed-2.0-Litenonevsgpt-oss-120bmediumБесплатно доступно DeepSeek V4 Prononevsgpt-oss-120bmediumБесплатно доступно gpt-oss-120bmediumБесплатно доступноvsGLM 5.1none DeepSeek V3.2nonevsMiniMax M2.5medium gpt-oss-120bmediumБесплатно доступноvsQwen3.5 Plus 2026-04-20none gpt-oss-120bmediumБесплатно доступноvsQwen3.5-35B-A3Bnone gpt-oss-120bmediumБесплатно доступноvsQwen3.5-27Bnone gpt-oss-120bmediumБесплатно доступноvsQwen3.6 27Bnone DeepSeek V3.2nonevsMistral Small 4medium CobuddymediumvsDeepSeek V3.2none