AI BENCHY Compare

DeepSeek: DeepSeek V4 Pro vs OpenAI: gpt-oss-120b

Сводка

Сравнение benchmark DeepSeek V4 Pro vs gpt-oss-120b: gpt-oss-120b лидирует по среднему баллу: 6.1 vs 5.7. gpt-oss-120b имеет более низкую стоимость benchmark: $0.013 vs $0.025. DeepSeek V4 Pro быстрее: 12.38s vs 22.28s, с долей успешных попыток 42.9% vs 52.4%.

Рекомендуемая модель: gpt-oss-120b - Здесь у него лучший балл (6.1), при этом он примерно в 2.0 раза дешевле, чем DeepSeek V4 Pro.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-04

Метрика	DeepSeek V4 Pro DeepSeek V4 Pro none Релиз: 2026-04-24	gpt-oss-120b gpt-oss-120b medium Релиз: 2025-08-05 Бесплатно доступно

Метрика	DeepSeek V4 Pro DeepSeek V4 Pro none Релиз: 2026-04-24	gpt-oss-120b gpt-oss-120b medium Релиз: 2025-08-05 Бесплатно доступно
Оценка	5.7	6.1
Ранг	#113	#99
Надежность	8.5	10.0
Стабильность	8.5	8.0
Тестов верно
Доля успешных попыток	42.9%	52.4%
Нестабильные тесты	4	5
Всего запусков	63	63
Стоимость за результат	0.660	0.141
Общая стоимость	$0.025	$0.013
Цена входа	$0.435 / 1M	$0.039 / 1M
Цена выхода	$0.870 / 1M	$0.180 / 1M
Общее число входных токенов	44,845	39,084
Выходные токены	5,349	20,013
Токены рассуждений	0	50,233
Время ответа (среднее)	12.38s	22.28s
Время ответа (макс.)	58.65s	68.16s
Время ответа (суммарно)	260.06s	311.96s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#113 DeepSeek V4 Pro

none

Invalid SVG

Cost: $0.000
Time: 300.0s
Tokens: 0 tok

#99 gpt-oss-120b

medium

Cost: $0.001
Time: 26.7s
Tokens: 555 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	3.5	8.0	16.7%	1		14.02s	540	704	0
gpt-oss-120b	6.7	9.9	50.0%	0		10.21s	1,314	3,518	2,177

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	4.6	7.9	22.2%	1		6.11s	7,279	531	0
gpt-oss-120b	5.9	7.0	55.6%	1		38.37s	7,782	3,365	11,973

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	9.5	10.0	100.0%	0		25.49s	20,773	1,911	0
gpt-oss-120b	10.0	10.0	100.0%	0		31.18s	11,535	694	5,072

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	6.9	5.8	66.7%	1		30.54s	5,633	170	0
gpt-oss-120b	6.4	5.9	66.7%	1		1.98s	7,476	241	1,114

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	5.3	10.0	33.3%	0		3.17s	666	18	0
gpt-oss-120b	2.9	4.4	22.2%	2		50.92s	1,266	6,784	20,606

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	4.3	9.9	0.0%	0		3.75s	471	132	0
gpt-oss-120b	4.3	10.0	0.0%	0		7.90s	659	107	387

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	6.3	10.0	50.0%	0		8.23s	627	64	0
gpt-oss-120b	9.9	10.0	100.0%	0		7.63s	1,036	126	1,799

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	7.6	7.2	77.8%	1		15.95s	594	173	0
gpt-oss-120b	5.3	7.2	44.4%	1		21.71s	1,190	1,790	2,264

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	10.0	10.0	100.0%	0		5.92s	8,079	219	0
gpt-oss-120b	9.8	10.0	100.0%	0		6.91s	6,514	287	1,083

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	3.0	10.0	0.0%	0		15.59s	183	1,427	0
gpt-oss-120b	3.0	10.0	0.0%	0		26.51s	312	3,101	3,758

Быстрое сравнение

Сменить пару сравнения