AI BENCHY Compare

DeepSeek: DeepSeek V4 Pro vs Google: Gemini 2.5 Flash

Сводка

Сравнение benchmark DeepSeek V4 Pro vs Gemini 2.5 Flash: Gemini 2.5 Flash лидирует по среднему баллу: 8.2 vs 7.2. DeepSeek V4 Pro имеет более низкую стоимость benchmark: $0.034 vs $0.379. DeepSeek V4 Pro быстрее: 6.41s vs 15.49s, с долей успешных попыток 52.4% vs 69.8%.

Рекомендуемая модель: DeepSeek V4 Pro - Он дает лучший общий компромисс: конкурентный балл (7.2), ниже стоимость, чем у Gemini 2.5 Flash, и сбалансированное время ответа.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-18

Метрика	DeepSeek V4 Pro DeepSeek V4 Pro none Релиз: 2026-04-24	Gemini 2.5 Flash Gemini 2.5 Flash medium Релиз: 2025-06-17

Метрика	DeepSeek V4 Pro DeepSeek V4 Pro none Релиз: 2026-04-24	Gemini 2.5 Flash Gemini 2.5 Flash medium Релиз: 2025-06-17
Оценка	7.2	8.2
Ранг	#58	#24
Надежность	9.9	10.0
Стабильность	8.8	9.6
Тестов верно
Доля успешных попыток	52.4%	69.8%
Нестабильные тесты	3	1
Всего запусков	63	63
Стоимость за результат	0.333	2.701
Общая стоимость	$0.034	$0.379
Цена входа	$0.435 / 1M	$0.300 / 1M
Цена выхода	$0.870 / 1M	$2.500 / 1M
Общее число входных токенов	53,558	34,476
Выходные токены	11,424	1,930
Токены рассуждений	0	145,145
Время ответа (среднее)	6.41s	15.49s
Время ответа (макс.)	30.09s	95.48s
Время ответа (суммарно)	134.66s	325.39s

Генерация showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#58 DeepSeek V4 Pro

none

Неверный SVG

Стоимость: $0.000
Время: 300.0s
Токены: 0 tok

#24 Gemini 2.5 Flash

medium

Неверный SVG

Стоимость: $0.000
Время: 274.0s
Токены: 0 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	3.2	6.1	16.7%	2		4.02s	540	1,168	0
Gemini 2.5 Flash	8.4	10.0	75.0%	0		6.30s	492	255	10,233

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	5.6	10.0	33.3%	0		13.38s	7,275	5,500	0
Gemini 2.5 Flash	7.8	10.0	66.7%	0		41.01s	6,669	543	32,303

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	9.5	10.0	100.0%	0		23.74s	27,529	2,235	0
Gemini 2.5 Flash	10.0	10.0	100.0%	0		28.44s	12,522	303	11,922

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	10.0	10.0	100.0%	0		4.61s	7,568	200	0
Gemini 2.5 Flash	10.0	10.0	100.0%	0		4.06s	7,257	279	2,325

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	5.3	10.0	33.3%	0		3.72s	666	24	0
Gemini 2.5 Flash	5.9	7.2	55.6%	1		37.34s	633	18	80,702

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	5.0	10.0	0.0%	0		2.05s	471	126	0
Gemini 2.5 Flash	4.8	10.0	0.0%	0		4.86s	486	92	1,899

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	6.3	5.8	66.7%	1		4.12s	627	713	0
Gemini 2.5 Flash	9.8	10.0	100.0%	0		2.62s	615	69	1,203

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	10.0	10.0	100.0%	0		3.61s	594	442	0
Gemini 2.5 Flash	7.7	10.0	66.7%	0		3.18s	558	126	2,499

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	10.0	10.0	100.0%	0		7.40s	8,105	328	0
Gemini 2.5 Flash	10.0	10.0	100.0%	0		6.20s	5,088	234	1,140

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	3.0	10.0	0.0%	0		5.76s	183	688	0
Gemini 2.5 Flash	3.0	10.0	0.0%	0		2.76s	156	11	919

Быстрое сравнение

Сменить пару сравнения