AI BENCHY Compare

DeepSeek: DeepSeek V4 Pro vs MoonshotAI: Kimi K2.5

Сводка

Сравнение benchmark DeepSeek V4 Pro vs Kimi K2.5: DeepSeek V4 Pro лидирует по среднему баллу: 7.6 vs 7.5. DeepSeek V4 Pro имеет более низкую стоимость benchmark: $0.157 vs $0.348. DeepSeek V4 Pro быстрее: 77.20s vs 98.43s, с долей успешных попыток 66.7% vs 68.3%.

Рекомендуемая модель: DeepSeek V4 Pro - Здесь у него лучший балл (7.6), при этом он примерно в 2.2 раза дешевле, чем Kimi K2.5.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-17

Метрика	DeepSeek V4 Pro DeepSeek V4 Pro high Релиз: 2026-04-24	Kimi K2.5 Kimi K2.5 medium Релиз: 2026-01-27

Метрика	DeepSeek V4 Pro DeepSeek V4 Pro high Релиз: 2026-04-24	Kimi K2.5 Kimi K2.5 medium Релиз: 2026-01-27
Оценка	7.6	7.5
Ранг	#41	#43
Надежность	9.3	10.0
Стабильность	7.0	6.9
Тестов верно
Доля успешных попыток	66.7%	68.3%
Нестабильные тесты	8	8
Всего запусков	63	63
Стоимость за результат	1.742	3.704
Общая стоимость	$0.157	$0.348
Цена входа	$0.435 / 1M	$0.375 / 1M
Цена выхода	$0.870 / 1M	$2.025 / 1M
Общее число входных токенов	38,726	34,312
Выходные токены	6,334	48,379
Токены рассуждений	159,151	157,747
Время ответа (среднее)	77.20s	98.43s
Время ответа (макс.)	416.76s	281.00s
Время ответа (суммарно)	1621.17s	1378.03s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#41 DeepSeek V4 Pro

high

Cost: $0.023
Time: 257.6s
Tokens: 14,870 tok

#43 MoonshotAI: Kimi K2.5

medium

Cost: $0.030
Time: 58.6s
Tokens: 8,683 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	5.7	5.9	58.3%	2		25.70s	536	149	3,214
Kimi K2.5	7.3	5.8	83.3%	2		51.38s	634	2,789	8,880

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	6.1	4.6	66.7%	2		243.00s	5,090	383	84,580
Kimi K2.5	6.1	4.6	66.7%	2		217.49s	6,935	5,705	74,693

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	10.0	10.0	100.0%	0		38.17s	14,060	454	5,836
Kimi K2.5	10.0	10.0	100.0%	0		71.37s	11,280	703	3,713

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	10.0	10.0	100.0%	0		25.03s	7,690	274	2,166
Kimi K2.5	10.0	10.0	100.0%	0		49.78s	7,020	563	7,940

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	3.6	7.2	22.2%	1		151.46s	569	4,404	50,391
Kimi K2.5	3.5	4.4	33.3%	2		137.29s	485	20,753	30,564

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	10.0	10.0	100.0%	0		8.83s	471	115	1,013
Kimi K2.5	6.5	3.4	66.7%	1		69.73s	480	3,815	4,262

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	7.8	6.6	83.3%	1		8.73s	627	66	2,726
Kimi K2.5	10.0	10.0	100.0%	0		92.47s	675	5,371	6,547

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	6.9	4.9	77.8%	2		56.85s	591	178	2,563
Kimi K2.5	5.3	7.3	44.4%	1		43.23s	659	8,426	12,692

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	9.8	10.0	100.0%	0		15.92s	8,909	295	701
Kimi K2.5	10.0	10.0	100.0%	0		31.74s	5,933	242	812

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	3.0	10.0	0.0%	0		34.01s	183	16	5,961
Kimi K2.5	3.0	10.0	0.0%	0		83.95s	211	12	7,644

Быстрое сравнение

Сменить пару сравнения