AI BENCHY Compare

DeepSeek: DeepSeek V4 Pro vs inclusionAI: Ling-2.6-flash

Сводка

Сравнение benchmark DeepSeek V4 Pro vs Ling-2.6-flash: DeepSeek V4 Pro лидирует по среднему баллу: 6.0 vs 5.0. Ling-2.6-flash имеет более низкую стоимость benchmark: $0.001 vs $0.079. Ling-2.6-flash быстрее: 9.34s vs 65.21s, с долей успешных попыток 52.4% vs 31.8%.

Рекомендуемая модель: Ling-2.6-flash - Он дает лучший общий компромисс: конкурентный балл (5.0), ниже стоимость, чем у DeepSeek V4 Pro, и сбалансированное время ответа.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-04

Метрика	DeepSeek V4 Pro DeepSeek V4 Pro high Релиз: 2026-04-24	Ling-2.6-flash Ling-2.6-flash none Релиз: 2026-04-21

Метрика	DeepSeek V4 Pro DeepSeek V4 Pro high Релиз: 2026-04-24	Ling-2.6-flash Ling-2.6-flash none Релиз: 2026-04-21
Оценка	6.0	5.0
Ранг	#103	#138
Надежность	9.0	10.0
Стабильность	7.6	9.2
Тестов верно
Доля успешных попыток	52.4%	31.8%
Нестабильные тесты	6	2
Всего запусков	63	63
Стоимость за результат	2.869	0.005
Общая стоимость	$0.079	$0.001
Цена входа	$0.435 / 1M	$0.010 / 1M
Цена выхода	$0.870 / 1M	$0.030 / 1M
Общее число входных токенов	32,240	40,718
Выходные токены	12,250	2,878
Токены рассуждений	72,257	0
Время ответа (среднее)	65.21s	9.34s
Время ответа (макс.)	358.35s	35.34s
Время ответа (суммарно)	1304.19s	177.48s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#103 DeepSeek V4 Pro

high

Cost: $0.023
Time: 257.6s
Tokens: 14,870 tok

#138 Ling-2.6-flash

none

No showcase result has been generated for this model yet.

Cost: $0.000
Time: -
Tokens: 0 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	6.4	7.9	58.3%	1		16.53s	448	71	3,617
Ling-2.6-flash	6.8	8.1	58.3%	1		11.81s	726	573	0

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	3.3	6.4	11.1%	1		118.23s	1,966	111	20,940
Ling-2.6-flash	5.3	10.0	33.3%	0		11.21s	813	381	0

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	10.0	10.0	100.0%	0		65.02s	14,016	465	5,914
Ling-2.6-flash	3.0	10.0	0.0%	0		35.34s	20,818	1,069	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	7.3	5.9	83.3%	1		23.62s	5,633	229	1,710
Ling-2.6-flash	6.5	10.0	50.0%	0		8.48s	8,004	246	0

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	2.9	7.2	11.1%	1		205.66s	430	10,529	28,089
Ling-2.6-flash	3.0	10.0	0.0%	0		4.95s	810	24	0

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	6.1	3.1	66.7%	1		25.09s	314	76	1,152
Ling-2.6-flash	4.0	10.0	0.0%	0		1.45s	540	109	0

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	10.0	10.0	100.0%	0		41.16s	627	205	2,416
Ling-2.6-flash	9.8	10.0	100.0%	0		5.52s	732	81	0

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	5.9	7.2	55.6%	1		34.84s	544	139	4,019
Ling-2.6-flash	2.9	7.2	11.1%	1		6.51s	729	151	0

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	10.0	10.0	100.0%	0		21.33s	8,079	372	593
Ling-2.6-flash	3.0	10.0	0.0%	0		18.80s	7,324	229	0

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
DeepSeek V4 Pro	3.0	10.0	0.0%	0		39.14s	183	53	3,807
Ling-2.6-flash	3.0	10.0	0.0%	0		1.06s	222	15	0

Быстрое сравнение

Сменить пару сравнения