Навигация
AI BENCHY
Advertise here

AI BENCHY Compare

DeepSeek: DeepSeek V3.2 vs IBM: Granite 4.1 8B

Сводка

Сравнение benchmark DeepSeek V3.2 vs Granite 4.1 8B: DeepSeek V3.2 лидирует по среднему баллу: 5.3 vs 4.0. Granite 4.1 8B имеет более низкую стоимость benchmark: $0.003 vs $0.017. Granite 4.1 8B быстрее: 728ms vs 13.83s, с долей успешных попыток 39.7% vs 9.5%.

Рекомендуемая модель: Granite 4.1 8B - Он дает лучший общий компромисс: конкурентный балл (4.0), ниже стоимость, чем у DeepSeek V3.2, и сбалансированное время ответа.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-12

Метрика DeepSeek V3.2 DeepSeek V3.2 none Релиз: 2025-12-01 Granite 4.1 8B Granite 4.1 8B none Релиз: 2026-05-01
Оценка 5.3 4.0
Ранг #133 #163
Надежность 10.0 10.0
Стабильность 7.6 10.0
Тестов верно
Доля успешных попыток 39.7% 9.5%
Нестабильные тесты 6 0
Всего запусков 63 63
Стоимость за результат 0.306 0.131
Общая стоимость $0.017 $0.003
Цена входа $0.229 / 1M $0.050 / 1M
Цена выхода $0.344 / 1M $0.100 / 1M
Общее число входных токенов 55,997 46,285
Выходные токены 11,165 2,911
Токены рассуждений 0 0
Время ответа (среднее) 13.83s 728ms
Время ответа (макс.) 115.89s 2.17s
Время ответа (суммарно) 290.43s 15.29s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#133 DeepSeek V3.2

none
Cost
$0.002
Time
7.0s
Tokens
1,046 tok

#163 IBM: Granite 4.1 8B

none
Cost
$0.001
Time
3.2s
Tokens
491 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
DeepSeek V3.2 3.2 8.0 8.3% 1 9.35s 494 1,073 0
Granite 4.1 8B 4.9 10.0 25.0% 0 844ms 645 903 0
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
DeepSeek V3.2 3.1 6.9 11.1% 1 14.54s 7,279 4,528 0
Granite 4.1 8B 4.5 10.0 0.0% 0 775ms 8,344 525 0
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
DeepSeek V3.2 6.5 10.0 0.0% 0 115.89s 29,843 2,887 0
Granite 4.1 8B 3.0 10.0 0.0% 0 1.88s 19,089 396 0
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
DeepSeek V3.2 6.3 5.8 66.7% 1 9.42s 7,890 1,710 0
Granite 4.1 8B 3.0 10.0 0.0% 0 575ms 7,617 195 0
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
DeepSeek V3.2 2.9 7.2 11.1% 1 4.17s 624 21 0
Granite 4.1 8B 3.0 10.0 0.0% 0 357ms 768 24 0
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
DeepSeek V3.2 4.7 1.6 66.7% 1 9.32s 314 43 0
Granite 4.1 8B 4.0 10.0 0.0% 0 499ms 528 115 0
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
DeepSeek V3.2 10.0 10.0 100.0% 0 1.52s 627 66 0
Granite 4.1 8B 3.6 9.9 0.0% 0 344ms 687 66 0
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
DeepSeek V3.2 7.6 7.2 77.8% 1 6.91s 424 298 0
Granite 4.1 8B 3.2 10.0 0.0% 0 608ms 672 432 0
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
DeepSeek V3.2 10.0 10.0 100.0% 0 11.85s 8,319 522 0
Granite 4.1 8B 10.0 10.0 100.0% 0 2.17s 7,719 243 0
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
DeepSeek V3.2 3.0 10.0 0.0% 0 17.23s 183 17 0
Granite 4.1 8B 3.0 10.0 0.0% 0 306ms 216 12 0

Быстрое сравнение

Сменить пару сравнения