Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

DeepSeek: DeepSeek V4 Flash vs StepFun: Step 3.7 Flash

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-29

Метрика DeepSeek V4 Flash DeepSeek V4 Flash high Релиз: 2026-04-24 Бесплатно доступно Step 3.7 Flash Step 3.7 Flash medium Релиз: 2026-05-29
Оценка 7.6 7.9
Ранг #47 #32
Надежность 10.0 9.9
Стабильность 8.4 9.2
Тестов верно
Доля успешных попыток 73.3% 71.7%
Нестабильные тесты 4 2
Всего запусков 60 58
Стоимость за результат 0.309 2.663
Общая стоимость $0.037 $0.347
Цена входа $0.100 / 1M $0.200 / 1M
Цена выхода $0.200 / 1M $1.150 / 1M
Выходные токены 10,302 294,481
Токены рассуждений 115,740 0
Время ответа (среднее) 46.36s 18.32s
Время ответа (макс.) 218.13s 113.98s
Время ответа (суммарно) 927.27s 366.45s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Flash 8.3 10.0 75.0% 0 28.51s 140 7,770
Step 3.7 Flash 8.7 7.9 91.7% 1 9.65s 32,185 0
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Flash 6.8 10.0 50.0% 0 58.13s 387 27,101
Step 3.7 Flash 8.2 6.7 83.3% 1 10.64s 19,320 0
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Flash 10.0 10.0 100.0% 0 76.57s 465 7,347
Step 3.7 Flash 10.0 10.0 100.0% 0 9.06s 7,106 0
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Flash 10.0 10.0 100.0% 0 28.03s 201 1,179
Step 3.7 Flash 10.0 10.0 100.0% 0 2.75s 3,020 0
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Flash 4.1 4.4 44.5% 2 100.31s 27 59,249
Step 3.7 Flash 7.7 10.0 66.7% 0 48.27s 70,347 0
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Flash 6.1 3.1 66.7% 1 25.15s 79 632
Step 3.7 Flash 4.0 10.0 0.0% 0 6.85s 3,987 0
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Flash 10.0 10.0 100.0% 0 15.36s 63 1,622
Step 3.7 Flash 9.8 10.0 100.0% 0 1.83s 2,166 0
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Flash 8.2 7.2 88.9% 1 26.11s 196 1,767
Step 3.7 Flash 5.7 9.9 33.3% 0 6.19s 15,071 0
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Flash 10.0 10.0 100.0% 0 74.73s 228 542
Step 3.7 Flash 10.0 10.0 100.0% 0 4.16s 2,115 0
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
DeepSeek V4 Flash 3.0 10.0 0.0% 0 54.46s 8,516 8,531
Step 3.7 Flash 3.0 10.0 0.0% 0 113.98s 139,164 0

Быстрое сравнение

Сменить пару сравнения