Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Google: Gemini 3.5 Flash vs StepFun: Step 3.7 Flash

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-29

Метрика Gemini 3.5 Flash Gemini 3.5 Flash low Релиз: 2026-05-19 Step 3.7 Flash Step 3.7 Flash high Релиз: 2026-05-29
Оценка 9.3 7.1
Ранг #3 #74
Надежность 10.0 10.0
Стабильность 10.0 8.2
Тестов верно
Доля успешных попыток 90.0% 65.8%
Нестабильные тесты 0 4
Всего запусков 60 60
Стоимость за результат 1.582 8.723
Общая стоимость $0.285 $0.960
Цена входа $1.500 / 1M $0.200 / 1M
Цена выхода $9.000 / 1M $1.150 / 1M
Выходные токены 2,027 828,084
Токены рассуждений 23,938 0
Время ответа (среднее) 2.98s 49.43s
Время ответа (макс.) 6.44s 192.75s
Время ответа (суммарно) 59.59s 988.58s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.5 Flash 10.0 10.0 100.0% 0 2.52s 209 2,536
Step 3.7 Flash 10.0 10.0 100.0% 0 13.40s 42,656 0
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.5 Flash 6.8 10.0 50.0% 0 5.54s 452 6,839
Step 3.7 Flash 3.6 4.6 25.0% 1 126.82s 164,069 0
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.5 Flash 10.0 10.0 100.0% 0 6.44s 351 3,050
Step 3.7 Flash 10.0 10.0 100.0% 0 13.01s 8,802 0
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.5 Flash 10.0 10.0 100.0% 0 1.81s 279 1,164
Step 3.7 Flash 10.0 10.0 100.0% 0 14.72s 23,113 0
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.5 Flash 7.7 10.0 66.7% 0 3.39s 12 4,538
Step 3.7 Flash 4.1 4.4 44.5% 2 149.64s 410,502 0
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.5 Flash 10.0 10.0 100.0% 0 2.27s 119 916
Step 3.7 Flash 5.5 10.0 0.0% 0 4.17s 2,862 0
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.5 Flash 9.9 10.0 100.0% 0 1.86s 71 1,652
Step 3.7 Flash 9.8 10.0 100.0% 0 1.52s 2,010 0
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.5 Flash 10.0 10.0 100.0% 0 2.35s 288 2,150
Step 3.7 Flash 5.3 7.2 44.4% 1 10.22s 25,422 0
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.5 Flash 10.0 10.0 100.0% 0 3.27s 234 403
Step 3.7 Flash 10.0 10.0 100.0% 0 2.79s 1,172 0
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.5 Flash 10.0 10.0 100.0% 0 1.88s 12 690
Step 3.7 Flash 3.0 10.0 0.0% 0 149.34s 147,476 0

Быстрое сравнение

Сменить пару сравнения