Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Google: Gemini 3.1 Pro Preview vs StepFun: Step 3.7 Flash

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-29

Метрика Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Релиз: 2026-02-19 Step 3.7 Flash Step 3.7 Flash low Релиз: 2026-05-29
Оценка 9.3 7.4
Ранг #4 #60
Надежность 10.0 10.0
Стабильность 10.0 8.7
Тестов верно
Доля успешных попыток 90.0% 68.3%
Нестабильные тесты 0 3
Всего запусков 60 60
Стоимость за результат 5.587 2.796
Общая стоимость $1.006 $0.336
Цена входа $2.000 / 1M $0.200 / 1M
Цена выхода $12.000 / 1M $1.150 / 1M
Выходные токены 1,971 285,209
Токены рассуждений 75,384 0
Время ответа (среднее) 20.77s 16.06s
Время ответа (макс.) 88.68s 124.75s
Время ответа (суммарно) 269.96s 321.11s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 7.90s 112 3,218
Step 3.7 Flash 8.7 7.9 91.7% 1 4.02s 10,896 0
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Pro Preview 7.0 9.8 50.0% 0 54.28s 429 37,735
Step 3.7 Flash 10.0 10.0 100.0% 0 9.43s 14,569 0
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Pro Preview 9.5 10.0 100.0% 0 40.61s 432 9,281
Step 3.7 Flash 10.0 10.0 100.0% 0 7.98s 6,426 0
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 7.72s 279 3,904
Step 3.7 Flash 7.3 5.8 83.3% 1 2.29s 2,667 0
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Pro Preview 7.7 10.0 66.7% 0 32.73s 18 12,424
Step 3.7 Flash 5.3 7.2 44.4% 1 43.31s 104,487 0
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 11.77s 108 1,179
Step 3.7 Flash 3.4 9.3 0.0% 0 7.00s 4,604 0
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 9.56s 72 2,236
Step 3.7 Flash 9.8 10.0 100.0% 0 1.58s 1,857 0
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 6.90s 235 3,128
Step 3.7 Flash 5.5 9.9 33.3% 0 1.84s 3,564 0
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 23.15s 274 982
Step 3.7 Flash 10.0 10.0 100.0% 0 3.25s 1,360 0
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 6.27s 12 1,297
Step 3.7 Flash 3.0 10.0 0.0% 0 124.75s 134,779 0

Быстрое сравнение

Сменить пару сравнения