Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Google: Gemini 3.1 Flash Lite vs StepFun: Step 3.7 Flash

Сводка

Сравнение benchmark Gemini 3.1 Flash Lite vs Step 3.7 Flash: Gemini 3.1 Flash Lite лидирует по среднему баллу: 7.8 vs 7.7. Gemini 3.1 Flash Lite имеет более низкую стоимость benchmark: $0.071 vs $0.341. Gemini 3.1 Flash Lite быстрее: 3.23s vs 15.74s, с долей успешных попыток 65.1% vs 68.3%.

Рекомендуемая модель: Gemini 3.1 Flash Lite - Здесь у него лучший балл (7.8), при этом он примерно в 4.9 раза дешевле, чем Step 3.7 Flash.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-12

Метрика Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite medium Релиз: 2026-05-08 Step 3.7 Flash Step 3.7 Flash low Релиз: 2026-05-29
Оценка 7.8 7.7
Ранг #37 #42
Надежность 10.0 10.0
Стабильность 9.2 8.4
Тестов верно
Доля успешных попыток 65.1% 68.3%
Нестабильные тесты 2 4
Всего запусков 63 63
Стоимость за результат 0.539 2.840
Общая стоимость $0.071 $0.341
Цена входа $0.250 / 1M $0.200 / 1M
Цена выхода $1.500 / 1M $1.150 / 1M
Общее число входных токенов 36,808 40,101
Выходные токены 2,254 289,325
Токены рассуждений 38,300 0
Время ответа (среднее) 3.23s 15.74s
Время ответа (макс.) 10.87s 124.75s
Время ответа (суммарно) 67.80s 330.63s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#37 Gemini 3.1 Flash Lite

medium
Cost
$0.003
Time
5.3s
Tokens
1,754 tok

#42 Step 3.7 Flash

low
Invalid SVG
Cost
$0.004
Time
25.3s
Tokens
3,072 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite 9.1 10.0 75.0% 0 2.39s 502 604 4,201
Step 3.7 Flash 8.7 7.9 91.7% 1 4.02s 756 10,896 0
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite 5.5 10.0 33.3% 0 3.81s 8,134 459 8,978
Step 3.7 Flash 8.2 7.2 88.9% 1 9.46s 7,437 18,685 0
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 10.87s 12,873 327 7,401
Step 3.7 Flash 10.0 10.0 100.0% 0 7.98s 13,683 6,426 0
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 2.60s 7,362 279 2,845
Step 3.7 Flash 7.3 5.8 83.3% 1 2.29s 7,398 2,667 0
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite 2.9 7.2 11.1% 1 3.16s 643 15 5,165
Step 3.7 Flash 5.3 7.2 44.4% 1 43.31s 828 104,487 0
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 2.60s 488 84 1,142
Step 3.7 Flash 3.4 9.3 0.0% 0 7.00s 525 4,604 0
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite 9.9 10.0 100.0% 0 2.59s 623 75 3,320
Step 3.7 Flash 9.8 10.0 100.0% 0 1.58s 735 1,857 0
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite 7.6 7.2 77.8% 1 1.95s 568 165 2,450
Step 3.7 Flash 5.5 9.9 33.3% 0 1.84s 756 3,564 0
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 4.55s 5,457 234 921
Step 3.7 Flash 10.0 10.0 100.0% 0 3.25s 7,746 1,360 0
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite 3.0 10.0 0.0% 0 3.08s 158 12 1,877
Step 3.7 Flash 3.0 10.0 0.0% 0 124.75s 237 134,779 0

Быстрое сравнение

Сменить пару сравнения