Навигация
AI BENCHY
Advertise here

AI BENCHY Compare

Google: Gemini 3.1 Flash Lite Preview vs StepFun: Step 3.7 Flash

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-01

Метрика Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview medium Релиз: 2026-03-03 Step 3.7 Flash Step 3.7 Flash high Релиз: 2026-05-29
Оценка 7.7 7.1
Ранг #38 #74
Надежность 10.0 10.0
Стабильность 10.0 8.2
Тестов верно
Доля успешных попыток 65.0% 65.0%
Нестабильные тесты 0 4
Всего запусков 60 60
Стоимость за результат 0.481 8.723
Общая стоимость $0.063 $0.960
Цена входа $0.250 / 1M $0.200 / 1M
Цена выхода $1.500 / 1M $1.150 / 1M
Выходные токены 2,204 828,084
Токены рассуждений 33,657 0
Время ответа (среднее) 3.94s 49.43s
Время ответа (макс.) 14.93s 192.75s
Время ответа (суммарно) 78.74s 988.58s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite Preview 9.1 10.0 75.0% 0 2.33s 570 4,305
Step 3.7 Flash 10.0 10.0 100.0% 0 13.40s 42,656 0
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite Preview 6.8 10.0 50.0% 0 3.98s 455 5,510
Step 3.7 Flash 3.2 4.6 16.7% 1 126.82s 164,069 0
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 14.93s 327 7,347
Step 3.7 Flash 10.0 10.0 100.0% 0 13.01s 8,802 0
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 2.29s 279 2,952
Step 3.7 Flash 10.0 10.0 100.0% 0 14.72s 23,113 0
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite Preview 3.0 10.0 0.0% 0 4.21s 18 5,325
Step 3.7 Flash 4.1 4.4 44.5% 2 149.64s 410,502 0
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 3.16s 96 1,488
Step 3.7 Flash 5.5 10.0 0.0% 0 4.17s 2,862 0
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 1.91s 72 2,121
Step 3.7 Flash 9.8 10.0 100.0% 0 1.52s 2,010 0
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite Preview 7.7 10.0 66.7% 0 5.30s 141 1,896
Step 3.7 Flash 5.3 7.2 44.4% 1 10.22s 25,422 0
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 3.80s 234 912
Step 3.7 Flash 10.0 10.0 100.0% 0 2.79s 1,172 0
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Gemini 3.1 Flash Lite Preview 3.0 10.0 0.0% 0 2.68s 12 1,801
Step 3.7 Flash 3.0 10.0 0.0% 0 149.34s 147,476 0

Быстрое сравнение

Сменить пару сравнения