Навигация
AI BENCHY
Advertise here

AI BENCHY Compare

OpenAI: GPT-5.2 vs StepFun: Step 3.7 Flash

Сводка

Сравнение benchmark GPT-5.2 vs Step 3.7 Flash: Step 3.7 Flash лидирует по среднему баллу: 8.5 vs 8.4. Step 3.7 Flash имеет более низкую стоимость benchmark: $0.376 vs $0.548. GPT-5.2 быстрее: 16.88s vs 20.35s, с долей успешных попыток 71.4% vs 73.0%.

Рекомендуемая модель: Step 3.7 Flash - У него самый высокий балл в этом сравнении (8.5) и лучший общий баланс стоимости и времени ответа среди всех 2 моделей.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-07-02

Метрика GPT-5.2 GPT-5.2 medium Релиз: 2025-12-11 Step 3.7 Flash Step 3.7 Flash medium Релиз: 2026-05-29
Оценка 8.4 8.5
Ранг #22 #20
Надежность 10.0 9.9
Стабильность 8.4 9.3
Тестов верно
Доля успешных попыток 71.4% 73.0%
Нестабильные тесты 4 2
Всего запусков 63 61
Стоимость за результат 4.209 2.686
Общая стоимость $0.548 $0.376
Цена входа $1.750 / 1M $0.200 / 1M
Цена выхода $14.000 / 1M $1.150 / 1M
Общее число входных токенов 33,967 39,981
Выходные токены 2,901 319,958
Токены рассуждений 31,932 0
Время ответа (среднее) 16.88s 20.35s
Время ответа (макс.) 77.80s 113.98s
Время ответа (суммарно) 236.34s 427.42s

Генерация showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#22 GPT-5.2

medium
Стоимость
$0.047
Время
49.2s
Токены
3,396 tok

#20 Step 3.7 Flash

medium
Стоимость
$0.006
Время
46.2s
Токены
4,466 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 6.5 8.0 58.3% 1 7.81s 606 567 2,002
Step 3.7 Flash 8.7 7.9 91.7% 1 9.65s 756 32,185 0
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 10.0 10.0 100.0% 0 22.73s 7,302 511 11,912
Step 3.7 Flash 8.8 7.8 88.9% 1 27.42s 7,437 44,797 0
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 10.0 10.0 100.0% 0 14.06s 11,019 291 1,757
Step 3.7 Flash 10.0 10.0 100.0% 0 9.06s 13,683 7,106 0
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 10.0 10.0 100.0% 0 3.15s 7,140 234 420
Step 3.7 Flash 10.0 10.0 100.0% 0 2.75s 7,398 3,020 0
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 5.9 7.2 55.6% 1 77.80s 473 42 10,342
Step 3.7 Flash 7.7 10.0 66.7% 0 48.27s 708 70,347 0
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 3.7 9.7 0.0% 0 4.32s 477 162 269
Step 3.7 Flash 4.0 10.0 0.0% 0 6.85s 525 3,987 0
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 9.9 10.0 100.0% 0 3.12s 660 94 614
Step 3.7 Flash 9.8 10.0 100.0% 0 1.83s 735 2,166 0
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 7.5 7.3 77.8% 1 5.80s 642 735 924
Step 3.7 Flash 5.7 9.9 33.3% 0 6.19s 756 15,071 0
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 4.7 1.6 66.7% 1 10.30s 5,453 239 469
Step 3.7 Flash 10.0 10.0 100.0% 0 4.16s 7,746 2,115 0
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 3.0 10.0 0.0% 0 28.18s 195 26 3,223
Step 3.7 Flash 3.0 10.0 0.0% 0 113.98s 237 139,164 0

Быстрое сравнение

Сменить пару сравнения