Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Qwen: Qwen3.6 Max Preview vs StepFun: Step 3.7 Flash

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-29

Метрика Qwen3.6 Max Preview Qwen3.6 Max Preview none Релиз: 2026-04-20 Step 3.7 Flash Step 3.7 Flash high Релиз: 2026-05-29
Оценка 7.1 7.1
Ранг #76 #74
Надежность 10.0 10.0
Стабильность 9.2 8.2
Тестов верно
Доля успешных попыток 61.7% 65.8%
Нестабильные тесты 2 4
Всего запусков 60 60
Стоимость за результат 0.797 8.723
Общая стоимость $0.088 $0.960
Цена входа $1.040 / 1M $0.200 / 1M
Цена выхода $6.240 / 1M $1.150 / 1M
Выходные токены 4,773 828,084
Токены рассуждений 0 0
Время ответа (среднее) 3.31s 49.43s
Время ответа (макс.) 20.51s 192.75s
Время ответа (суммарно) 66.17s 988.58s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.6 Max Preview 5.2 7.9 41.7% 1 2.63s 513 0
Step 3.7 Flash 10.0 10.0 100.0% 0 13.40s 42,656 0
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.6 Max Preview 4.2 6.0 33.3% 1 3.06s 450 0
Step 3.7 Flash 3.6 4.6 25.0% 1 126.82s 164,069 0
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.6 Max Preview 3.0 10.0 0.0% 0 20.51s 2,842 0
Step 3.7 Flash 10.0 10.0 100.0% 0 13.01s 8,802 0
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.6 Max Preview 10.0 10.0 100.0% 0 2.87s 243 0
Step 3.7 Flash 10.0 10.0 100.0% 0 14.72s 23,113 0
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.6 Max Preview 7.7 10.0 66.7% 0 1.22s 18 0
Step 3.7 Flash 4.1 4.4 44.5% 2 149.64s 410,502 0
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.6 Max Preview 4.3 10.0 0.0% 0 1.62s 76 0
Step 3.7 Flash 5.5 10.0 0.0% 0 4.17s 2,862 0
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.6 Max Preview 9.8 10.0 100.0% 0 1.40s 69 0
Step 3.7 Flash 9.8 10.0 100.0% 0 1.52s 2,010 0
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.6 Max Preview 10.0 10.0 100.0% 0 2.65s 321 0
Step 3.7 Flash 5.3 7.2 44.4% 1 10.22s 25,422 0
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.6 Max Preview 10.0 10.0 100.0% 0 5.27s 222 0
Step 3.7 Flash 10.0 10.0 100.0% 0 2.79s 1,172 0
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.6 Max Preview 3.0 10.0 0.0% 0 1.97s 19 0
Step 3.7 Flash 3.0 10.0 0.0% 0 149.34s 147,476 0

Быстрое сравнение

Сменить пару сравнения