Навигация
AI BENCHY
Advertise here

AI BENCHY Compare

Qwen: Qwen3.5-122B-A10B vs StepFun: Step 3.7 Flash

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-29

Метрика Qwen3.5-122B-A10B Qwen3.5-122B-A10B medium Релиз: 2026-02-24 Step 3.7 Flash Step 3.7 Flash high Релиз: 2026-05-29
Оценка 7.7 7.1
Ранг #43 #74
Надежность 10.0 10.0
Стабильность 8.8 8.2
Тестов верно
Доля успешных попыток 71.7% 65.8%
Нестабильные тесты 3 4
Всего запусков 60 60
Стоимость за результат 5.031 8.723
Общая стоимость $0.655 $0.960
Цена входа $0.260 / 1M $0.200 / 1M
Цена выхода $2.080 / 1M $1.150 / 1M
Выходные токены 26,166 828,084
Токены рассуждений 213,524 0
Время ответа (среднее) 39.40s 49.43s
Время ответа (макс.) 168.16s 192.75s
Время ответа (суммарно) 788.00s 988.58s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 10.0 10.0 100.0% 0 9.75s 269 16,835
Step 3.7 Flash 10.0 10.0 100.0% 0 13.40s 42,656 0
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 4.1 5.8 33.3% 1 119.57s 8,036 45,074
Step 3.7 Flash 3.6 4.6 25.0% 1 126.82s 164,069 0
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 10.0 10.0 100.0% 0 107.79s 483 11,337
Step 3.7 Flash 10.0 10.0 100.0% 0 13.01s 8,802 0
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 10.0 10.0 100.0% 0 23.41s 270 16,558
Step 3.7 Flash 10.0 10.0 100.0% 0 14.72s 23,113 0
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 2.9 7.2 11.1% 1 63.40s 15,537 64,889
Step 3.7 Flash 4.1 4.4 44.5% 2 149.64s 410,502 0
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 3.4 2.2 33.3% 1 34.11s 66 7,592
Step 3.7 Flash 5.5 10.0 0.0% 0 4.17s 2,862 0
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 10.0 10.0 100.0% 0 9.88s 77 7,372
Step 3.7 Flash 9.8 10.0 100.0% 0 1.52s 2,010 0
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 10.0 10.0 100.0% 0 17.89s 284 27,575
Step 3.7 Flash 5.3 7.2 44.4% 1 10.22s 25,422 0
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 10.0 10.0 100.0% 0 4.60s 322 1,226
Step 3.7 Flash 10.0 10.0 100.0% 0 2.79s 1,172 0
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 3.0 10.0 0.0% 0 52.87s 822 15,066
Step 3.7 Flash 3.0 10.0 0.0% 0 149.34s 147,476 0

Быстрое сравнение

Сменить пару сравнения