Навигация
AI BENCHY
Advertise here

AI BENCHY Compare

Qwen: Qwen3.5-122B-A10B vs StepFun: Step 3.5 Flash

Сводка

Сравнение benchmark Qwen3.5-122B-A10B vs Step 3.5 Flash: Step 3.5 Flash лидирует по среднему баллу: 6.6 vs 5.3. Qwen3.5-122B-A10B имеет более низкую стоимость benchmark: $0.020 vs $0.070. Qwen3.5-122B-A10B быстрее: 3.41s vs 72.53s, с долей успешных попыток 31.8% vs 54.0%.

Рекомендуемая модель: Qwen3.5-122B-A10B - Он дает лучший общий компромисс: конкурентный балл (5.3), ниже стоимость, чем у Step 3.5 Flash, и сбалансированное время ответа.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-18

Метрика Qwen3.5-122B-A10B Qwen3.5-122B-A10B none Релиз: 2026-02-24 Step 3.5 Flash Step 3.5 Flash medium Релиз: 2026-02-01
Оценка 5.3 6.6
Ранг #125 #80
Надежность 10.0 10.0
Стабильность 9.6 8.9
Тестов верно
Доля успешных попыток 31.8% 54.0%
Нестабильные тесты 1 1
Всего запусков 63 60
Стоимость за результат 0.393 0.198
Общая стоимость $0.020 $0.070
Цена входа $0.260 / 1M $0.090 / 1M
Цена выхода $2.080 / 1M $0.300 / 1M
Общее число входных токенов 47,735 34,431
Выходные токены 3,383 91,587
Токены рассуждений 0 195,973
Время ответа (среднее) 3.41s 72.53s
Время ответа (макс.) 46.00s 453.94s
Время ответа (суммарно) 71.59s 1015.47s

Генерация showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#125 Qwen3.5-122B-A10B

none
Стоимость
$0.016
Время
44.5s
Токены
6,431 tok

#80 Step 3.5 Flash

medium
Стоимость
$0.008
Время
277.1s
Токены
23,695 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 4.8 10.0 25.0% 0 1.59s 696 312 0
Step 3.5 Flash 10.0 10.0 100.0% 0 40.57s 694 20,391 24,176
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 3.7 7.0 22.2% 1 2.77s 7,913 693 0
Step 3.5 Flash 2.4 5.2 0.0% 0 258.38s 2,211 13,207 22,429
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 3.0 10.0 0.0% 0 46.00s 20,175 1,137 0
Step 3.5 Flash 10.0 10.0 100.0% 0 29.57s 13,638 1,176 12,984
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 10.0 10.0 100.0% 0 1.01s 7,794 243 0
Step 3.5 Flash 10.0 10.0 100.0% 0 15.01s 7,368 600 13,886
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 5.3 10.0 33.3% 0 465ms 789 15 0
Step 3.5 Flash 5.3 7.2 44.4% 1 170.45s 673 45,350 90,436
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 5.0 10.0 0.0% 0 1.12s 522 66 0
Step 3.5 Flash 5.5 10.0 0.0% 0 22.39s 509 240 3,506
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 6.3 10.0 50.0% 0 513ms 711 69 0
Step 3.5 Flash 8.3 10.0 50.0% 0 4.78s 705 2,364 3,521
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 3.8 10.0 0.0% 0 1.00s 714 575 0
Step 3.5 Flash 5.3 10.0 33.3% 0 7.22s 711 5,630 10,861
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 10.0 10.0 100.0% 0 2.04s 8,211 264 0
Step 3.5 Flash 10.0 10.0 100.0% 0 11.91s 7,701 275 3,802
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Qwen3.5-122B-A10B 3.0 10.0 0.0% 0 295ms 210 9 0
Step 3.5 Flash 3.0 10.0 0.0% 0 108.45s 221 2,354 10,372

Быстрое сравнение

Сменить пару сравнения