Qwen3.8 27B (high) лидирует по среднему баллу: 8.7 vs 8.6. Qwen3.8 27B (high) имеет более низкую стоимость benchmark: ~$0.298 vs $0.885. Muse Spark 1.1 (low) быстрее: 13.21s vs 166.34s, с долей успешных попыток 72.5% vs 78.3%.
Бенчмарки сгенерированы из тестовых наборов AI BENCHY в:
2026-10-01
Сравниваемые модели
Ранг
#60
Общее число выходных токенов
122,421
Время ответа (среднее)
13.21s
Общая стоимость
$0.885
Ответы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Ранг
#55
Общее число выходных токенов
677,080
Время ответа (среднее)
166.34s
Общая стоимость
~$0.298Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 3.0102 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.297613.
Рекомендуемая модельMuse Spark 1.1 (low)
Его балл близок к лучшему здесь (8.6 против 8.7), и он отвечает примерно в 12.6 раза быстрее, чем Qwen3.8 27B (high).
Qwen3.8 27BQwen3.8 27BhighОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14Бесплатно доступно
Qwen3.8 27BQwen3.8 27BhighОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14Бесплатно доступно
Оценка
8.6Средний балл по всем бенчмарк-тестам.…
8.7Средний балл по всем бенчмарк-тестам.…
Ранг
#60
#55
Надежность
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
9.7Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
8.6Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
9.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Попытки
69/69
69/69
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 5Не соблюдены инструкции: 3Недопустимый вызов инструмента: 1Время ответа (среднее)13.21sВремя ответа (макс.)54.15sВремя ответа (суммарно)303.92sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 2Нет ответа: 2Неверный ответ: 2Время ответа (среднее)166.34sВремя ответа (макс.)640.85sВремя ответа (суммарно)3825.81sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
72.5%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
78.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
4Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
69Всего запусков…
69Всего запусков…
Стоимость за результат
6.318
~1.751Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 3.0102 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.297613.
Общая стоимость
$0.885
~$0.298Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 3.0102 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.297613.
Цена входа
$1.250 / 1MЦена входа…
Н/ДЦена входа…
Цена выхода
$4.250 / 1MЦена выхода…
Н/ДЦена выхода…
Общее число входных токенов
291,368Общее число входных токенов…
348,967Общее число входных токенов…
Выходные токены
13,469Выходные токены…
1,005Выходные токены…
Токены рассуждений
108,952Токены рассуждений…
676,075Токены рассуждений…
Время ответа (среднее)
13.21sВремя ответа (среднее)…
166.34sВремя ответа (среднее)…
Время ответа (макс.)
54.15sВремя ответа (макс.)…
640.85sВремя ответа (макс.)…
Время ответа (суммарно)
303.92sВремя ответа (суммарно)…
3825.81sВремя ответа (суммарно)…
Параметры
~1T всего (~50B активных)
27.3B
Доступность
Закрытая модель
Веса доступны
Генерация showcase моделей
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#60 Muse Spark 1.1
low
Стоимость
$0.020
Время
39.2s
Токены
4,947 tok
#55 Qwen3.8 27B
highОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Стоимость
~$0.008Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.0750 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.007419.
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)42.23sВремя ответа (макс.)42.23sВремя ответа (суммарно)42.23sТест считается полностью пройденным, только если все его прогоны успешны.…
42.23sВремя ответа (среднее)…
149,490Общее число входных токенов…
2,436Выходные токены…
3,496Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)132.27sВремя ответа (макс.)132.27sВремя ответа (суммарно)132.27sТест считается полностью пройденным, только если все его прогоны успешны.…
6.3Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
83.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)4.36sВремя ответа (макс.)8.92sВремя ответа (суммарно)17.45sТест считается полностью пройденным, только если все его прогоны успешны.…
4.36sВремя ответа (среднее)…
2,334Общее число входных токенов…
621Выходные токены…
6,040Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)8.10sВремя ответа (макс.)21.48sВремя ответа (суммарно)32.40sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)10.34sВремя ответа (макс.)12.60sВремя ответа (суммарно)31.02sТест считается полностью пройденным, только если все его прогоны успешны.…
10.34sВремя ответа (среднее)…
8,562Общее число входных токенов…
394Выходные токены…
14,503Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
8.1Средний балл по всем бенчмарк-тестам.…
7.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
88.9%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)248.62sВремя ответа (макс.)458.25sВремя ответа (суммарно)745.85sТест считается полностью пройденным, только если все его прогоны успешны.…
9.1Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Недопустимый вызов инструмента: 1Время ответа (среднее)29.45sВремя ответа (макс.)39.63sВремя ответа (суммарно)58.89sТест считается полностью пройденным, только если все его прогоны успешны.…
29.45sВремя ответа (среднее)…
103,652Общее число входных токенов…
8,010Выходные токены…
17,369Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)185.57sВремя ответа (макс.)333.21sВремя ответа (суммарно)371.15sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.22sВремя ответа (макс.)3.93sВремя ответа (суммарно)6.45sТест считается полностью пройденным, только если все его прогоны успешны.…
3.22sВремя ответа (среднее)…
7,827Общее число входных токенов…
240Выходные токены…
2,074Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)34.85sВремя ответа (макс.)57.71sВремя ответа (суммарно)69.71sТест считается полностью пройденным, только если все его прогоны успешны.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
22.2%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Не соблюдены инструкции: 1Время ответа (среднее)32.99sВремя ответа (макс.)54.15sВремя ответа (суммарно)98.96sТест считается полностью пройденным, только если все его прогоны успешны.…
32.99sВремя ответа (среднее)…
1,596Общее число входных токенов…
421Выходные токены…
48,038Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Неверный ответ: 1Время ответа (среднее)526.74sВремя ответа (макс.)640.85sВремя ответа (суммарно)1580.21sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.12sВремя ответа (макс.)4.12sВремя ответа (суммарно)4.12sТест считается полностью пройденным, только если все его прогоны успешны.…
4.12sВремя ответа (среднее)…
906Общее число входных токенов…
131Выходные токены…
1,125Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)8.45sВремя ответа (макс.)8.45sВремя ответа (суммарно)8.45sТест считается полностью пройденным, только если все его прогоны успешны.…
6.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
83.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)5.42sВремя ответа (макс.)6.23sВремя ответа (суммарно)10.85sТест считается полностью пройденным, только если все его прогоны успешны.…
5.42sВремя ответа (среднее)…
1,527Общее число входных токенов…
252Выходные токены…
4,246Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
9.8Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)8.24sВремя ответа (макс.)10.18sВремя ответа (суммарно)16.49sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)6.60sВремя ответа (макс.)11.77sВремя ответа (суммарно)19.81sТест считается полностью пройденным, только если все его прогоны успешны.…
6.60sВремя ответа (среднее)…
1,938Общее число входных токенов…
391Выходные токены…
7,503Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
7.6Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
77.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)199.90sВремя ответа (макс.)569.33sВремя ответа (суммарно)599.69sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.98sВремя ответа (макс.)5.98sВремя ответа (суммарно)5.98sТест считается полностью пройденным, только если все его прогоны успешны.…
5.98sВремя ответа (среднее)…
12,924Общее число входных токенов…
533Выходные токены…
1,012Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.62sВремя ответа (макс.)5.62sВремя ответа (суммарно)5.62sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)8.17sВремя ответа (макс.)8.17sВремя ответа (суммарно)8.17sТест считается полностью пройденным, только если все его прогоны успешны.…
8.17sВремя ответа (среднее)…
612Общее число входных токенов…
40Выходные токены…
3,546Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)263.98sВремя ответа (макс.)263.98sВремя ответа (суммарно)263.98sТест считается полностью пройденным, только если все его прогоны успешны.…