Средний балл практически равен: 5.5 vs 5.6. Qwen3.8 27B имеет более низкую стоимость benchmark: ~$0.006 vs $1.745. Qwen3.8 27B быстрее: 3.12s vs 214.25s, с долей успешных попыток 40.9% vs 19.7%.
Бенчмарки сгенерированы из тестовых наборов AI BENCHY в:
2026-08-29
Ответы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Ранг
#220
Общее число выходных токенов
11,445
Время ответа (среднее)
3.12s
Общая стоимость
~$0.006Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.0572 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.005659.
Ранг
#217
Общее число выходных токенов
682,538
Время ответа (среднее)
214.25s
Общая стоимость
$1.745
Рекомендуемая модельQwen3.8 27B
Здесь у него лучший балл (5.5), при этом он примерно в 308.3 раза дешевле, чем Hy4 preview (low).
Подробное сравнение
Метрика
Qwen3.8 27BQwen3.8 27BnoneОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
5.4Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
8.5Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 14Неверный ответ: 3Не соблюдены инструкции: 1Нет ответа: 1Время ответа (среднее)214.25sВремя ответа (макс.)597.45sВремя ответа (суммарно)4713.56sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
40.9%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
19.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
3Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
66Всего запусков…
66Всего запусков…
Стоимость за результат
~0.063Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.0572 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.005659.
58.157
Общая стоимость
~$0.006Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.0572 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.005659.
$1.745
Цена входа
Н/ДЦена входа…
$0.834 / 1MЦена входа…
Цена выхода
Н/ДЦена выхода…
$2.501 / 1MЦена выхода…
Общее число входных токенов
122,463Общее число входных токенов…
45,154Общее число входных токенов…
Выходные токены
11,445Выходные токены…
4,022Выходные токены…
Токены рассуждений
0Токены рассуждений…
678,516Токены рассуждений…
Время ответа (среднее)
3.12sВремя ответа (среднее)…
214.25sВремя ответа (среднее)…
Время ответа (макс.)
44.76sВремя ответа (макс.)…
597.45sВремя ответа (макс.)…
Время ответа (суммарно)
68.69sВремя ответа (суммарно)…
4713.56sВремя ответа (суммарно)…
Параметры
27.3B
770B всего (49B активных)
Доступность
Веса доступны
Открытый исходный код
Генерация showcase моделей
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#220 Qwen3.8 27B
noneОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Стоимость
~$0.001Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.0066 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.000657.
Время
23.9s
Токены
1,922 tok
#217 Hy4 preview
low
Provider returned error
Стоимость
$0.000
Время
1.1s
Токены
0 tok
Оценка
-
Стоимость
-
Время
-
Токены
-
Лучшие модели по оценке
Оценка vs общая стоимость
Время ответа (среднее)
Оценка vs Время ответа (среднее)
Общее число выходных токенов
Оценка vs Общее число выходных токенов
Разбивка по категориям
Анти-ИИ уловки
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
6.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)828msВремя ответа (макс.)1.95sВремя ответа (суммарно)3.31sТест считается полностью пройденным, только если все его прогоны успешны.…
8.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 4Время ответа (среднее)129.60sВремя ответа (макс.)237.97sВремя ответа (суммарно)518.41sТест считается полностью пройденным, только если все его прогоны успешны.…
129.60sВремя ответа (среднее)…
624Общее число входных токенов…
478Выходные токены…
72,022Токены рассуждений…
Программирование
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)1.19sВремя ответа (макс.)1.97sВремя ответа (суммарно)3.56sТест считается полностью пройденным, только если все его прогоны успешны.…
8.6Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 3Время ответа (среднее)219.15sВремя ответа (макс.)259.22sВремя ответа (суммарно)657.45sТест считается полностью пройденным, только если все его прогоны успешны.…
219.15sВремя ответа (среднее)…
6,110Общее число входных токенов…
135Выходные токены…
96,407Токены рассуждений…
Комбинированный
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Недопустимый вызов инструмента: 1Неверный ответ: 1Время ответа (среднее)24.10sВремя ответа (макс.)44.76sВремя ответа (суммарно)48.21sТест считается полностью пройденным, только если все его прогоны успешны.…
5.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
16.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 2Время ответа (среднее)139.43sВремя ответа (макс.)171.85sВремя ответа (суммарно)278.85sТест считается полностью пройденным, только если все его прогоны успешны.…
139.43sВремя ответа (среднее)…
28,254Общее число входных токенов…
2,485Выходные токены…
8,420Токены рассуждений…
Парсинг и извлечение данных
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
6.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)1.14sВремя ответа (макс.)1.18sВремя ответа (суммарно)2.27sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)88.53sВремя ответа (макс.)120.56sВремя ответа (суммарно)177.06sТест считается полностью пройденным, только если все его прогоны успешны.…
88.53sВремя ответа (среднее)…
7,197Общее число входных токенов…
195Выходные токены…
18,424Токены рассуждений…
Предметно-ориентированное
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
7.7Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)552msВремя ответа (макс.)675msВремя ответа (суммарно)1.66sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Ошибка API: 1Время ответа (среднее)470.24sВремя ответа (макс.)547.52sВремя ответа (суммарно)1410.71sТест считается полностью пройденным, только если все его прогоны успешны.…
470.24sВремя ответа (среднее)…
716Общее число входных токенов…
28Выходные токены…
220,446Токены рассуждений…
Общий интеллект
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
4.2Средний балл по всем бенчмарк-тестам.…
9.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)1.31sВремя ответа (макс.)1.31sВремя ответа (суммарно)1.31sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)110.43sВремя ответа (макс.)110.43sВремя ответа (суммарно)110.43sТест считается полностью пройденным, только если все его прогоны успешны.…
110.43sВремя ответа (среднее)…
525Общее число входных токенов…
170Выходные токены…
13,806Токены рассуждений…
Следование инструкциям
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
6.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)582msВремя ответа (макс.)633msВремя ответа (суммарно)1.16sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)77.72sВремя ответа (макс.)91.04sВремя ответа (суммарно)155.43sТест считается полностью пройденным, только если все его прогоны успешны.…
77.72sВремя ответа (среднее)…
732Общее число входных токенов…
71Выходные токены…
17,054Токены рассуждений…
Решение головоломок
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
6.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)1.25sВремя ответа (макс.)1.84sВремя ответа (суммарно)3.76sТест считается полностью пройденным, только если все его прогоны успешны.…
5.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)238.03sВремя ответа (макс.)373.63sВремя ответа (суммарно)714.10sТест считается полностью пройденным, только если все его прогоны успешны.…
238.03sВремя ответа (среднее)…
750Общее число входных токенов…
454Выходные токены…
103,707Токены рассуждений…
Вызов инструментов
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.75sВремя ответа (макс.)2.75sВремя ответа (суммарно)2.75sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)93.67sВремя ответа (макс.)93.67sВремя ответа (суммарно)93.67sТест считается полностью пройденным, только если все его прогоны успешны.…
93.67sВремя ответа (среднее)…
0Общее число входных токенов…
0Выходные токены…
0Токены рассуждений…
Эрудиция
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)703msВремя ответа (макс.)703msВремя ответа (суммарно)703msТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)597.45sВремя ответа (макс.)597.45sВремя ответа (суммарно)597.45sТест считается полностью пройденным, только если все его прогоны успешны.…