Qwen3.8 27B (low) лидирует по среднему баллу: 7.9 vs 7.8. Стоимость локального оборудования не измерялась, поэтому сравнение стоимости недоступно. GLM 5.2 (medium) быстрее: 23.28s vs 39.11s, с долей успешных попыток 68.2% vs 80.3%.
Бенчмарки сгенерированы из тестовых наборов AI BENCHY в:
2026-08-15
Ранг
#61
Общее число выходных токенов
169,329
Время ответа (среднее)
39.11s
Общая стоимость
Н/Д
Ранг
#65
Общее число выходных токенов
61,761
Время ответа (среднее)
23.28s
Общая стоимость
$0.276
Рекомендуемая модельGLM 5.2 (medium)
Его балл близок к лучшему здесь (7.8 против 7.9), и он отвечает примерно в 1.7 раза быстрее, чем Qwen3.8 27B (low).
Подробное сравнение
Метрика
Qwen3.8 27BQwen3.8 27BlowОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14
GLM 5.2GLM 5.2medium63/66 попыток (Цель: 3 повторов на тест)Релиз: 2026-06-17
Метрика
Qwen3.8 27BQwen3.8 27BlowОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14
GLM 5.2GLM 5.2medium63/66 попыток (Цель: 3 повторов на тест)Релиз: 2026-06-17
Оценка
7.9Средний балл по всем бенчмарк-тестам.…
7.8Средний балл по всем бенчмарк-тестам.…
Ранг
#61
#65
Надежность
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
9.5Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
8.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Попытки
66/66
63/66
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 4Нет ответа: 2Не соблюдены инструкции: 1Время ответа (среднее)39.11sВремя ответа (макс.)376.04sВремя ответа (суммарно)860.51sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Нет ответа: 2Тайм-аут: 1Время ответа (среднее)23.28sВремя ответа (макс.)101.36sВремя ответа (суммарно)488.94sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
68.2%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
80.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
4Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
66Всего запусков…
63Всего запусков…
Стоимость за результат
Н/ДПоказывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
2.159Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
Общая стоимость
Н/ДОбщая стоимость (текущая цена)…
$0.276Общая стоимость (текущая цена)…
Цена входа
Н/ДЦена входа…
$1.190 / 1MЦена входа…
Цена выхода
Н/ДЦена выхода…
$3.740 / 1MЦена выхода…
Общее число входных токенов
99,705Общее число входных токенов…
37,199Общее число входных токенов…
Выходные токены
1,545Выходные токены…
12,261Выходные токены…
Токены рассуждений
167,784Токены рассуждений…
49,500Токены рассуждений…
Время ответа (среднее)
39.11sВремя ответа (среднее)…
23.28sВремя ответа (среднее)…
Время ответа (макс.)
376.04sВремя ответа (макс.)…
101.36sВремя ответа (макс.)…
Время ответа (суммарно)
860.51sВремя ответа (суммарно)…
488.94sВремя ответа (суммарно)…
Параметры
27.3B
744B всего (40B активных)
Доступность
Веса доступны
Открытый исходный код
Генерация showcase моделей
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#61 Qwen3.8 27B
lowОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Стоимость
Н/Д
Время
92.8s
Токены
6,902 tok
#65 GLM 5.2
medium
Стоимость
$0.041
Время
195.8s
Токены
9,287 tok
Оценка
-
Стоимость
-
Время
-
Токены
-
Лучшие модели по оценке
Оценка vs общая стоимость
Время ответа (среднее)
Оценка vs Время ответа (среднее)
Общее число выходных токенов
Оценка vs Общее число выходных токенов
Разбивка по категориям
Анти-ИИ уловки
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.02sВремя ответа (макс.)5.68sВремя ответа (суммарно)12.07sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.89sВремя ответа (макс.)7.10sВремя ответа (суммарно)23.56sТест считается полностью пройденным, только если все его прогоны успешны.…
5.89sВремя ответа (среднее)…
639Общее число входных токенов…
497Выходные токены…
2,634Токены рассуждений…
Программирование
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
7.7Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)140.92sВремя ответа (макс.)376.04sВремя ответа (суммарно)422.75sТест считается полностью пройденным, только если все его прогоны успешны.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
88.9%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)40.96sВремя ответа (макс.)60.28sВремя ответа (суммарно)122.88sТест считается полностью пройденным, только если все его прогоны успешны.…
40.96sВремя ответа (среднее)…
7,317Общее число входных токенов…
1,475Выходные токены…
17,123Токены рассуждений…
Комбинированный
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)90.63sВремя ответа (макс.)143.71sВремя ответа (суммарно)181.27sТест считается полностью пройденным, только если все его прогоны успешны.…
5.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)51.96sВремя ответа (макс.)51.96sВремя ответа (суммарно)51.96sТест считается полностью пройденным, только если все его прогоны успешны.…
51.96sВремя ответа (среднее)…
12,696Общее число входных токенов…
458Выходные токены…
4,531Токены рассуждений…
Парсинг и извлечение данных
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)8.03sВремя ответа (макс.)9.09sВремя ответа (суммарно)16.06sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)13.44sВремя ответа (макс.)16.02sВремя ответа (суммарно)26.88sТест считается полностью пройденным, только если все его прогоны успешны.…
13.44sВремя ответа (среднее)…
7,149Общее число входных токенов…
348Выходные токены…
2,345Токены рассуждений…
Предметно-ориентированное
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)60.78sВремя ответа (макс.)120.94sВремя ответа (суммарно)182.34sТест считается полностью пройденным, только если все его прогоны успешны.…
4.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
44.5%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Тайм-аут: 1Неверный ответ: 1Время ответа (среднее)45.47sВремя ответа (макс.)101.36sВремя ответа (суммарно)136.40sТест считается полностью пройденным, только если все его прогоны успешны.…
45.47sВремя ответа (среднее)…
551Общее число входных токенов…
8,188Выходные токены…
11,606Токены рассуждений…
Общий интеллект
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)5.37sВремя ответа (макс.)5.37sВремя ответа (суммарно)5.37sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)17.39sВремя ответа (макс.)17.39sВремя ответа (суммарно)17.39sТест считается полностью пройденным, только если все его прогоны успешны.…
17.39sВремя ответа (среднее)…
498Общее число входных токенов…
54Выходные токены…
1,842Токены рассуждений…
Следование инструкциям
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.43sВремя ответа (макс.)2.87sВремя ответа (суммарно)4.86sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)7.90sВремя ответа (макс.)10.13sВремя ответа (суммарно)15.80sТест считается полностью пройденным, только если все его прогоны успешны.…
7.90sВремя ответа (среднее)…
678Общее число входных токенов…
94Выходные токены…
1,518Токены рассуждений…
Решение головоломок
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
7.7Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)4.91sВремя ответа (макс.)8.81sВремя ответа (суммарно)14.74sТест считается полностью пройденным, только если все его прогоны успешны.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
88.9%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)13.13sВремя ответа (макс.)25.90sВремя ответа (суммарно)39.40sТест считается полностью пройденным, только если все его прогоны успешны.…
13.13sВремя ответа (среднее)…
672Общее число входных токенов…
536Выходные токены…
4,822Токены рассуждений…
Вызов инструментов
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)8.42sВремя ответа (макс.)8.42sВремя ответа (суммарно)8.42sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)20.41sВремя ответа (макс.)20.41sВремя ответа (суммарно)20.41sТест считается полностью пройденным, только если все его прогоны успешны.…
20.41sВремя ответа (среднее)…
6,861Общее число входных токенов…
230Выходные токены…
550Токены рассуждений…
Эрудиция
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)12.64sВремя ответа (макс.)12.64sВремя ответа (суммарно)12.64sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)34.25sВремя ответа (макс.)34.25sВремя ответа (суммарно)34.25sТест считается полностью пройденным, только если все его прогоны успешны.…