GLM 5.2 (high) лидирует по среднему баллу: 8.0 vs 7.9. Стоимость локального оборудования не измерялась, поэтому сравнение стоимости недоступно. Qwen3.8 27B (low) быстрее: 39.11s vs 69.86s, с долей успешных попыток 68.2% vs 69.7%.
Бенчмарки сгенерированы из тестовых наборов AI BENCHY в:
2026-08-15
Ранг
#61
Общее число выходных токенов
169,329
Время ответа (среднее)
39.11s
Общая стоимость
Н/Д
Ранг
#55
Общее число выходных токенов
364,655
Время ответа (среднее)
69.86s
Общая стоимость
$1.463
Рекомендуемая модельGLM 5.2 (high)
У него самый высокий балл в этом сравнении (8.0) и лучший общий баланс стоимости и времени ответа среди всех 2 моделей.
Подробное сравнение
Метрика
Qwen3.8 27BQwen3.8 27BlowОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
8.6Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Попытки
66/66
66/66
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 4Нет ответа: 2Не соблюдены инструкции: 1Время ответа (среднее)39.11sВремя ответа (макс.)376.04sВремя ответа (суммарно)860.51sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Тайм-аут: 3Нет ответа: 2Неверный ответ: 2Не соблюдены инструкции: 1Время ответа (среднее)69.86sВремя ответа (макс.)599.43sВремя ответа (суммарно)1536.98sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
68.2%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
69.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
3Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
66Всего запусков…
66Всего запусков…
Стоимость за результат
Н/ДПоказывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
6.849Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
Общая стоимость
Н/ДОбщая стоимость (текущая цена)…
$1.463Общая стоимость (текущая цена)…
Цена входа
Н/ДЦена входа…
$1.190 / 1MЦена входа…
Цена выхода
Н/ДЦена выхода…
$3.740 / 1MЦена выхода…
Общее число входных токенов
99,705Общее число входных токенов…
83,822Общее число входных токенов…
Выходные токены
1,545Выходные токены…
72,040Выходные токены…
Токены рассуждений
167,784Токены рассуждений…
292,615Токены рассуждений…
Время ответа (среднее)
39.11sВремя ответа (среднее)…
69.86sВремя ответа (среднее)…
Время ответа (макс.)
376.04sВремя ответа (макс.)…
599.43sВремя ответа (макс.)…
Время ответа (суммарно)
860.51sВремя ответа (суммарно)…
1536.98sВремя ответа (суммарно)…
Параметры
27.3B
744B всего (40B активных)
Доступность
Веса доступны
Открытый исходный код
Генерация showcase моделей
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#61 Qwen3.8 27B
lowОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Стоимость
Н/Д
Время
92.8s
Токены
6,902 tok
#55 GLM 5.2
high
Неверный SVG
Стоимость
$0.000
Время
300.0s
Токены
0 tok
Оценка
-
Стоимость
-
Время
-
Токены
-
Лучшие модели по оценке
Оценка vs общая стоимость
Время ответа (среднее)
Оценка vs Время ответа (среднее)
Общее число выходных токенов
Оценка vs Общее число выходных токенов
Разбивка по категориям
Анти-ИИ уловки
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.02sВремя ответа (макс.)5.68sВремя ответа (суммарно)12.07sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.80sВремя ответа (макс.)7.00sВремя ответа (суммарно)23.18sТест считается полностью пройденным, только если все его прогоны успешны.…
5.80sВремя ответа (среднее)…
639Общее число входных токенов…
406Выходные токены…
2,660Токены рассуждений…
Программирование
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
7.7Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)140.92sВремя ответа (макс.)376.04sВремя ответа (суммарно)422.75sТест считается полностью пройденным, только если все его прогоны успешны.…
8.6Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Тайм-аут: 2Время ответа (среднее)73.03sВремя ответа (макс.)129.73sВремя ответа (суммарно)219.09sТест считается полностью пройденным, только если все его прогоны успешны.…
73.03sВремя ответа (среднее)…
5,124Общее число входных токенов…
2,302Выходные токены…
22,546Токены рассуждений…
Комбинированный
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)90.63sВремя ответа (макс.)143.71sВремя ответа (суммарно)181.27sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)321.47sВремя ответа (макс.)599.43sВремя ответа (суммарно)642.94sТест считается полностью пройденным, только если все его прогоны успешны.…
321.47sВремя ответа (среднее)…
61,516Общее число входных токенов…
18,824Выходные токены…
63,861Токены рассуждений…
Парсинг и извлечение данных
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)8.03sВремя ответа (макс.)9.09sВремя ответа (суммарно)16.06sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.81sВремя ответа (макс.)9.80sВремя ответа (суммарно)11.62sТест считается полностью пройденным, только если все его прогоны успешны.…
5.81sВремя ответа (среднее)…
7,143Общее число входных токенов…
435Выходные токены…
1,414Токены рассуждений…
Предметно-ориентированное
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)60.78sВремя ответа (макс.)120.94sВремя ответа (суммарно)182.34sТест считается полностью пройденным, только если все его прогоны успешны.…
6.5Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
11.1%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 2Тайм-аут: 1Время ответа (среднее)126.85sВремя ответа (макс.)180.69sВремя ответа (суммарно)380.54sТест считается полностью пройденным, только если все его прогоны успешны.…
126.85sВремя ответа (среднее)…
560Общее число входных токенов…
49,045Выходные токены…
157,522Токены рассуждений…
Общий интеллект
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)5.37sВремя ответа (макс.)5.37sВремя ответа (суммарно)5.37sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)12.90sВремя ответа (макс.)12.90sВремя ответа (суммарно)12.90sТест считается полностью пройденным, только если все его прогоны успешны.…
12.90sВремя ответа (среднее)…
498Общее число входных токенов…
63Выходные токены…
1,743Токены рассуждений…
Следование инструкциям
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.43sВремя ответа (макс.)2.87sВремя ответа (суммарно)4.86sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.26sВремя ответа (макс.)5.88sВремя ответа (суммарно)8.52sТест считается полностью пройденным, только если все его прогоны успешны.…
4.26sВремя ответа (среднее)…
678Общее число входных токенов…
151Выходные токены…
1,210Токены рассуждений…
Решение головоломок
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
7.7Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)4.91sВремя ответа (макс.)8.81sВремя ответа (суммарно)14.74sТест считается полностью пройденным, только если все его прогоны успешны.…
4.6Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)33.71sВремя ответа (макс.)76.21sВремя ответа (суммарно)101.13sТест считается полностью пройденным, только если все его прогоны успешны.…
33.71sВремя ответа (среднее)…
665Общее число входных токенов…
568Выходные токены…
22,392Токены рассуждений…
Вызов инструментов
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)8.42sВремя ответа (макс.)8.42sВремя ответа (суммарно)8.42sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)9.25sВремя ответа (макс.)9.25sВремя ответа (суммарно)9.25sТест считается полностью пройденным, только если все его прогоны успешны.…
9.25sВремя ответа (среднее)…
6,861Общее число входных токенов…
246Выходные токены…
503Токены рассуждений…
Эрудиция
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)12.64sВремя ответа (макс.)12.64sВремя ответа (суммарно)12.64sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)127.82sВремя ответа (макс.)127.82sВремя ответа (суммарно)127.82sТест считается полностью пройденным, только если все его прогоны успешны.…