Бенчмарк-сравнение Qwen3.8 27B (high) vs Qwen3.8 27B (medium) vs Qwen3.8 27B (low) vs Qwen3.8 27B:Qwen3.8 27B (high) лидирует по Оценка со значением 8.4. Qwen3.8 27B (low) лидирует по Надежность со значением 10.0. У Qwen3.8 27B самый низкий Общая стоимость: ~$0.006. Qwen3.8 27B самый быстрый: 3.12s.
Бенчмарки сгенерированы из тестовых наборов AI BENCHY в:
2026-08-15
Ответы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Ранг
#42
Общее число выходных токенов
656,635
Время ответа (среднее)
167.89s
Общая стоимость
~$0.287Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
Ответы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Ранг
#68
Общее число выходных токенов
136,162
Время ответа (среднее)
33.05s
Общая стоимость
~$0.058Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Ответы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Ранг
#61
Общее число выходных токенов
169,329
Время ответа (среднее)
39.11s
Общая стоимость
~$0.071Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
Ответы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Ранг
#214
Общее число выходных токенов
11,445
Время ответа (среднее)
3.12s
Общая стоимость
~$0.006Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.0572 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.005659.
Рекомендуемая модельQwen3.8 27B
Он дает лучший общий компромисс: конкурентный балл (5.5), ниже стоимость, чем у другие модели в этом сравнении, и сбалансированное время ответа.
Подробное сравнение
Метрика
Qwen3.8 27BQwen3.8 27BhighОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14
Qwen3.8 27BQwen3.8 27BmediumОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14
Qwen3.8 27BQwen3.8 27BlowОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14
Qwen3.8 27BQwen3.8 27BnoneОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14
Метрика
Qwen3.8 27BQwen3.8 27BhighОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14
Qwen3.8 27BQwen3.8 27BmediumОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14
Qwen3.8 27BQwen3.8 27BlowОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14
Qwen3.8 27BQwen3.8 27BnoneОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14
Оценка
8.4Средний балл по всем бенчмарк-тестам.…
7.8Средний балл по всем бенчмарк-тестам.…
7.9Средний балл по всем бенчмарк-тестам.…
5.5Средний балл по всем бенчмарк-тестам.…
Ранг
#42
#68
#61
#214
Надежность
9.6Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
9.6Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
9.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
9.7Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Попытки
66/66
66/66
66/66
66/66
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 2Нет ответа: 2Неверный ответ: 2Время ответа (среднее)167.89sВремя ответа (макс.)640.85sВремя ответа (суммарно)3693.54sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 4Нет ответа: 2Не соблюдены инструкции: 1Время ответа (среднее)39.11sВремя ответа (макс.)376.04sВремя ответа (суммарно)860.51sТест считается полностью пройденным, только если все его прогоны успешны.…
77.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
68.2%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
40.9%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
66Всего запусков…
66Всего запусков…
66Всего запусков…
66Всего запусков…
Стоимость за результат
~1.792Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
~0.409Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
~0.473Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
~0.063Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.0572 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.005659.
Общая стоимость
~$0.287Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
~$0.058Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
~$0.071Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
~$0.006Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.0572 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.005659.
Цена входа
Н/ДЦена входа…
Н/ДЦена входа…
Н/ДЦена входа…
Н/ДЦена входа…
Цена выхода
Н/ДЦена выхода…
Н/ДЦена выхода…
Н/ДЦена выхода…
Н/ДЦена выхода…
Общее число входных токенов
100,179Общее число входных токенов…
98,266Общее число входных токенов…
99,705Общее число входных токенов…
122,463Общее число входных токенов…
Выходные токены
904Выходные токены…
1,861Выходные токены…
1,545Выходные токены…
11,445Выходные токены…
Токены рассуждений
655,731Токены рассуждений…
134,301Токены рассуждений…
167,784Токены рассуждений…
0Токены рассуждений…
Время ответа (среднее)
167.89sВремя ответа (среднее)…
33.05sВремя ответа (среднее)…
39.11sВремя ответа (среднее)…
3.12sВремя ответа (среднее)…
Время ответа (макс.)
640.85sВремя ответа (макс.)…
214.63sВремя ответа (макс.)…
376.04sВремя ответа (макс.)…
44.76sВремя ответа (макс.)…
Время ответа (суммарно)
3693.54sВремя ответа (суммарно)…
694.04sВремя ответа (суммарно)…
860.51sВремя ответа (суммарно)…
68.69sВремя ответа (суммарно)…
Параметры
27.3B
27.3B
27.3B
27.3B
Доступность
Веса доступны
Веса доступны
Веса доступны
Веса доступны
Генерация showcase моделей
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#42 Qwen3.8 27B
highОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Стоимость
~$0.008Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.0750 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.000000.
Время
270.1s
Токены
18,963 tok
#68 Qwen3.8 27B
mediumОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Стоимость
~$0.002Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.0121 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.000000.
Время
43.4s
Токены
2,956 tok
#61 Qwen3.8 27B
lowОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Стоимость
~$0.003Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.0258 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.000000.
Время
92.8s
Токены
6,902 tok
#214 Qwen3.8 27B
noneОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Стоимость
~$0.001Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.0066 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.000000.
Время
23.9s
Токены
1,922 tok
Оценка
-
Стоимость
-
Время
-
Токены
-
Лучшие модели по оценке
Оценка vs общая стоимость
Время ответа (среднее)
Оценка vs Время ответа (среднее)
Общее число выходных токенов
Оценка vs Общее число выходных токенов
Разбивка по категориям
Анти-ИИ уловки
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)8.10sВремя ответа (макс.)21.48sВремя ответа (суммарно)32.40sТест считается полностью пройденным, только если все его прогоны успешны.…
8.10sВремя ответа (среднее)…
1,128Общее число входных токенов…
114Выходные токены…
5,319Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.93sВремя ответа (макс.)5.18sВремя ответа (суммарно)11.70sТест считается полностью пройденным, только если все его прогоны успешны.…
2.93sВремя ответа (среднее)…
672Общее число входных токенов…
228Выходные токены…
1,842Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.02sВремя ответа (макс.)5.68sВремя ответа (суммарно)12.07sТест считается полностью пройденным, только если все его прогоны успешны.…
3.02sВремя ответа (среднее)…
984Общее число входных токенов…
183Выходные токены…
2,016Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
6.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)828msВремя ответа (макс.)1.95sВремя ответа (суммарно)3.31sТест считается полностью пройденным, только если все его прогоны успешны.…
828msВремя ответа (среднее)…
696Общее число входных токенов…
267Выходные токены…
0Токены рассуждений…
Программирование
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
8.1Средний балл по всем бенчмарк-тестам.…
7.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
88.9%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)248.62sВремя ответа (макс.)458.25sВремя ответа (суммарно)745.85sТест считается полностью пройденным, только если все его прогоны успешны.…
248.62sВремя ответа (среднее)…
8,235Общее число входных токенов…
346Выходные токены…
143,335Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)40.50sВремя ответа (макс.)72.14sВремя ответа (суммарно)121.51sТест считается полностью пройденным, только если все его прогоны успешны.…
40.50sВремя ответа (среднее)…
7,893Общее число входных токенов…
585Выходные токены…
26,808Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
7.7Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)140.92sВремя ответа (макс.)376.04sВремя ответа (суммарно)422.75sТест считается полностью пройденным, только если все его прогоны успешны.…
140.92sВремя ответа (среднее)…
8,127Общее число входных токенов…
585Выходные токены…
86,694Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)1.19sВремя ответа (макс.)1.97sВремя ответа (суммарно)3.56sТест считается полностью пройденным, только если все его прогоны успешны.…
1.19sВремя ответа (среднее)…
7,911Общее число входных токенов…
408Выходные токены…
0Токены рассуждений…
Комбинированный
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)185.57sВремя ответа (макс.)333.21sВремя ответа (суммарно)371.15sТест считается полностью пройденным, только если все его прогоны успешны.…
185.57sВремя ответа (среднее)…
68,997Общее число входных токенов…
66Выходные токены…
72,556Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
8.7Средний балл по всем бенчмарк-тестам.…
6.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
83.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Недопустимый вызов инструмента: 1Время ответа (среднее)124.48sВремя ответа (макс.)214.63sВремя ответа (суммарно)248.96sТест считается полностью пройденным, только если все его прогоны успешны.…
124.48sВремя ответа (среднее)…
77,767Общее число входных токенов…
70Выходные токены…
51,705Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)90.63sВремя ответа (макс.)143.71sВремя ответа (суммарно)181.27sТест считается полностью пройденным, только если все его прогоны успешны.…
90.63sВремя ответа (среднее)…
69,687Общее число входных токенов…
66Выходные токены…
37,791Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Недопустимый вызов инструмента: 1Неверный ответ: 1Время ответа (среднее)24.10sВремя ответа (макс.)44.76sВремя ответа (суммарно)48.21sТест считается полностью пройденным, только если все его прогоны успешны.…
24.10sВремя ответа (среднее)…
95,181Общее число входных токенов…
9,588Выходные токены…
0Токены рассуждений…
Парсинг и извлечение данных
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)34.85sВремя ответа (макс.)57.71sВремя ответа (суммарно)69.71sТест считается полностью пройденным, только если все его прогоны успешны.…
34.85sВремя ответа (среднее)…
9,675Общее число входных токенов…
123Выходные токены…
10,320Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
6.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)8.76sВремя ответа (макс.)10.36sВремя ответа (суммарно)17.53sТест считается полностью пройденным, только если все его прогоны успешны.…
8.76sВремя ответа (среднее)…
9,039Общее число входных токенов…
144Выходные токены…
2,271Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)8.03sВремя ответа (макс.)9.09sВремя ответа (суммарно)16.06sТест считается полностью пройденным, только если все его прогоны успешны.…
8.03sВремя ответа (среднее)…
9,087Общее число входных токенов…
150Выходные токены…
1,962Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
6.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)1.14sВремя ответа (макс.)1.18sВремя ответа (суммарно)2.27sТест считается полностью пройденным, только если все его прогоны успешны.…
1.14sВремя ответа (среднее)…
7,788Общее число входных токенов…
246Выходные токены…
0Токены рассуждений…
Предметно-ориентированное
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Неверный ответ: 1Время ответа (среднее)526.74sВремя ответа (макс.)640.85sВремя ответа (суммарно)1580.21sТест считается полностью пройденным, только если все его прогоны успешны.…
526.74sВремя ответа (среднее)…
975Общее число входных токенов…
6Выходные токены…
234,555Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)76.98sВремя ответа (макс.)144.07sВремя ответа (суммарно)230.93sТест считается полностью пройденным, только если все его прогоны успешны.…
76.98sВремя ответа (среднее)…
780Общее число входных токенов…
12Выходные токены…
41,184Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)60.78sВремя ответа (макс.)120.94sВремя ответа (суммарно)182.34sТест считается полностью пройденным, только если все его прогоны успешны.…
60.78sВремя ответа (среднее)…
1,014Общее число входных токенов…
12Выходные токены…
31,872Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
7.7Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)552msВремя ответа (макс.)675msВремя ответа (суммарно)1.66sТест считается полностью пройденным, только если все его прогоны успешны.…
552msВремя ответа (среднее)…
798Общее число входных токенов…
27Выходные токены…
0Токены рассуждений…
Общий интеллект
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)8.45sВремя ответа (макс.)8.45sВремя ответа (суммарно)8.45sТест считается полностью пройденным, только если все его прогоны успешны.…
8.45sВремя ответа (среднее)…
630Общее число входных токенов…
63Выходные токены…
1,191Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)9.20sВремя ответа (макс.)9.20sВремя ответа (суммарно)9.20sТест считается полностью пройденным, только если все его прогоны успешны.…
9.20sВремя ответа (среднее)…
516Общее число входных токенов…
204Выходные токены…
1,299Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)5.37sВремя ответа (макс.)5.37sВремя ответа (суммарно)5.37sТест считается полностью пройденным, только если все его прогоны успешны.…
5.37sВремя ответа (среднее)…
594Общее число входных токенов…
132Выходные токены…
729Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
4.2Средний балл по всем бенчмарк-тестам.…
9.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)1.31sВремя ответа (макс.)1.31sВремя ответа (суммарно)1.31sТест считается полностью пройденным, только если все его прогоны успешны.…
1.31sВремя ответа (среднее)…
522Общее число входных токенов…
126Выходные токены…
0Токены рассуждений…
Следование инструкциям
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
9.8Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)8.24sВремя ответа (макс.)10.18sВремя ответа (суммарно)16.49sТест считается полностью пройденным, только если все его прогоны успешны.…
8.24sВремя ответа (среднее)…
927Общее число входных токенов…
42Выходные токены…
2,871Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.54sВремя ответа (макс.)2.67sВремя ответа (суммарно)5.07sТест считается полностью пройденным, только если все его прогоны успешны.…
2.54sВремя ответа (среднее)…
699Общее число входных токенов…
48Выходные токены…
984Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.43sВремя ответа (макс.)2.87sВремя ответа (суммарно)4.86sТест считается полностью пройденным, только если все его прогоны успешны.…
2.43sВремя ответа (среднее)…
855Общее число входных токенов…
48Выходные токены…
915Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
6.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)582msВремя ответа (макс.)633msВремя ответа (суммарно)1.16sТест считается полностью пройденным, только если все его прогоны успешны.…
582msВремя ответа (среднее)…
711Общее число входных токенов…
72Выходные токены…
0Токены рассуждений…
Решение головоломок
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
7.6Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
77.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)199.90sВремя ответа (макс.)569.33sВремя ответа (суммарно)599.69sТест считается полностью пройденным, только если все его прогоны успешны.…
199.90sВремя ответа (среднее)…
1,038Общее число входных токенов…
120Выходные токены…
138,427Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
8.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)12.62sВремя ответа (макс.)29.62sВремя ответа (суммарно)37.85sТест считается полностью пройденным, только если все его прогоны успешны.…
12.62sВремя ответа (среднее)…
696Общее число входных токенов…
444Выходные токены…
6,237Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
7.7Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)4.91sВремя ответа (макс.)8.81sВремя ответа (суммарно)14.74sТест считается полностью пройденным, только если все его прогоны успешны.…
4.91sВремя ответа (среднее)…
930Общее число входных токенов…
240Выходные токены…
2,382Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
6.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)1.25sВремя ответа (макс.)1.84sВремя ответа (суммарно)3.76sТест считается полностью пройденным, только если все его прогоны успешны.…
1.25sВремя ответа (среднее)…
714Общее число входных токенов…
411Выходные токены…
0Токены рассуждений…
Вызов инструментов
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.62sВремя ответа (макс.)5.62sВремя ответа (суммарно)5.62sТест считается полностью пройденным, только если все его прогоны успешны.…
5.62sВремя ответа (среднее)…
8,256Общее число входных токенов…
21Выходные токены…
912Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)0msВремя ответа (макс.)0msВремя ответа (суммарно)0msТест считается полностью пройденным, только если все его прогоны успешны.…
0msВремя ответа (среднее)…
0Общее число входных токенов…
0Выходные токены…
0Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)8.42sВремя ответа (макс.)8.42sВремя ответа (суммарно)8.42sТест считается полностью пройденным, только если все его прогоны успешны.…
8.42sВремя ответа (среднее)…
8,145Общее число входных токенов…
15Выходные токены…
1,350Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.75sВремя ответа (макс.)2.75sВремя ответа (суммарно)2.75sТест считается полностью пройденным, только если все его прогоны успешны.…
2.75sВремя ответа (среднее)…
7,932Общее число входных токенов…
273Выходные токены…
0Токены рассуждений…
Эрудиция
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Входные токены
Выходные токены
Токены рассуждений
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)263.98sВремя ответа (макс.)263.98sВремя ответа (суммарно)263.98sТест считается полностью пройденным, только если все его прогоны успешны.…
263.98sВремя ответа (среднее)…
318Общее число входных токенов…
3Выходные токены…
46,245Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)11.29sВремя ответа (макс.)11.29sВремя ответа (суммарно)11.29sТест считается полностью пройденным, только если все его прогоны успешны.…
11.29sВремя ответа (среднее)…
204Общее число входных токенов…
126Выходные токены…
1,971Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)12.64sВремя ответа (макс.)12.64sВремя ответа (суммарно)12.64sТест считается полностью пройденным, только если все его прогоны успешны.…
12.64sВремя ответа (среднее)…
282Общее число входных токенов…
114Выходные токены…
2,073Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)703msВремя ответа (макс.)703msВремя ответа (суммарно)703msТест считается полностью пройденным, только если все его прогоны успешны.…