Средний балл практически равен: 7.9 vs 7.9. Стоимость локального оборудования не измерялась, поэтому сравнение стоимости недоступно. Qwen3.8 27B (low) быстрее: 39.11s vs 142.84s, с долей успешных попыток 77.3% vs 68.2%.
Бенчмарки сгенерированы из тестовых наборов AI BENCHY в:
2026-08-15
Ранг
#58
Общее число выходных токенов
224,128
Время ответа (среднее)
142.84s
Общая стоимость
$3.467
Ранг
#61
Общее число выходных токенов
169,329
Время ответа (среднее)
39.11s
Общая стоимость
Н/Д
Рекомендуемая модельQwen3.8 27B (low)
Здесь у него лучший балл (7.9), и он отвечает примерно в 3.7 раза быстрее, чем Kimi K3 (max).
Qwen3.8 27BQwen3.8 27BlowОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14
Оценка
7.9Средний балл по всем бенчмарк-тестам.…
7.9Средний балл по всем бенчмарк-тестам.…
Ранг
#58
#61
Надежность
9.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
9.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Попытки
66/66
66/66
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 2Нет ответа: 2Лишнее форматирование: 1Тайм-аут: 1Время ответа (среднее)142.84sВремя ответа (макс.)766.58sВремя ответа (суммарно)2714.02sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 4Нет ответа: 2Не соблюдены инструкции: 1Время ответа (среднее)39.11sВремя ответа (макс.)376.04sВремя ответа (суммарно)860.51sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
77.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
68.2%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
66Всего запусков…
66Всего запусков…
Стоимость за результат
21.668Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
Н/ДПоказывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
Общая стоимость
$3.467Общая стоимость (текущая цена)…
Н/ДОбщая стоимость (текущая цена)…
Цена входа
$3.000 / 1MЦена входа…
Н/ДЦена входа…
Цена выхода
$15.000 / 1MЦена выхода…
Н/ДЦена выхода…
Общее число входных токенов
34,960Общее число входных токенов…
99,705Общее число входных токенов…
Выходные токены
2,887Выходные токены…
1,545Выходные токены…
Токены рассуждений
221,241Токены рассуждений…
167,784Токены рассуждений…
Время ответа (среднее)
142.84sВремя ответа (среднее)…
39.11sВремя ответа (среднее)…
Время ответа (макс.)
766.58sВремя ответа (макс.)…
376.04sВремя ответа (макс.)…
Время ответа (суммарно)
2714.02sВремя ответа (суммарно)…
860.51sВремя ответа (суммарно)…
Параметры
2.8T всего (104B активных)
27.3B
Доступность
Веса доступны
Веса доступны
Генерация showcase моделей
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#58 MoonshotAI: Kimi K3
max
Стоимость
$0.281
Время
506.9s
Токены
18,863 tok
#61 Qwen3.8 27B
lowОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)10.24sВремя ответа (макс.)15.21sВремя ответа (суммарно)40.97sТест считается полностью пройденным, только если все его прогоны успешны.…
10.24sВремя ответа (среднее)…
1,638Общее число входных токенов…
496Выходные токены…
2,629Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.02sВремя ответа (макс.)5.68sВремя ответа (суммарно)12.07sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)325.79sВремя ответа (макс.)589.43sВремя ответа (суммарно)977.36sТест считается полностью пройденным, только если все его прогоны успешны.…
325.79sВремя ответа (среднее)…
8,061Общее число входных токенов…
460Выходные токены…
84,012Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
7.7Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)140.92sВремя ответа (макс.)376.04sВремя ответа (суммарно)422.75sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)223.03sВремя ответа (макс.)223.03sВремя ответа (суммарно)223.03sТест считается полностью пройденным, только если все его прогоны успешны.…
223.03sВремя ответа (среднее)…
12,792Общее число входных токенов…
399Выходные токены…
20,460Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)90.63sВремя ответа (макс.)143.71sВремя ответа (суммарно)181.27sТест считается полностью пройденным, только если все его прогоны успешны.…
5.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
83.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Лишнее форматирование: 1Время ответа (среднее)16.72sВремя ответа (макс.)18.73sВремя ответа (суммарно)33.44sТест считается полностью пройденным, только если все его прогоны успешны.…
16.72sВремя ответа (среднее)…
7,839Общее число входных токенов…
354Выходные токены…
2,606Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)8.03sВремя ответа (макс.)9.09sВремя ответа (суммарно)16.06sТест считается полностью пройденным, только если все его прогоны успешны.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
44.4%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Тайм-аут: 1Время ответа (среднее)683.62sВремя ответа (макс.)766.58sВремя ответа (суммарно)1367.25sТест считается полностью пройденным, только если все его прогоны успешны.…
683.62sВремя ответа (среднее)…
838Общее число входных токенов…
57Выходные токены…
106,892Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)60.78sВремя ответа (макс.)120.94sВремя ответа (суммарно)182.34sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)14.91sВремя ответа (макс.)14.91sВремя ответа (суммарно)14.91sТест считается полностью пройденным, только если все его прогоны успешны.…
14.91sВремя ответа (среднее)…
732Общее число входных токенов…
191Выходные токены…
871Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)5.37sВремя ответа (макс.)5.37sВремя ответа (суммарно)5.37sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)7.66sВремя ответа (макс.)7.99sВремя ответа (суммарно)15.33sТест считается полностью пройденным, только если все его прогоны успешны.…
7.66sВремя ответа (среднее)…
1,179Общее число входных токенов…
147Выходные токены…
1,119Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.43sВремя ответа (макс.)2.87sВремя ответа (суммарно)4.86sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)7.36sВремя ответа (макс.)12.30sВремя ответа (суммарно)22.07sТест считается полностью пройденным, только если все его прогоны успешны.…
7.36sВремя ответа (среднее)…
1,416Общее число входных токенов…
495Выходные токены…
1,368Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
7.7Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)4.91sВремя ответа (макс.)8.81sВремя ответа (суммарно)14.74sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)0msВремя ответа (макс.)0msВремя ответа (суммарно)0msТест считается полностью пройденным, только если все его прогоны успешны.…
0msВремя ответа (среднее)…
0Общее число входных токенов…
0Выходные токены…
0Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)8.42sВремя ответа (макс.)8.42sВремя ответа (суммарно)8.42sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)19.67sВремя ответа (макс.)19.67sВремя ответа (суммарно)19.67sТест считается полностью пройденным, только если все его прогоны успешны.…
19.67sВремя ответа (среднее)…
465Общее число входных токенов…
288Выходные токены…
1,284Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)12.64sВремя ответа (макс.)12.64sВремя ответа (суммарно)12.64sТест считается полностью пройденным, только если все его прогоны успешны.…