Средний балл практически равен: 7.8 vs 7.8. Qwen3.8 27B (medium) имеет более низкую стоимость benchmark: ~$0.058 vs $0.236. Qwen3.8 27B (medium) быстрее: 33.05s vs 47.94s, с долей успешных попыток 69.7% vs 66.7%.
Бенчмарки сгенерированы из тестовых наборов AI BENCHY в:
2026-09-28
Сравниваемые модели
Ранг
#102
Общее число выходных токенов
101,296
Время ответа (среднее)
47.94s
Общая стоимость
$0.236
Ответы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Ранг
#101
Общее число выходных токенов
136,162
Время ответа (среднее)
33.05s
Общая стоимость
~$0.058Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Рекомендуемая модельQwen3.8 27B (medium)
Здесь у него лучший балл (7.8), при этом он примерно в 4.1 раза дешевле, чем Seed-2.0-Lite (medium).
Qwen3.8 27BQwen3.8 27BmediumОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14
Оценка
7.8Средний балл по всем бенчмарк-тестам.…
7.8Средний балл по всем бенчмарк-тестам.…
Ранг
#102
#101
Надежность
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
9.6Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
8.6Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
9.7Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Попытки
66/66
66/66
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 6Не соблюдены инструкции: 2Нет ответа: 1Время ответа (среднее)47.94sВремя ответа (макс.)254.92sВремя ответа (суммарно)1054.57sТест считается полностью пройденным, только если все его прогоны успешны.…
69.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
4Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
66Всего запусков…
66Всего запусков…
Стоимость за результат
1.809
~0.409Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Общая стоимость
$0.236
~$0.058Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Цена входа
$0.250 / 1MЦена входа…
Н/ДЦена входа…
Цена выхода
$2.000 / 1MЦена выхода…
Н/ДЦена выхода…
Общее число входных токенов
129,906Общее число входных токенов…
98,266Общее число входных токенов…
Выходные токены
12,530Выходные токены…
1,861Выходные токены…
Токены рассуждений
88,766Токены рассуждений…
134,301Токены рассуждений…
Время ответа (среднее)
47.94sВремя ответа (среднее)…
33.05sВремя ответа (среднее)…
Время ответа (макс.)
254.92sВремя ответа (макс.)…
214.63sВремя ответа (макс.)…
Время ответа (суммарно)
1054.57sВремя ответа (суммарно)…
694.04sВремя ответа (суммарно)…
Параметры
~200B всего (~20B активных)
27.3B
Доступность
Закрытая модель
Веса доступны
Генерация showcase моделей
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#102 Seed-2.0-Lite
medium
Стоимость
$0.005
Время
86.7s
Токены
2,354 tok
#101 Qwen3.8 27B
mediumОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Стоимость
~$0.002Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.0121 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.001193.
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
75.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)17.99sВремя ответа (макс.)48.33sВремя ответа (суммарно)71.98sТест считается полностью пройденным, только если все его прогоны успешны.…
17.99sВремя ответа (среднее)…
942Общее число входных токенов…
996Выходные токены…
7,142Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.93sВремя ответа (макс.)5.18sВремя ответа (суммарно)11.70sТест считается полностью пройденным, только если все его прогоны успешны.…
9.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)156.74sВремя ответа (макс.)254.92sВремя ответа (суммарно)470.22sТест считается полностью пройденным, только если все его прогоны успешны.…
156.74sВремя ответа (среднее)…
8,247Общее число входных токенов…
458Выходные токены…
31,890Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)40.50sВремя ответа (макс.)72.14sВремя ответа (суммарно)121.51sТест считается полностью пройденным, только если все его прогоны успешны.…
5.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)58.52sВремя ответа (макс.)79.36sВремя ответа (суммарно)117.04sТест считается полностью пройденным, только если все его прогоны успешны.…
58.52sВремя ответа (среднее)…
99,411Общее число входных токенов…
9,809Выходные токены…
13,940Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
8.7Средний балл по всем бенчмарк-тестам.…
6.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
83.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Недопустимый вызов инструмента: 1Время ответа (среднее)124.48sВремя ответа (макс.)214.63sВремя ответа (суммарно)248.96sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)9.07sВремя ответа (макс.)12.19sВремя ответа (суммарно)18.14sТест считается полностью пройденным, только если все его прогоны успешны.…
9.07sВремя ответа (среднее)…
8,562Общее число входных токенов…
246Выходные токены…
1,742Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
6.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)8.76sВремя ответа (макс.)10.36sВремя ответа (суммарно)17.53sТест считается полностью пройденным, только если все его прогоны успешны.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
22.2%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Время ответа (среднее)84.35sВремя ответа (макс.)168.71sВремя ответа (суммарно)253.05sТест считается полностью пройденным, только если все его прогоны успешны.…
84.35sВремя ответа (среднее)…
852Общее число входных токенов…
12Выходные токены…
24,616Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)76.98sВремя ответа (макс.)144.07sВремя ответа (суммарно)230.93sТест считается полностью пройденным, только если все его прогоны успешны.…
3.6Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)18.25sВремя ответа (макс.)18.25sВремя ответа (суммарно)18.25sТест считается полностью пройденным, только если все его прогоны успешны.…
18.25sВремя ответа (среднее)…
582Общее число входных токенов…
304Выходные токены…
1,620Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)9.20sВремя ответа (макс.)9.20sВремя ответа (суммарно)9.20sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)7.26sВремя ответа (макс.)9.02sВремя ответа (суммарно)14.52sТест считается полностью пройденным, только если все его прогоны успешны.…
7.26sВремя ответа (среднее)…
834Общее число входных токенов…
71Выходные токены…
1,480Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.54sВремя ответа (макс.)2.67sВремя ответа (суммарно)5.07sТест считается полностью пройденным, только если все его прогоны успешны.…
7.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
88.9%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)10.23sВремя ответа (макс.)11.54sВремя ответа (суммарно)30.68sТест считается полностью пройденным, только если все его прогоны успешны.…
10.23sВремя ответа (среднее)…
894Общее число входных токенов…
403Выходные токены…
3,285Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
8.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)12.62sВремя ответа (макс.)29.62sВремя ответа (суммарно)37.85sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)12.38sВремя ответа (макс.)12.38sВремя ответа (суммарно)12.38sТест считается полностью пройденным, только если все его прогоны успешны.…
12.38sВремя ответа (среднее)…
9,306Общее число входных токенов…
222Выходные токены…
1,011Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)0msВремя ответа (макс.)0msВремя ответа (суммарно)0msТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)48.32sВремя ответа (макс.)48.32sВремя ответа (суммарно)48.32sТест считается полностью пройденным, только если все его прогоны успешны.…
48.32sВремя ответа (среднее)…
276Общее число входных токенов…
9Выходные токены…
2,040Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)11.29sВремя ответа (макс.)11.29sВремя ответа (суммарно)11.29sТест считается полностью пройденным, только если все его прогоны успешны.…