DeepSeek V4.1 Flash (low) лидирует по среднему баллу: 8.5 vs 8.4. DeepSeek V4.1 Flash (low) имеет более низкую стоимость benchmark: $0.224 vs ~$0.287. DeepSeek V4.1 Flash (low) быстрее: 26.77s vs 167.89s, с долей успешных попыток 74.2% vs 77.3%.
Бенчмарки сгенерированы из тестовых наборов AI BENCHY в:
2026-09-10
Сравниваемые модели
Ранг
#51
Общее число выходных токенов
347,963
Время ответа (среднее)
26.77s
Общая стоимость
$0.224
Ответы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Ранг
#59
Общее число выходных токенов
656,635
Время ответа (среднее)
167.89s
Общая стоимость
~$0.287Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
Рекомендуемая модельDeepSeek V4.1 Flash (low)
Здесь у него лучший балл (8.5), и он отвечает примерно в 6.3 раза быстрее, чем Qwen3.8 27B (high).
Qwen3.8 27BQwen3.8 27BhighОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14
Оценка
8.5Средний балл по всем бенчмарк-тестам.…
8.4Средний балл по всем бенчмарк-тестам.…
Ранг
#51
#59
Надежность
9.5Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
9.6Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
8.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
9.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Попытки
66/66
66/66
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 6Ошибка API: 1Время ответа (среднее)26.77sВремя ответа (макс.)149.84sВремя ответа (суммарно)589.01sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 2Нет ответа: 2Неверный ответ: 2Время ответа (среднее)167.89sВремя ответа (макс.)640.85sВремя ответа (суммарно)3693.54sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
74.2%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
77.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
3Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
66Всего запусков…
66Всего запусков…
Стоимость за результат
1.492
~1.792Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
Общая стоимость
$0.224
~$0.287Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 2.8999 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.286715.
Цена входа
$0.150 / 1MЦена входа…
Н/ДЦена входа…
Цена выхода
$0.600 / 1MЦена выхода…
Н/ДЦена выхода…
Общее число входных токенов
99,715Общее число входных токенов…
100,179Общее число входных токенов…
Выходные токены
6,381Выходные токены…
904Выходные токены…
Токены рассуждений
341,582Токены рассуждений…
655,731Токены рассуждений…
Время ответа (среднее)
26.77sВремя ответа (среднее)…
167.89sВремя ответа (среднее)…
Время ответа (макс.)
149.84sВремя ответа (макс.)…
640.85sВремя ответа (макс.)…
Время ответа (суммарно)
589.01sВремя ответа (суммарно)…
3693.54sВремя ответа (суммарно)…
Параметры
748B всего (16B активных)
27.3B
Доступность
Открытый исходный код
Веса доступны
Генерация showcase моделей
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#51 DeepSeek V4.1 Flash
low
Стоимость
$0.017
Время
43.6s
Токены
14,069 tok
#59 Qwen3.8 27B
highОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Стоимость
~$0.008Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.0750 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.007419.
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
75.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)3.32sВремя ответа (макс.)5.98sВремя ответа (суммарно)13.28sТест считается полностью пройденным, только если все его прогоны успешны.…
3.32sВремя ответа (среднее)…
852Общее число входных токенов…
171Выходные токены…
4,328Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)8.10sВремя ответа (макс.)21.48sВремя ответа (суммарно)32.40sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)40.66sВремя ответа (макс.)56.87sВремя ответа (суммарно)121.97sТест считается полностью пройденным, только если все его прогоны успешны.…
40.66sВремя ответа (среднее)…
7,509Общее число входных токенов…
378Выходные токены…
81,978Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
8.1Средний балл по всем бенчмарк-тестам.…
7.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
88.9%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)248.62sВремя ответа (макс.)458.25sВремя ответа (суммарно)745.85sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)24.73sВремя ответа (макс.)34.30sВремя ответа (суммарно)49.47sТест считается полностью пройденным, только если все его прогоны успешны.…
24.73sВремя ответа (среднее)…
77,368Общее число входных токенов…
4,906Выходные токены…
24,016Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)185.57sВремя ответа (макс.)333.21sВремя ответа (суммарно)371.15sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)3.80sВремя ответа (макс.)7.39sВремя ответа (суммарно)7.61sТест считается полностью пройденным, только если все его прогоны успешны.…
3.80sВремя ответа (среднее)…
2,397Общее число входных токенов…
120Выходные токены…
1,149Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)34.85sВремя ответа (макс.)57.71sВремя ответа (суммарно)69.71sТест считается полностью пройденным, только если все его прогоны успешны.…
4.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Время ответа (среднее)95.58sВремя ответа (макс.)149.84sВремя ответа (суммарно)286.75sТест считается полностью пройденным, только если все его прогоны успешны.…
95.58sВремя ответа (среднее)…
909Общее число входных токенов…
27Выходные токены…
184,701Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Неверный ответ: 1Время ответа (среднее)526.74sВремя ответа (макс.)640.85sВремя ответа (суммарно)1580.21sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.34sВремя ответа (макс.)4.34sВремя ответа (суммарно)4.34sТест считается полностью пройденным, только если все его прогоны успешны.…
4.34sВремя ответа (среднее)…
549Общее число входных токенов…
117Выходные токены…
1,319Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)8.45sВремя ответа (макс.)8.45sВремя ответа (суммарно)8.45sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)8.38sВремя ответа (макс.)14.30sВремя ответа (суммарно)16.75sТест считается полностью пройденным, только если все его прогоны успешны.…
8.38sВремя ответа (среднее)…
783Общее число входных токенов…
63Выходные токены…
1,546Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
9.8Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)8.24sВремя ответа (макс.)10.18sВремя ответа (суммарно)16.49sТест считается полностью пройденным, только если все его прогоны успешны.…
7.7Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
77.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)9.39sВремя ответа (макс.)20.40sВремя ответа (суммарно)28.16sТест считается полностью пройденным, только если все его прогоны успешны.…
9.39sВремя ответа (среднее)…
828Общее число входных токенов…
273Выходные токены…
14,502Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
7.6Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
77.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)199.90sВремя ответа (макс.)569.33sВремя ответа (суммарно)599.69sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)13.83sВремя ответа (макс.)13.83sВремя ответа (суммарно)13.83sТест считается полностью пройденным, только если все его прогоны успешны.…
13.83sВремя ответа (среднее)…
8,259Общее число входных токенов…
313Выходные токены…
284Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.62sВремя ответа (макс.)5.62sВремя ответа (суммарно)5.62sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)46.86sВремя ответа (макс.)46.86sВремя ответа (суммарно)46.86sТест считается полностью пройденным, только если все его прогоны успешны.…
46.86sВремя ответа (среднее)…
261Общее число входных токенов…
13Выходные токены…
27,759Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)263.98sВремя ответа (макс.)263.98sВремя ответа (суммарно)263.98sТест считается полностью пройденным, только если все его прогоны успешны.…