GPT-5.6 Terra (medium) лидирует по среднему баллу: 7.8 vs 7.8. Qwen3.8 27B (medium) имеет более низкую стоимость benchmark: ~$0.058 vs $0.523. GPT-5.6 Terra (medium) быстрее: 6.85s vs 33.05s, с долей успешных попыток 69.7% vs 66.7%.
Бенчмарки сгенерированы из тестовых наборов AI BENCHY в:
2026-09-28
Сравниваемые модели
Ранг
#99
Общее число выходных токенов
30,349
Время ответа (среднее)
6.85s
Общая стоимость
$0.523
Ответы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Ранг
#101
Общее число выходных токенов
136,162
Время ответа (среднее)
33.05s
Общая стоимость
~$0.058Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Рекомендуемая модельQwen3.8 27B (medium)
Его балл близок к лучшему здесь (7.8 против 7.8), при этом он примерно в 9.1 раза дешевле, чем GPT-5.6 Terra (medium).
Qwen3.8 27BQwen3.8 27BmediumОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.Релиз: 2026-08-14
Оценка
7.8Средний балл по всем бенчмарк-тестам.…
7.8Средний балл по всем бенчмарк-тестам.…
Ранг
#99
#101
Надежность
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
9.6Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
9.3Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
9.7Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Попытки
66/66
66/66
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 8Время ответа (среднее)6.85sВремя ответа (макс.)41.68sВремя ответа (суммарно)150.65sТест считается полностью пройденным, только если все его прогоны успешны.…
69.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
66Всего запусков…
66Всего запусков…
Стоимость за результат
4.603
~0.409Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Общая стоимость
$0.523
~$0.058Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Цена входа
$2.000 / 1MЦена входа…
Н/ДЦена входа…
Цена выхода
$12.000 / 1MЦена выхода…
Н/ДЦена выхода…
Общее число входных токенов
79,184Общее число входных токенов…
98,266Общее число входных токенов…
Выходные токены
4,878Выходные токены…
1,861Выходные токены…
Токены рассуждений
25,471Токены рассуждений…
134,301Токены рассуждений…
Время ответа (среднее)
6.85sВремя ответа (среднее)…
33.05sВремя ответа (среднее)…
Время ответа (макс.)
41.68sВремя ответа (макс.)…
214.63sВремя ответа (макс.)…
Время ответа (суммарно)
150.65sВремя ответа (суммарно)…
694.04sВремя ответа (суммарно)…
Параметры
~1T всего (~60B активных)
27.3B
Доступность
Закрытая модель
Веса доступны
Генерация showcase моделей
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#99 GPT-5.6 Terra
medium
Стоимость
$0.035
Время
16.3s
Токены
2,418 tok
#101 Qwen3.8 27B
mediumОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
Стоимость
~$0.002Оценка учитывает только электроэнергию для GPU. Остальная часть компьютера и покупка оборудования не учитываются. NVIDIA GeForce RTX 3090: 0.0121 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.001193.
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
75.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)2.22sВремя ответа (макс.)3.03sВремя ответа (суммарно)8.87sТест считается полностью пройденным, только если все его прогоны успешны.…
2.22sВремя ответа (среднее)…
606Общее число входных токенов…
172Выходные токены…
657Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.93sВремя ответа (макс.)5.18sВремя ответа (суммарно)11.70sТест считается полностью пройденным, только если все его прогоны успешны.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
55.6%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)7.19sВремя ответа (макс.)9.73sВремя ответа (суммарно)21.57sТест считается полностью пройденным, только если все его прогоны успешны.…
7.19sВремя ответа (среднее)…
7,302Общее число входных токенов…
427Выходные токены…
4,527Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)40.50sВремя ответа (макс.)72.14sВремя ответа (суммарно)121.51sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)11.10sВремя ответа (макс.)15.93sВремя ответа (суммарно)22.19sТест считается полностью пройденным, только если все его прогоны успешны.…
11.10sВремя ответа (среднее)…
55,976Общее число входных токенов…
3,212Выходные токены…
2,122Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
8.7Средний балл по всем бенчмарк-тестам.…
6.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
83.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Недопустимый вызов инструмента: 1Время ответа (среднее)124.48sВремя ответа (макс.)214.63sВремя ответа (суммарно)248.96sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)872msВремя ответа (макс.)920msВремя ответа (суммарно)1.74sТест считается полностью пройденным, только если все его прогоны успешны.…
872msВремя ответа (среднее)…
7,140Общее число входных токенов…
222Выходные токены…
0Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
6.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)8.76sВремя ответа (макс.)10.36sВремя ответа (суммарно)17.53sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)21.52sВремя ответа (макс.)41.68sВремя ответа (суммарно)64.57sТест считается полностью пройденным, только если все его прогоны успешны.…
21.52sВремя ответа (среднее)…
732Общее число входных токенов…
70Выходные токены…
13,846Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)76.98sВремя ответа (макс.)144.07sВремя ответа (суммарно)230.93sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)2.37sВремя ответа (макс.)2.37sВремя ответа (суммарно)2.37sТест считается полностью пройденным, только если все его прогоны успешны.…
2.37sВремя ответа (среднее)…
477Общее число входных токенов…
133Выходные токены…
144Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
5.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)9.20sВремя ответа (макс.)9.20sВремя ответа (суммарно)9.20sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)1.43sВремя ответа (макс.)1.84sВремя ответа (суммарно)2.87sТест считается полностью пройденным, только если все его прогоны успешны.…
1.43sВремя ответа (среднее)…
660Общее число входных токенов…
89Выходные токены…
261Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.54sВремя ответа (макс.)2.67sВремя ответа (суммарно)5.07sТест считается полностью пройденным, только если все его прогоны успешны.…
7.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
88.9%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)3.78sВремя ответа (макс.)6.96sВремя ответа (суммарно)11.33sТест считается полностью пройденным, только если все его прогоны успешны.…
3.78sВремя ответа (среднее)…
642Общее число входных токенов…
272Выходные токены…
1,462Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
8.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)12.62sВремя ответа (макс.)29.62sВремя ответа (суммарно)37.85sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.09sВремя ответа (макс.)5.09sВремя ответа (суммарно)5.09sТест считается полностью пройденным, только если все его прогоны успешны.…
5.09sВремя ответа (среднее)…
5,454Общее число входных токенов…
254Выходные токены…
246Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)0msВремя ответа (макс.)0msВремя ответа (суммарно)0msТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)10.05sВремя ответа (макс.)10.05sВремя ответа (суммарно)10.05sТест считается полностью пройденным, только если все его прогоны успешны.…
10.05sВремя ответа (среднее)…
195Общее число входных токенов…
27Выходные токены…
2,206Токены рассуждений…
Qwen3.8 27BОтветы модели-кандидата созданы на локальном оборудовании. OpenRouter использовался только для оценки.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)11.29sВремя ответа (макс.)11.29sВремя ответа (суммарно)11.29sТест считается полностью пройденным, только если все его прогоны успешны.…