Бенчмарк-сравнение Gemma 4 31B (medium) vs Gemini 3 PRO Preview (medium) vs GLM 5 Turbo (medium):GLM 5 Turbo (medium) лидирует по Оценка со значением 7.6. Gemma 4 31B (medium) лидирует по Надежность со значением 10.0. У Gemma 4 31B (medium) самый низкий Общая стоимость: $0.100. Gemini 3 PRO Preview (medium) самый быстрый: 9.05s.
Бенчмарки сгенерированы из тестовых наборов AI BENCHY в:
2026-08-20
Ранг
#166
Общее число выходных токенов
267,421
Время ответа (среднее)
78.59s
Общая стоимость
$0.100
Ранг
#185
Общее число выходных токенов
11,592
Время ответа (среднее)
9.05s
Общая стоимость
$0.385
Ранг
#77
Общее число выходных токенов
74,522
Время ответа (среднее)
23.00s
Общая стоимость
$0.323
Рекомендуемая модельGLM 5 Turbo (medium)
Здесь у него лучший балл (7.6), и он отвечает примерно в 1.9 раза быстрее, чем другие модели в этом сравнении.
GLM 5 TurboGLM 5 TurbomediumАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.Релиз: 2026-03-15
Оценка
6.2Средний балл по всем бенчмарк-тестам.…
6.0Средний балл по всем бенчмарк-тестам.…
7.6Средний балл по всем бенчмарк-тестам.…
Ранг
#166
#185
#77
Надежность
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Н/ДОценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
8.7Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
9.5Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
8.1Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 4Неверный ответ: 3Время ответа (среднее)9.05sВремя ответа (макс.)26.24sВремя ответа (суммарно)90.53sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 4Не соблюдены инструкции: 1Нет ответа: 1Тайм-аут: 1Время ответа (среднее)23.00sВремя ответа (макс.)194.23sВремя ответа (суммарно)482.97sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
65.2%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
63.6%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
71.2%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
3Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
4Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
66Всего запусков…
63Всего запусков…
63Всего запусков…
Стоимость за результат
1.152
1.406
2.011
Общая стоимость
$0.100
$0.385
$0.323
Цена входа
$0.090 / 1MЦена входа…
$9.506 / 1MЦена входа…
$1.200 / 1MЦена входа…
Цена выхода
$0.340 / 1MЦена выхода…
$9.506 / 1MЦена выхода…
$4.000 / 1MЦена выхода…
Общее число входных токенов
94,969Общее число входных токенов…
28,848Общее число входных токенов…
35,593Общее число входных токенов…
Выходные токены
34,399Выходные токены…
1,490Выходные токены…
12,245Выходные токены…
Токены рассуждений
233,022Токены рассуждений…
10,102Токены рассуждений…
62,277Токены рассуждений…
Время ответа (среднее)
78.59sВремя ответа (среднее)…
9.05sВремя ответа (среднее)…
23.00sВремя ответа (среднее)…
Время ответа (макс.)
437.40sВремя ответа (макс.)…
26.24sВремя ответа (макс.)…
194.23sВремя ответа (макс.)…
Время ответа (суммарно)
1571.84sВремя ответа (суммарно)…
90.53sВремя ответа (суммарно)…
482.97sВремя ответа (суммарно)…
Параметры
30.7B
~1.2T всего (~20B активных)
744B всего (40B активных)
Доступность
Открытый исходный код
Закрытая модель
Закрытая модель
Генерация showcase моделей
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#166 Gemma 4 31B
medium
Стоимость
$0.002
Время
45.7s
Токены
2,696 tok
#185 Gemini 3 PRO Preview
medium
No endpoints found for google/gemini-3-pro-preview.
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)12.89sВремя ответа (макс.)26.66sВремя ответа (суммарно)51.55sТест считается полностью пройденным, только если все его прогоны успешны.…
12.89sВремя ответа (среднее)…
816Общее число входных токенов…
962Выходные токены…
2,046Токены рассуждений…
Gemini 3 PRO PreviewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)14.99sВремя ответа (макс.)26.24sВремя ответа (суммарно)29.99sТест считается полностью пройденным, только если все его прогоны успешны.…
14.99sВремя ответа (среднее)…
500Общее число входных токенов…
149Выходные токены…
1,485Токены рассуждений…
GLM 5 TurboАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.82sВремя ответа (макс.)7.69sВремя ответа (суммарно)19.26sТест считается полностью пройденным, только если все его прогоны успешны.…
5.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
22.2%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Тайм-аут: 2Нет ответа: 1Время ответа (среднее)219.76sВремя ответа (макс.)437.40sВремя ответа (суммарно)659.27sТест считается полностью пройденным, только если все его прогоны успешны.…
219.76sВремя ответа (среднее)…
5,568Общее число входных токенов…
11,098Выходные токены…
33,212Токены рассуждений…
Gemini 3 PRO PreviewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 3Время ответа (среднее)0msВремя ответа (макс.)0msВремя ответа (суммарно)0msТест считается полностью пройденным, только если все его прогоны успешны.…
0msВремя ответа (среднее)…
0Общее число входных токенов…
0Выходные токены…
0Токены рассуждений…
GLM 5 TurboАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
8.2Средний балл по всем бенчмарк-тестам.…
9.3Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)45.90sВремя ответа (макс.)95.57sВремя ответа (суммарно)137.71sТест считается полностью пройденным, только если все его прогоны успешны.…
5.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
16.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Недопустимый вызов инструмента: 1Время ответа (среднее)433.11sВремя ответа (макс.)433.11sВремя ответа (суммарно)433.11sТест считается полностью пройденным, только если все его прогоны успешны.…
433.11sВремя ответа (среднее)…
77,035Общее число входных токенов…
12,112Выходные токены…
157,552Токены рассуждений…
Gemini 3 PRO PreviewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
1.5Средний балл по всем бенчмарк-тестам.…
5.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)10.37sВремя ответа (макс.)10.37sВремя ответа (суммарно)10.37sТест считается полностью пройденным, только если все его прогоны успешны.…
10.37sВремя ответа (среднее)…
13,211Общее число входных токенов…
351Выходные токены…
952Токены рассуждений…
GLM 5 TurboАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
5.0Средний балл по всем бенчмарк-тестам.…
5.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)13.88sВремя ответа (макс.)13.88sВремя ответа (суммарно)13.88sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)21.11sВремя ответа (макс.)21.94sВремя ответа (суммарно)42.21sТест считается полностью пройденным, только если все его прогоны успешны.…
21.11sВремя ответа (среднее)…
8,334Общее число входных токенов…
1,822Выходные токены…
2,951Токены рассуждений…
Gemini 3 PRO PreviewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)10.84sВремя ответа (макс.)10.84sВремя ответа (суммарно)10.84sТест считается полностью пройденным, только если все его прогоны успешны.…
10.84sВремя ответа (среднее)…
7,259Общее число входных токенов…
279Выходные токены…
3,156Токены рассуждений…
GLM 5 TurboАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)6.19sВремя ответа (макс.)6.42sВремя ответа (суммарно)12.38sТест считается полностью пройденным, только если все его прогоны успешны.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
44.4%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)59.92sВремя ответа (макс.)77.78sВремя ответа (суммарно)179.75sТест считается полностью пройденным, только если все его прогоны успешны.…
59.92sВремя ответа (среднее)…
853Общее число входных токенов…
4,280Выходные токены…
18,729Токены рассуждений…
Gemini 3 PRO PreviewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
5.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)7.01sВремя ответа (макс.)7.01sВремя ответа (суммарно)7.01sТест считается полностью пройденным, только если все его прогоны успешны.…
7.01sВремя ответа (среднее)…
643Общее число входных токенов…
15Выходные токены…
1,195Токены рассуждений…
GLM 5 TurboАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
2.9Средний балл по всем бенчмарк-тестам.…
4.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
22.2%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Тайм-аут: 1Время ответа (среднее)71.07sВремя ответа (макс.)194.23sВремя ответа (суммарно)213.22sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)9.57sВремя ответа (макс.)9.57sВремя ответа (суммарно)9.57sТест считается полностью пройденным, только если все его прогоны успешны.…
9.57sВремя ответа (среднее)…
567Общее число входных токенов…
105Выходные токены…
888Токены рассуждений…
Gemini 3 PRO PreviewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)9.34sВремя ответа (макс.)9.34sВремя ответа (суммарно)9.34sТест считается полностью пройденным, только если все его прогоны успешны.…
9.34sВремя ответа (среднее)…
486Общее число входных токенов…
78Выходные токены…
374Токены рассуждений…
GLM 5 TurboАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
6.1Средний балл по всем бенчмарк-тестам.…
3.1Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)10.05sВремя ответа (макс.)10.05sВремя ответа (суммарно)10.05sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)12.76sВремя ответа (макс.)17.53sВремя ответа (суммарно)25.52sТест считается полностью пройденным, только если все его прогоны успешны.…
12.76sВремя ответа (среднее)…
777Общее число входных токенов…
533Выходные токены…
2,035Токены рассуждений…
Gemini 3 PRO PreviewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
9.8Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.26sВремя ответа (макс.)3.26sВремя ответа (суммарно)3.26sТест считается полностью пройденным, только если все его прогоны успешны.…
3.26sВремя ответа (среднее)…
623Общее число входных токенов…
69Выходные токены…
754Токены рассуждений…
GLM 5 TurboАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.38sВремя ответа (макс.)5.70sВремя ответа (суммарно)10.77sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)26.91sВремя ответа (макс.)61.08sВремя ответа (суммарно)80.72sТест считается полностью пройденным, только если все его прогоны успешны.…
26.91sВремя ответа (среднее)…
801Общее число входных токенов…
1,795Выходные токены…
5,595Токены рассуждений…
Gemini 3 PRO PreviewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.88sВремя ответа (макс.)4.23sВремя ответа (суммарно)7.77sТест считается полностью пройденным, только если все его прогоны успешны.…
3.88sВремя ответа (среднее)…
570Общее число входных токенов…
225Выходные токены…
1,215Токены рассуждений…
GLM 5 TurboАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
8.7Средний балл по всем бенчмарк-тестам.…
7.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
77.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)5.23sВремя ответа (макс.)7.26sВремя ответа (суммарно)15.69sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)0msВремя ответа (макс.)0msВремя ответа (суммарно)0msТест считается полностью пройденным, только если все его прогоны успешны.…
0msВремя ответа (среднее)…
0Общее число входных токенов…
0Выходные токены…
0Токены рассуждений…
Gemini 3 PRO PreviewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)11.96sВремя ответа (макс.)11.96sВремя ответа (суммарно)11.96sТест считается полностью пройденным, только если все его прогоны успешны.…
11.96sВремя ответа (среднее)…
5,556Общее число входных токенов…
324Выходные токены…
971Токены рассуждений…
GLM 5 TurboАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)9.84sВремя ответа (макс.)9.84sВремя ответа (суммарно)9.84sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)90.14sВремя ответа (макс.)90.14sВремя ответа (суммарно)90.14sТест считается полностью пройденным, только если все его прогоны успешны.…
90.14sВремя ответа (среднее)…
218Общее число входных токенов…
1,692Выходные токены…
10,014Токены рассуждений…
Gemini 3 PRO PreviewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)0msВремя ответа (макс.)0msВремя ответа (суммарно)0msТест считается полностью пройденным, только если все его прогоны успешны.…
0msВремя ответа (среднее)…
0Общее число входных токенов…
0Выходные токены…
0Токены рассуждений…
GLM 5 TurboАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)40.17sВремя ответа (макс.)40.17sВремя ответа (суммарно)40.17sТест считается полностью пройденным, только если все его прогоны успешны.…