9.1Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
8.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Стоимость за результат
0.000Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
0.933Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
Общая стоимость
$0.000Общая стоимость…
$0.103Общая стоимость…
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 3Неверный ответ: 3Время ответа (среднее)29.10sВремя ответа (макс.)170.45sВремя ответа (суммарно)290.96sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Не соблюдены инструкции: 1Нет ответа: 1Тайм-аут: 1Время ответа (среднее)16.16sВремя ответа (макс.)28.96sВремя ответа (суммарно)129.26sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
68.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
83.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
4Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
48 (16 x 3)Всего запусков…
48 (16 x 3)Всего запусков…
Выходные токены
71,452Выходные токены…
19,773Выходные токены…
Токены рассуждений
155,147Токены рассуждений…
36,459Токены рассуждений…
Время ответа (среднее)
29.10sВремя ответа (среднее)…
16.16sВремя ответа (среднее)…
Время ответа (макс.)
170.45sВремя ответа (макс.)…
28.96sВремя ответа (макс.)…
Время ответа (суммарно)
290.96sВремя ответа (суммарно)…
129.26sВремя ответа (суммарно)…
Лучшие модели по оценке
Оценка vs общая стоимость
Время ответа (среднее)
Средний балл vs Время ответа (среднее)
Разбивка по категориям
Анти-ИИ уловки
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
StepFun: Step 3.5 Flash
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)18.54sВремя ответа (макс.)32.30sВремя ответа (суммарно)37.07sТест считается полностью пройденным, только если все его прогоны успешны.…
18.54sВремя ответа (среднее)…
13,924Выходные токены…
17,208Токены рассуждений…
Z.ai: GLM 5
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)22.26sВремя ответа (макс.)22.26sВремя ответа (суммарно)22.26sТест считается полностью пройденным, только если все его прогоны успешны.…
22.26sВремя ответа (среднее)…
420Выходные токены…
4,992Токены рассуждений…
Комбинированный
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
StepFun: Step 3.5 Flash
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)29.57sВремя ответа (макс.)29.57sВремя ответа (суммарно)29.57sТест считается полностью пройденным, только если все его прогоны успешны.…
29.57sВремя ответа (среднее)…
1,176Выходные токены…
12,984Токены рассуждений…
Z.ai: GLM 5
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)28.96sВремя ответа (макс.)28.96sВремя ответа (суммарно)28.96sТест считается полностью пройденным, только если все его прогоны успешны.…
28.96sВремя ответа (среднее)…
662Выходные токены…
3,242Токены рассуждений…
Парсинг и извлечение данных
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
StepFun: Step 3.5 Flash
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)15.01sВремя ответа (макс.)15.01sВремя ответа (суммарно)15.01sТест считается полностью пройденным, только если все его прогоны успешны.…
15.01sВремя ответа (среднее)…
600Выходные токены…
13,886Токены рассуждений…
Z.ai: GLM 5
5.0Средний балл по всем бенчмарк-тестам.…
5.6Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
83.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)8.90sВремя ответа (макс.)8.90sВремя ответа (суммарно)8.90sТест считается полностью пройденным, только если все его прогоны успешны.…
8.90sВремя ответа (среднее)…
567Выходные токены…
3,734Токены рассуждений…
Предметно-ориентированное
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
StepFun: Step 3.5 Flash
4.0Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
44.4%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)170.45sВремя ответа (макс.)170.45sВремя ответа (суммарно)170.45sТест считается полностью пройденным, только если все его прогоны успешны.…
170.45sВремя ответа (среднее)…
45,350Выходные токены…
90,436Токены рассуждений…
Z.ai: GLM 5
10.0Средний балл по всем бенчмарк-тестам.…
4.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Тайм-аут: 1Время ответа (среднее)0msВремя ответа (макс.)0msВремя ответа (суммарно)0msТест считается полностью пройденным, только если все его прогоны успешны.…
0msВремя ответа (среднее)…
13,176Выходные токены…
14,137Токены рассуждений…
Общий интеллект
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
StepFun: Step 3.5 Flash
6.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)6.54sВремя ответа (макс.)6.54sВремя ответа (суммарно)6.54sТест считается полностью пройденным, только если все его прогоны успешны.…
6.54sВремя ответа (среднее)…
2,214Выходные токены…
2,584Токены рассуждений…
Z.ai: GLM 5
5.0Средний балл по всем бенчмарк-тестам.…
3.1Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)14.69sВремя ответа (макс.)14.69sВремя ответа (суммарно)14.69sТест считается полностью пройденным, только если все его прогоны успешны.…
14.69sВремя ответа (среднее)…
2,020Выходные токены…
2,248Токены рассуждений…
Следование инструкциям
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
StepFun: Step 3.5 Flash
9.0Средний балл по всем бенчмарк-тестам.…
6.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
83.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)4.98sВремя ответа (макс.)4.98sВремя ответа (суммарно)4.98sТест считается полностью пройденным, только если все его прогоны успешны.…
4.98sВремя ответа (среднее)…
2,284Выходные токены…
3,412Токены рассуждений…
Z.ai: GLM 5
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)7.25sВремя ответа (макс.)7.25sВремя ответа (суммарно)7.25sТест считается полностью пройденным, только если все его прогоны успешны.…
7.25sВремя ответа (среднее)…
1,001Выходные токены…
2,129Токены рассуждений…
Puzzle Solving
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
StepFun: Step 3.5 Flash
4.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)7.72sВремя ответа (макс.)10.60sВремя ответа (суммарно)15.44sТест считается полностью пройденным, только если все его прогоны успешны.…
7.72sВремя ответа (среднее)…
5,629Выходные токены…
10,835Токены рассуждений…
Z.ai: GLM 5
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)15.64sВремя ответа (макс.)16.34sВремя ответа (суммарно)31.27sТест считается полностью пройденным, только если все его прогоны успешны.…
15.64sВремя ответа (среднее)…
1,694Выходные токены…
4,983Токены рассуждений…
Вызов инструментов
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
StepFun: Step 3.5 Flash
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)11.91sВремя ответа (макс.)11.91sВремя ответа (суммарно)11.91sТест считается полностью пройденным, только если все его прогоны успешны.…
11.91sВремя ответа (среднее)…
275Выходные токены…
3,802Токены рассуждений…
Z.ai: GLM 5
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)15.93sВремя ответа (макс.)15.93sВремя ответа (суммарно)15.93sТест считается полностью пройденным, только если все его прогоны успешны.…