9.6Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
6.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Стоимость за результат
0.000Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
1.040Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
Общая стоимость
$0.000Общая стоимость…
$0.042Общая стоимость…
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 9Не соблюдены инструкции: 2Время ответа (среднее)3.15sВремя ответа (макс.)8.91sВремя ответа (суммарно)50.46sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 7Не соблюдены инструкции: 2Нет ответа: 2invalid tool call: 1Время ответа (среднее)36.84sВремя ответа (макс.)174.55sВремя ответа (суммарно)331.58sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
41.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
7Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
48Всего запусков…
48Всего запусков…
Выходные токены
1,837Выходные токены…
38,682Выходные токены…
Токены рассуждений
0Токены рассуждений…
64,952Токены рассуждений…
Время ответа (среднее)
3.15sВремя ответа (среднее)…
36.84sВремя ответа (среднее)…
Время ответа (макс.)
8.91sВремя ответа (макс.)…
174.55sВремя ответа (макс.)…
Время ответа (суммарно)
50.46sВремя ответа (суммарно)…
331.58sВремя ответа (суммарно)…
Лучшие модели по оценке
Оценка vs общая стоимость
Время ответа (среднее)
Средний балл vs Время ответа (среднее)
Разбивка по категориям
Анти-ИИ уловки
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Trinity Large Preview
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Время ответа (среднее)3.59sВремя ответа (макс.)8.17sВремя ответа (суммарно)10.78sТест считается полностью пройденным, только если все его прогоны успешны.…
3.59sВремя ответа (среднее)…
587Выходные токены…
0Токены рассуждений…
Z.ai: GLM 4.7 Flash
4.0Средний балл по всем бенчмарк-тестам.…
4.5Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
55.6%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)27.09sВремя ответа (макс.)27.09sВремя ответа (суммарно)27.09sТест считается полностью пройденным, только если все его прогоны успешны.…
27.09sВремя ответа (среднее)…
1,085Выходные токены…
5,597Токены рассуждений…
Комбинированный
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Trinity Large Preview
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)8.91sВремя ответа (макс.)8.91sВремя ответа (суммарно)8.91sТест считается полностью пройденным, только если все его прогоны успешны.…
8.91sВремя ответа (среднее)…
294Выходные токены…
0Токены рассуждений…
Z.ai: GLM 4.7 Flash
10.0Средний балл по всем бенчмарк-тестам.…
2.1Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.invalid tool call: 1Время ответа (среднее)65.57sВремя ответа (макс.)65.57sВремя ответа (суммарно)65.57sТест считается полностью пройденным, только если все его прогоны успешны.…
65.57sВремя ответа (среднее)…
2,585Выходные токены…
20,648Токены рассуждений…
Парсинг и извлечение данных
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Trinity Large Preview
9.9Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.26sВремя ответа (макс.)4.66sВремя ответа (суммарно)6.52sТест считается полностью пройденным, только если все его прогоны успешны.…
3.26sВремя ответа (среднее)…
186Выходные токены…
0Токены рассуждений…
Z.ai: GLM 4.7 Flash
5.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)1.51sВремя ответа (макс.)1.51sВремя ответа (суммарно)1.51sТест считается полностью пройденным, только если все его прогоны успешны.…
1.51sВремя ответа (среднее)…
584Выходные токены…
2,755Токены рассуждений…
Предметно-ориентированное
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Trinity Large Preview
4.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)877msВремя ответа (макс.)894msВремя ответа (суммарно)2.63sТест считается полностью пройденным, только если все его прогоны успешны.…
877msВремя ответа (среднее)…
25Выходные токены…
0Токены рассуждений…
Z.ai: GLM 4.7 Flash
10.0Средний балл по всем бенчмарк-тестам.…
4.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Нет ответа: 1Время ответа (среднее)174.55sВремя ответа (макс.)174.55sВремя ответа (суммарно)174.55sТест считается полностью пройденным, только если все его прогоны успешны.…
174.55sВремя ответа (среднее)…
33,000Выходные токены…
25,394Токены рассуждений…
Общий интеллект
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Trinity Large Preview
3.0Средний балл по всем бенчмарк-тестам.…
9.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)2.86sВремя ответа (макс.)2.86sВремя ответа (суммарно)2.86sТест считается полностью пройденным, только если все его прогоны успешны.…
2.86sВремя ответа (среднее)…
124Выходные токены…
0Токены рассуждений…
Z.ai: GLM 4.7 Flash
10.0Средний балл по всем бенчмарк-тестам.…
9.7Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)18.14sВремя ответа (макс.)18.14sВремя ответа (суммарно)18.14sТест считается полностью пройденным, только если все его прогоны успешны.…
18.14sВремя ответа (среднее)…
18Выходные токены…
2,138Токены рассуждений…
Следование инструкциям
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Trinity Large Preview
3.5Средний балл по всем бенчмарк-тестам.…
6.7Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
16.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)1.09sВремя ответа (макс.)1.23sВремя ответа (суммарно)2.19sТест считается полностью пройденным, только если все его прогоны успешны.…
1.09sВремя ответа (среднее)…
63Выходные токены…
0Токены рассуждений…
Z.ai: GLM 4.7 Flash
5.0Средний балл по всем бенчмарк-тестам.…
5.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)2.97sВремя ответа (макс.)2.97sВремя ответа (суммарно)2.97sТест считается полностью пройденным, только если все его прогоны успешны.…
2.97sВремя ответа (среднее)…
388Выходные токены…
2,181Токены рассуждений…
Puzzle Solving
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Trinity Large Preview
4.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)3.30sВремя ответа (макс.)4.81sВремя ответа (суммарно)9.91sТест считается полностью пройденным, только если все его прогоны успешны.…
3.30sВремя ответа (среднее)…
291Выходные токены…
0Токены рассуждений…
Z.ai: GLM 4.7 Flash
10.0Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
11.1%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Не соблюдены инструкции: 1Время ответа (среднее)12.90sВремя ответа (макс.)22.33sВремя ответа (суммарно)25.80sТест считается полностью пройденным, только если все его прогоны успешны.…
12.90sВремя ответа (среднее)…
798Выходные токены…
5,225Токены рассуждений…
Вызов инструментов
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Trinity Large Preview
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)6.67sВремя ответа (макс.)6.67sВремя ответа (суммарно)6.67sТест считается полностью пройденным, только если все его прогоны успешны.…
6.67sВремя ответа (среднее)…
267Выходные токены…
0Токены рассуждений…
Z.ai: GLM 4.7 Flash
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)15.95sВремя ответа (макс.)15.95sВремя ответа (суммарно)15.95sТест считается полностью пройденным, только если все его прогоны успешны.…