Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 4Время ответа (среднее)3.49sВремя ответа (макс.)11.91sВремя ответа (суммарно)52.29sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 2Неверный ответ: 2Нет ответа: 1Тайм-аут: 1Время ответа (среднее)27.61sВремя ответа (макс.)121.79sВремя ответа (суммарно)220.87sТест считается полностью пройденным, только если все его прогоны успешны.…
Стабильность
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
7.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Стоимость за результат
0.170Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
0.541Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
Общая стоимость
$0.019Общая стоимость…
$0.049Общая стоимость…
Доля успешных попыток
73.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
71.1%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
4Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
common.totalRuns
45 (15 x 3)common.totalRuns…
45 (15 x 3)common.totalRuns…
Выходные токены
1,542Выходные токены…
1,056Выходные токены…
Токены рассуждений
6,888Токены рассуждений…
80,419Токены рассуждений…
Время ответа (среднее)
3.49sВремя ответа (среднее)…
27.61sВремя ответа (среднее)…
Время ответа (макс.)
11.91sВремя ответа (макс.)…
121.79sВремя ответа (макс.)…
Время ответа (суммарно)
52.29sВремя ответа (суммарно)…
220.87sВремя ответа (суммарно)…
Лучшие модели по оценке
Оценка vs общая стоимость
Время ответа (среднее)
Средний балл vs Время ответа (среднее)
Разбивка по категориям
Анти-ИИ уловки
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
7.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)2.18sВремя ответа (макс.)3.18sВремя ответа (суммарно)6.53sТест считается полностью пройденным, только если все его прогоны успешны.…
2.18sВремя ответа (среднее)…
456Выходные токены…
1,224Токены рассуждений…
xAI: Grok 4.1 Fast
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.65sВремя ответа (макс.)5.65sВремя ответа (суммарно)5.65sТест считается полностью пройденным, только если все его прогоны успешны.…
5.65sВремя ответа (среднее)…
102Выходные токены…
4,021Токены рассуждений…
Комбинированный
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)11.91sВремя ответа (макс.)11.91sВремя ответа (суммарно)11.91sТест считается полностью пройденным, только если все его прогоны успешны.…
11.91sВремя ответа (среднее)…
225Выходные токены…
762Токены рассуждений…
xAI: Grok 4.1 Fast
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)37.64sВремя ответа (макс.)37.64sВремя ответа (суммарно)37.64sТест считается полностью пройденным, только если все его прогоны успешны.…
37.64sВремя ответа (среднее)…
261Выходные токены…
12,272Токены рассуждений…
Парсинг и извлечение данных
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
9.9Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.00sВремя ответа (макс.)3.74sВремя ответа (суммарно)5.99sТест считается полностью пройденным, только если все его прогоны успешны.…
3.00sВремя ответа (среднее)…
291Выходные токены…
696Токены рассуждений…
xAI: Grok 4.1 Fast
9.9Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)6.63sВремя ответа (макс.)6.63sВремя ответа (суммарно)6.63sТест считается полностью пройденным, только если все его прогоны успешны.…
6.63sВремя ответа (среднее)…
180Выходные токены…
5,409Токены рассуждений…
Предметно-ориентированное
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
4.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)2.36sВремя ответа (макс.)3.51sВремя ответа (суммарно)7.07sТест считается полностью пройденным, только если все его прогоны успешны.…
2.36sВремя ответа (среднее)…
18Выходные токены…
1,212Токены рассуждений…
xAI: Grok 4.1 Fast
4.0Средний балл по всем бенчмарк-тестам.…
4.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Тайм-аут: 1Неверный ответ: 1Время ответа (среднее)121.79sВремя ответа (макс.)121.79sВремя ответа (суммарно)121.79sТест считается полностью пройденным, только если все его прогоны успешны.…
121.79sВремя ответа (среднее)…
11Выходные токены…
37,657Токены рассуждений…
Следование инструкциям
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)1.49sВремя ответа (макс.)1.66sВремя ответа (суммарно)2.99sТест считается полностью пройденным, только если все его прогоны успешны.…
1.49sВремя ответа (среднее)…
72Выходные токены…
753Токены рассуждений…
xAI: Grok 4.1 Fast
5.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)5.30sВремя ответа (макс.)5.30sВремя ответа (суммарно)5.30sТест считается полностью пройденным, только если все его прогоны успешны.…
5.30sВремя ответа (среднее)…
55Выходные токены…
3,489Токены рассуждений…
Puzzle Solving
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.76sВремя ответа (макс.)5.08sВремя ответа (суммарно)8.27sТест считается полностью пройденным, только если все его прогоны успешны.…
2.76sВремя ответа (среднее)…
243Выходные токены…
1,248Токены рассуждений…
xAI: Grok 4.1 Fast
4.0Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
44.4%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)8.08sВремя ответа (макс.)8.38sВремя ответа (суммарно)16.17sТест считается полностью пройденным, только если все его прогоны успешны.…
8.08sВремя ответа (среднее)…
187Выходные токены…
6,086Токены рассуждений…
Вызов инструментов
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)9.54sВремя ответа (макс.)9.54sВремя ответа (суммарно)9.54sТест считается полностью пройденным, только если все его прогоны успешны.…
9.54sВремя ответа (среднее)…
237Выходные токены…
993Токены рассуждений…
xAI: Grok 4.1 Fast
10.0Средний балл по всем бенчмарк-тестам.…
1.6Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)27.71sВремя ответа (макс.)27.71sВремя ответа (суммарно)27.71sТест считается полностью пройденным, только если все его прогоны успешны.…