Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 4Не соблюдены инструкции: 2Время ответа (среднее)1.33sВремя ответа (макс.)3.39sВремя ответа (суммарно)21.34sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Тайм-аут: 3Ошибка API: 1Неверный ответ: 1Время ответа (среднее)70.90sВремя ответа (макс.)234.29sВремя ответа (суммарно)1134.43sТест считается полностью пройденным, только если все его прогоны успешны.…
Стабильность
9.6Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
7.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Стоимость за результат
0.143Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
0.552Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
Общая стоимость
$0.015Общая стоимость…
$0.061Общая стоимость…
Доля успешных попыток
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
83.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
4Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
common.totalRuns
46 (16 x 2.88)common.totalRuns…
46 (16 x 2.88)common.totalRuns…
Выходные токены
4,669Выходные токены…
1,736Выходные токены…
Токены рассуждений
0Токены рассуждений…
141,900Токены рассуждений…
Время ответа (среднее)
1.33sВремя ответа (среднее)…
70.90sВремя ответа (среднее)…
Время ответа (макс.)
3.39sВремя ответа (макс.)…
234.29sВремя ответа (макс.)…
Время ответа (суммарно)
21.34sВремя ответа (суммарно)…
1134.43sВремя ответа (суммарно)…
Лучшие модели по оценке
Оценка vs общая стоимость
Время ответа (среднее)
Средний балл vs Время ответа (среднее)
Разбивка по категориям
Анти-ИИ уловки
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
6.0Средний балл по всем бенчмарк-тестам.…
7.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
55.6%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)1.16sВремя ответа (макс.)1.47sВремя ответа (суммарно)3.49sТест считается полностью пройденным, только если все его прогоны успешны.…
1.16sВремя ответа (среднее)…
1,086Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-Flash
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)71.35sВремя ответа (макс.)168.31sВремя ответа (суммарно)214.06sТест считается полностью пройденным, только если все его прогоны успешны.…
71.35sВремя ответа (среднее)…
363Выходные токены…
23,645Токены рассуждений…
Комбинированный
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)3.20sВремя ответа (макс.)3.20sВремя ответа (суммарно)3.20sТест считается полностью пройденным, только если все его прогоны успешны.…
3.20sВремя ответа (среднее)…
339Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-Flash
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)17.78sВремя ответа (макс.)17.78sВремя ответа (суммарно)17.78sТест считается полностью пройденным, только если все его прогоны успешны.…
17.78sВремя ответа (среднее)…
483Выходные токены…
8,270Токены рассуждений…
Парсинг и извлечение данных
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
9.9Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)1.22sВремя ответа (макс.)1.33sВремя ответа (суммарно)2.44sТест считается полностью пройденным, только если все его прогоны успешны.…
1.22sВремя ответа (среднее)…
399Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-Flash
5.5Средний балл по всем бенчмарк-тестам.…
5.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
83.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)56.99sВремя ответа (макс.)80.14sВремя ответа (суммарно)113.98sТест считается полностью пройденным, только если все его прогоны успешны.…
56.99sВремя ответа (среднее)…
235Выходные токены…
16,237Токены рассуждений…
Предметно-ориентированное
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
4.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)942msВремя ответа (макс.)1.12sВремя ответа (суммарно)2.83sТест считается полностью пройденным, только если все его прогоны успешны.…
942msВремя ответа (среднее)…
568Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-Flash
4.0Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
44.4%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Тайм-аут: 1Неверный ответ: 1Время ответа (среднее)146.50sВремя ответа (макс.)234.29sВремя ответа (суммарно)439.49sТест считается полностью пройденным, только если все его прогоны успешны.…
146.50sВремя ответа (среднее)…
58Выходные токены…
43,615Токены рассуждений…
Общий интеллект
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)808msВремя ответа (макс.)808msВремя ответа (суммарно)808msТест считается полностью пройденным, только если все его прогоны успешны.…
808msВремя ответа (среднее)…
23Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-Flash
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)41.59sВремя ответа (макс.)41.59sВремя ответа (суммарно)41.59sТест считается полностью пройденным, только если все его прогоны успешны.…
41.59sВремя ответа (среднее)…
28Выходные токены…
10,434Токены рассуждений…
Следование инструкциям
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)1.13sВремя ответа (макс.)1.14sВремя ответа (суммарно)2.27sТест считается полностью пройденным, только если все его прогоны успешны.…
1.13sВремя ответа (среднее)…
574Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-Flash
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)63.49sВремя ответа (макс.)111.61sВремя ответа (суммарно)126.98sТест считается полностью пройденным, только если все его прогоны успешны.…
63.49sВремя ответа (среднее)…
98Выходные токены…
14,139Токены рассуждений…
Puzzle Solving
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)972msВремя ответа (макс.)1.13sВремя ответа (суммарно)2.92sТест считается полностью пройденным, только если все его прогоны успешны.…
972msВремя ответа (среднее)…
898Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-Flash
4.0Средний балл по всем бенчмарк-тестам.…
4.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
77.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Тайм-аут: 2Время ответа (среднее)56.74sВремя ответа (макс.)115.01sВремя ответа (суммарно)170.23sТест считается полностью пройденным, только если все его прогоны успешны.…
56.74sВремя ответа (среднее)…
162Выходные токены…
24,276Токены рассуждений…
Вызов инструментов
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.39sВремя ответа (макс.)3.39sВремя ответа (суммарно)3.39sТест считается полностью пройденным, только если все его прогоны успешны.…
3.39sВремя ответа (среднее)…
782Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-Flash
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)10.33sВремя ответа (макс.)10.33sВремя ответа (суммарно)10.33sТест считается полностью пройденным, только если все его прогоны успешны.…