9.6Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
7.5Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Стоимость за результат
19.243Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
0.720Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
Общая стоимость
$2.310Общая стоимость…
$0.072Общая стоимость…
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Не соблюдены инструкции: 1Время ответа (среднее)68.83sВремя ответа (макс.)280.52sВремя ответа (суммарно)1101.32sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Тайм-аут: 3Ошибка API: 1Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)70.81sВремя ответа (макс.)234.29sВремя ответа (суммарно)1132.90sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
77.1%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
81.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
5Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
common.totalRuns
48 (16 x 3)common.totalRuns…
48 (16 x 3)common.totalRuns…
Выходные токены
1,283Выходные токены…
1,807Выходные токены…
Токены рассуждений
1,533,310Токены рассуждений…
169,952Токены рассуждений…
Время ответа (среднее)
68.83sВремя ответа (среднее)…
70.81sВремя ответа (среднее)…
Время ответа (макс.)
280.52sВремя ответа (макс.)…
234.29sВремя ответа (макс.)…
Время ответа (суммарно)
1101.32sВремя ответа (суммарно)…
1132.90sВремя ответа (суммарно)…
Лучшие модели по оценке
Оценка vs общая стоимость
Время ответа (среднее)
Средний балл vs Время ответа (среднее)
Разбивка по категориям
Анти-ИИ уловки
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)43.87sВремя ответа (макс.)121.88sВремя ответа (суммарно)131.62sТест считается полностью пройденным, только если все его прогоны успешны.…
43.87sВремя ответа (среднее)…
144Выходные токены…
193,077Токены рассуждений…
Qwen: Qwen3.5-Flash
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)71.35sВремя ответа (макс.)168.31sВремя ответа (суммарно)214.06sТест считается полностью пройденным, только если все его прогоны успешны.…
71.35sВремя ответа (среднее)…
363Выходные токены…
23,645Токены рассуждений…
Комбинированный
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)280.52sВремя ответа (макс.)280.52sВремя ответа (суммарно)280.52sТест считается полностью пройденным, только если все его прогоны успешны.…
280.52sВремя ответа (среднее)…
335Выходные токены…
380,440Токены рассуждений…
Qwen: Qwen3.5-Flash
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)17.78sВремя ответа (макс.)17.78sВремя ответа (суммарно)17.78sТест считается полностью пройденным, только если все его прогоны успешны.…
17.78sВремя ответа (среднее)…
483Выходные токены…
8,270Токены рассуждений…
Парсинг и извлечение данных
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
9.9Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)7.16sВремя ответа (макс.)8.54sВремя ответа (суммарно)14.31sТест считается полностью пройденным, только если все его прогоны успешны.…
7.16sВремя ответа (среднее)…
279Выходные токены…
6,186Токены рассуждений…
Qwen: Qwen3.5-Flash
5.5Средний балл по всем бенчмарк-тестам.…
5.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
83.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)56.99sВремя ответа (макс.)80.14sВремя ответа (суммарно)113.98sТест считается полностью пройденным, только если все его прогоны успешны.…
56.99sВремя ответа (среднее)…
235Выходные токены…
16,237Токены рассуждений…
Предметно-ориентированное
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
4.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)127.58sВремя ответа (макс.)133.93sВремя ответа (суммарно)382.74sТест считается полностью пройденным, только если все его прогоны успешны.…
127.58sВремя ответа (среднее)…
18Выходные токены…
566,202Токены рассуждений…
Qwen: Qwen3.5-Flash
4.0Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
44.4%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Тайм-аут: 1Неверный ответ: 1Время ответа (среднее)146.50sВремя ответа (макс.)234.29sВремя ответа (суммарно)439.49sТест считается полностью пройденным, только если все его прогоны успешны.…
146.50sВремя ответа (среднее)…
58Выходные токены…
43,615Токены рассуждений…
Общий интеллект
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.25sВремя ответа (макс.)5.25sВремя ответа (суммарно)5.25sТест считается полностью пройденным, только если все его прогоны успешны.…
5.25sВремя ответа (среднее)…
117Выходные токены…
3,915Токены рассуждений…
Qwen: Qwen3.5-Flash
5.0Средний балл по всем бенчмарк-тестам.…
3.1Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)40.05sВремя ответа (макс.)40.05sВремя ответа (суммарно)40.05sТест считается полностью пройденным, только если все его прогоны успешны.…
40.05sВремя ответа (среднее)…
99Выходные токены…
38,486Токены рассуждений…
Следование инструкциям
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
9.0Средний балл по всем бенчмарк-тестам.…
6.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)70.07sВремя ответа (макс.)136.53sВремя ответа (суммарно)140.14sТест считается полностью пройденным, только если все его прогоны успешны.…
70.07sВремя ответа (среднее)…
69Выходные токены…
190,053Токены рассуждений…
Qwen: Qwen3.5-Flash
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)63.49sВремя ответа (макс.)111.61sВремя ответа (суммарно)126.98sТест считается полностью пройденным, только если все его прогоны успешны.…
63.49sВремя ответа (среднее)…
98Выходные токены…
14,139Токены рассуждений…
Puzzle Solving
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
7.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)46.33sВремя ответа (макс.)134.22sВремя ответа (суммарно)139.00sТест считается полностью пройденным, только если все его прогоны успешны.…
46.33sВремя ответа (среднее)…
87Выходные токены…
190,953Токены рассуждений…
Qwen: Qwen3.5-Flash
4.0Средний балл по всем бенчмарк-тестам.…
4.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
77.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Тайм-аут: 2Время ответа (среднее)56.74sВремя ответа (макс.)115.01sВремя ответа (суммарно)170.23sТест считается полностью пройденным, только если все его прогоны успешны.…
56.74sВремя ответа (среднее)…
162Выходные токены…
24,276Токены рассуждений…
Вызов инструментов
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)7.73sВремя ответа (макс.)7.73sВремя ответа (суммарно)7.73sТест считается полностью пройденным, только если все его прогоны успешны.…
7.73sВремя ответа (среднее)…
234Выходные токены…
2,484Токены рассуждений…
Qwen: Qwen3.5-Flash
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)10.33sВремя ответа (макс.)10.33sВремя ответа (суммарно)10.33sТест считается полностью пройденным, только если все его прогоны успешны.…