8.5Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
9.1Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Стоимость за результат
3.163Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
3.585Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
Общая стоимость
$0.317Общая стоимость…
$0.431Общая стоимость…
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 4Не соблюдены инструкции: 2Время ответа (среднее)5.96sВремя ответа (макс.)18.33sВремя ответа (суммарно)95.30sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 2Тайм-аут: 1Неверный ответ: 1Время ответа (среднее)52.13sВремя ответа (макс.)163.96sВремя ответа (суммарно)834.16sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
70.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
81.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
3Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
48 (16 x 3)Всего запусков…
48 (16 x 3)Всего запусков…
Выходные токены
19,272Выходные токены…
1,658Выходные токены…
Токены рассуждений
0Токены рассуждений…
200,786Токены рассуждений…
Время ответа (среднее)
5.96sВремя ответа (среднее)…
52.13sВремя ответа (среднее)…
Время ответа (макс.)
18.33sВремя ответа (макс.)…
163.96sВремя ответа (макс.)…
Время ответа (суммарно)
95.30sВремя ответа (суммарно)…
834.16sВремя ответа (суммарно)…
Лучшие модели по оценке
Оценка vs общая стоимость
Время ответа (среднее)
Средний балл vs Время ответа (среднее)
Разбивка по категориям
Анти-ИИ уловки
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
OpenAI: GPT-5.3 Chat
7.3Средний балл по всем бенчмарк-тестам.…
7.5Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
77.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)4.72sВремя ответа (макс.)7.35sВремя ответа (суммарно)14.17sТест считается полностью пройденным, только если все его прогоны успешны.…
4.72sВремя ответа (среднее)…
3,091Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-27B
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)9.69sВремя ответа (макс.)10.84sВремя ответа (суммарно)29.06sТест считается полностью пройденным, только если все его прогоны успешны.…
9.69sВремя ответа (среднее)…
102Выходные токены…
8,956Токены рассуждений…
Комбинированный
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
OpenAI: GPT-5.3 Chat
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)11.96sВремя ответа (макс.)11.96sВремя ответа (суммарно)11.96sТест считается полностью пройденным, только если все его прогоны успешны.…
11.96sВремя ответа (среднее)…
2,614Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-27B
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)163.96sВремя ответа (макс.)163.96sВремя ответа (суммарно)163.96sТест считается полностью пройденным, только если все его прогоны успешны.…
163.96sВремя ответа (среднее)…
483Выходные токены…
9,991Токены рассуждений…
Парсинг и извлечение данных
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
OpenAI: GPT-5.3 Chat
9.9Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.21sВремя ответа (макс.)2.52sВремя ответа (суммарно)4.42sТест считается полностью пройденным, только если все его прогоны успешны.…
2.21sВремя ответа (среднее)…
942Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-27B
9.9Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)30.26sВремя ответа (макс.)32.03sВремя ответа (суммарно)60.52sТест считается полностью пройденным, только если все его прогоны успешны.…
30.26sВремя ответа (среднее)…
270Выходные токены…
16,150Токены рассуждений…
Предметно-ориентированное
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
OpenAI: GPT-5.3 Chat
10.0Средний балл по всем бенчмарк-тестам.…
4.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Время ответа (среднее)13.01sВремя ответа (макс.)18.33sВремя ответа (суммарно)39.04sТест считается полностью пройденным, только если все его прогоны успешны.…
13.01sВремя ответа (среднее)…
8,264Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-27B
4.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Тайм-аут: 1Неверный ответ: 1Время ответа (среднее)79.53sВремя ответа (макс.)95.52sВремя ответа (суммарно)238.59sТест считается полностью пройденным, только если все его прогоны успешны.…
79.53sВремя ответа (среднее)…
43Выходные токены…
52,368Токены рассуждений…
Общий интеллект
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
OpenAI: GPT-5.3 Chat
4.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)1.99sВремя ответа (макс.)1.99sВремя ответа (суммарно)1.99sТест считается полностью пройденным, только если все его прогоны успешны.…
1.99sВремя ответа (среднее)…
319Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-27B
5.0Средний балл по всем бенчмарк-тестам.…
3.1Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)101.41sВремя ответа (макс.)101.41sВремя ответа (суммарно)101.41sТест считается полностью пройденным, только если все его прогоны успешны.…
101.41sВремя ответа (среднее)…
70Выходные токены…
23,147Токены рассуждений…
Следование инструкциям
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
OpenAI: GPT-5.3 Chat
9.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)3.29sВремя ответа (макс.)4.18sВремя ответа (суммарно)6.59sТест считается полностью пройденным, только если все его прогоны успешны.…
3.29sВремя ответа (среднее)…
1,455Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-27B
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)19.66sВремя ответа (макс.)32.25sВремя ответа (суммарно)39.32sТест считается полностью пройденным, только если все его прогоны успешны.…
19.66sВремя ответа (среднее)…
97Выходные токены…
11,638Токены рассуждений…
Puzzle Solving
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
OpenAI: GPT-5.3 Chat
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.93sВремя ответа (макс.)3.05sВремя ответа (суммарно)8.78sТест считается полностью пройденным, только если все его прогоны успешны.…
2.93sВремя ответа (среднее)…
1,726Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-27B
8.3Средний балл по всем бенчмарк-тестам.…
7.7Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
77.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)64.61sВремя ответа (макс.)123.57sВремя ответа (суммарно)193.84sТест считается полностью пройденным, только если все его прогоны успешны.…
64.61sВремя ответа (среднее)…
245Выходные токены…
77,213Токены рассуждений…
Вызов инструментов
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
OpenAI: GPT-5.3 Chat
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)8.36sВремя ответа (макс.)8.36sВремя ответа (суммарно)8.36sТест считается полностью пройденным, только если все его прогоны успешны.…
8.36sВремя ответа (среднее)…
861Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-27B
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)7.45sВремя ответа (макс.)7.45sВремя ответа (суммарно)7.45sТест считается полностью пройденным, только если все его прогоны успешны.…