Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 8Не соблюдены инструкции: 1Время ответа (среднее)1.46sВремя ответа (макс.)2.89sВремя ответа (суммарно)21.86sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 8Не соблюдены инструкции: 1Время ответа (среднее)3.73sВремя ответа (макс.)13.73sВремя ответа (суммарно)55.90sТест считается полностью пройденным, только если все его прогоны успешны.…
Стабильность
8.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
9.5Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Стоимость за результат
1.496Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
0.088Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
Общая стоимость
$0.090Общая стоимость…
$0.006Общая стоимость…
Доля успешных попыток
44.4%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
42.2%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
common.totalRuns
45 (15 x 3)common.totalRuns…
45 (15 x 3)common.totalRuns…
Выходные токены
1,635Выходные токены…
3,674Выходные токены…
Токены рассуждений
0Токены рассуждений…
0Токены рассуждений…
Время ответа (среднее)
1.46sВремя ответа (среднее)…
3.73sВремя ответа (среднее)…
Время ответа (макс.)
2.89sВремя ответа (макс.)…
13.73sВремя ответа (макс.)…
Время ответа (суммарно)
21.86sВремя ответа (суммарно)…
55.90sВремя ответа (суммарно)…
Лучшие модели по оценке
Оценка vs общая стоимость
Время ответа (среднее)
Средний балл vs Время ответа (среднее)
Разбивка по категориям
Анти-ИИ уловки
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
OpenAI: GPT-5.4
10.0Средний балл по всем бенчмарк-тестам.…
7.3Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
11.1%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Время ответа (среднее)1.41sВремя ответа (макс.)2.58sВремя ответа (суммарно)4.23sТест считается полностью пройденным, только если все его прогоны успешны.…
1.41sВремя ответа (среднее)…
388Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-Flash
2.3Средний балл по всем бенчмарк-тестам.…
7.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
11.1%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Время ответа (среднее)1.62sВремя ответа (макс.)3.89sВремя ответа (суммарно)4.85sТест считается полностью пройденным, только если все его прогоны успешны.…
1.62sВремя ответа (среднее)…
687Выходные токены…
0Токены рассуждений…
Комбинированный
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
OpenAI: GPT-5.4
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)2.89sВремя ответа (макс.)2.89sВремя ответа (суммарно)2.89sТест считается полностью пройденным, только если все его прогоны успешны.…
2.89sВремя ответа (среднее)…
291Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-Flash
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)6.22sВремя ответа (макс.)6.22sВремя ответа (суммарно)6.22sТест считается полностью пройденным, только если все его прогоны успешны.…
6.22sВремя ответа (среднее)…
1,794Выходные токены…
0Токены рассуждений…
Парсинг и извлечение данных
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
OpenAI: GPT-5.4
9.9Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)1.04sВремя ответа (макс.)1.06sВремя ответа (суммарно)2.08sТест считается полностью пройденным, только если все его прогоны успешны.…
1.04sВремя ответа (среднее)…
222Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-Flash
9.9Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)1.57sВремя ответа (макс.)1.83sВремя ответа (суммарно)3.14sТест считается полностью пройденным, только если все его прогоны успешны.…
1.57sВремя ответа (среднее)…
243Выходные токены…
0Токены рассуждений…
Предметно-ориентированное
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
OpenAI: GPT-5.4
4.0Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
44.4%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)1.07sВремя ответа (макс.)1.54sВремя ответа (суммарно)3.22sТест считается полностью пройденным, только если все его прогоны успешны.…
1.07sВремя ответа (среднее)…
50Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-Flash
7.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)905msВремя ответа (макс.)1.10sВремя ответа (суммарно)2.71sТест считается полностью пройденным, только если все его прогоны успешны.…
905msВремя ответа (среднее)…
15Выходные токены…
0Токены рассуждений…
Следование инструкциям
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
OpenAI: GPT-5.4
5.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)1.07sВремя ответа (макс.)1.17sВремя ответа (суммарно)2.15sТест считается полностью пройденным, только если все его прогоны успешны.…
1.07sВремя ответа (среднее)…
81Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-Flash
5.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)8.81sВремя ответа (макс.)13.73sВремя ответа (суммарно)17.61sТест считается полностью пройденным, только если все его прогоны успешны.…
8.81sВремя ответа (среднее)…
63Выходные токены…
0Токены рассуждений…
Puzzle Solving
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
OpenAI: GPT-5.4
4.0Средний балл по всем бенчмарк-тестам.…
9.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)1.52sВремя ответа (макс.)1.82sВремя ответа (суммарно)4.56sТест считается полностью пройденным, только если все его прогоны успешны.…
1.52sВремя ответа (среднее)…
357Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-Flash
1.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Не соблюдены инструкции: 1Время ответа (среднее)5.90sВремя ответа (макс.)12.19sВремя ответа (суммарно)17.69sТест считается полностью пройденным, только если все его прогоны успешны.…
5.90sВремя ответа (среднее)…
608Выходные токены…
0Токены рассуждений…
Вызов инструментов
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Время ответа (среднее)
Выходные токены
Токены рассуждений
OpenAI: GPT-5.4
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.75sВремя ответа (макс.)2.75sВремя ответа (суммарно)2.75sТест считается полностью пройденным, только если все его прогоны успешны.…
2.75sВремя ответа (среднее)…
246Выходные токены…
0Токены рассуждений…
Qwen: Qwen3.5-Flash
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.67sВремя ответа (макс.)3.67sВремя ответа (суммарно)3.67sТест считается полностью пройденным, только если все его прогоны успешны.…