89Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
90Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
78Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Стоимость за результат
6.533Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
4.418Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
3.057Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
Общая стоимость
$0.784Общая стоимость…
$0.531Общая стоимость…
$0.306Общая стоимость…
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Не соблюдены инструкции: 1Время ответа (среднее)21.06sВремя ответа (макс.)100.41sВремя ответа (суммарно)315.95sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Не соблюдены инструкции: 1Время ответа (среднее)17.37sВремя ответа (макс.)100.93sВремя ответа (суммарно)260.52sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 2Нет ответа: 1Тайм-аут: 1Неверный ответ: 1Время ответа (среднее)16.71sВремя ответа (макс.)77.80sВремя ответа (суммарно)133.69sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
86.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
88.9%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
80.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
4Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Выходные токены
1,611Выходные токены…
1,577Выходные токены…
2,058Выходные токены…
Токены рассуждений
46,321Токены рассуждений…
33,017Токены рассуждений…
16,542Токены рассуждений…
Лучшие модели по оценке
Оценка vs общая стоимость
Разбивка по категориям
Анти-ИИ уловки
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Выходные токены
Токены рассуждений
OpenAI: GPT-5.4
100Средний балл по всем бенчмарк-тестам.…
100Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.02sВремя ответа (макс.)6.42sВремя ответа (суммарно)15.06sТест считается полностью пройденным, только если все его прогоны успешны.…
216Выходные токены…
1,466Токены рассуждений…
OpenAI: GPT-5.3-Codex
100Средний балл по всем бенчмарк-тестам.…
100Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.69sВремя ответа (макс.)6.68sВремя ответа (суммарно)14.06sТест считается полностью пройденным, только если все его прогоны успешны.…
216Выходные токены…
1,421Токены рассуждений…
OpenAI: GPT-5.2
70Средний балл по всем бенчмарк-тестам.…
73Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
77.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)14.34sВремя ответа (макс.)14.34sВремя ответа (суммарно)14.34sТест считается полностью пройденным, только если все его прогоны успешны.…
549Выходные токены…
2,002Токены рассуждений…
Комбинированный
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Выходные токены
Токены рассуждений
OpenAI: GPT-5.4
100Средний балл по всем бенчмарк-тестам.…
100Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)20.57sВремя ответа (макс.)20.57sВремя ответа (суммарно)20.57sТест считается полностью пройденным, только если все его прогоны успешны.…
301Выходные токены…
3,543Токены рассуждений…
OpenAI: GPT-5.3-Codex
100Средний балл по всем бенчмарк-тестам.…
100Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)19.56sВремя ответа (макс.)19.56sВремя ответа (суммарно)19.56sТест считается полностью пройденным, только если все его прогоны успешны.…
364Выходные токены…
2,731Токены рассуждений…
OpenAI: GPT-5.2
100Средний балл по всем бенчмарк-тестам.…
100Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)14.06sВремя ответа (макс.)14.06sВремя ответа (суммарно)14.06sТест считается полностью пройденным, только если все его прогоны успешны.…
291Выходные токены…
1,757Токены рассуждений…
Парсинг и извлечение данных
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Выходные токены
Токены рассуждений
OpenAI: GPT-5.4
99Средний балл по всем бенчмарк-тестам.…
100Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.32sВремя ответа (макс.)5.40sВремя ответа (суммарно)10.64sТест считается полностью пройденным, только если все его прогоны успешны.…
234Выходные токены…
804Токены рассуждений…
OpenAI: GPT-5.3-Codex
99Средний балл по всем бенчмарк-тестам.…
100Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.07sВремя ответа (макс.)3.59sВремя ответа (суммарно)6.15sТест считается полностью пройденным, только если все его прогоны успешны.…
234Выходные токены…
728Токены рассуждений…
OpenAI: GPT-5.2
99Средний балл по всем бенчмарк-тестам.…
100Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.15sВремя ответа (макс.)3.15sВремя ответа (суммарно)3.15sТест считается полностью пройденным, только если все его прогоны успешны.…
234Выходные токены…
420Токены рассуждений…
Предметно-ориентированное
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Выходные токены
Токены рассуждений
OpenAI: GPT-5.4
40Средний балл по всем бенчмарк-тестам.…
72Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
44.4%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)74.27sВремя ответа (макс.)100.41sВремя ответа (суммарно)222.80sТест считается полностью пройденным, только если все его прогоны успешны.…
61Выходные токены…
34,748Токены рассуждений…
OpenAI: GPT-5.3-Codex
40Средний балл по всем бенчмарк-тестам.…
72Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
55.6%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)64.31sВремя ответа (макс.)100.93sВремя ответа (суммарно)192.94sТест считается полностью пройденным, только если все его прогоны успешны.…
64Выходные токены…
25,308Токены рассуждений…
OpenAI: GPT-5.2
40Средний балл по всем бенчмарк-тестам.…
72Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
55.6%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Тайм-аут: 1Неверный ответ: 1Время ответа (среднее)77.80sВремя ответа (макс.)77.80sВремя ответа (суммарно)77.80sТест считается полностью пройденным, только если все его прогоны успешны.…
42Выходные токены…
10,342Токены рассуждений…
Следование инструкциям
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Выходные токены
Токены рассуждений
OpenAI: GPT-5.4
100Средний балл по всем бенчмарк-тестам.…
100Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.11sВремя ответа (макс.)3.68sВремя ответа (суммарно)6.22sТест считается полностью пройденным, только если все его прогоны успешны.…
93Выходные токены…
897Токены рассуждений…
OpenAI: GPT-5.3-Codex
100Средний балл по всем бенчмарк-тестам.…
100Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.04sВремя ответа (макс.)3.44sВремя ответа (суммарно)6.07sТест считается полностью пройденным, только если все его прогоны успешны.…
93Выходные токены…
693Токены рассуждений…
OpenAI: GPT-5.2
95Средний балл по всем бенчмарк-тестам.…
100Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.12sВремя ответа (макс.)3.12sВремя ответа (суммарно)3.12sТест считается полностью пройденным, только если все его прогоны успешны.…
94Выходные токены…
614Токены рассуждений…
Puzzle Solving
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Выходные токены
Токены рассуждений
OpenAI: GPT-5.4
70Средний балл по всем бенчмарк-тестам.…
72Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
88.9%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)9.13sВремя ответа (макс.)18.14sВремя ответа (суммарно)27.39sТест считается полностью пройденным, только если все его прогоны успешны.…
442Выходные токены…
3,832Токены рассуждений…
OpenAI: GPT-5.3-Codex
93Средний балл по всем бенчмарк-тестам.…
79Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
88.9%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)5.12sВремя ответа (макс.)8.73sВремя ответа (суммарно)15.37sТест считается полностью пройденным, только если все его прогоны успешны.…
352Выходные токены…
1,644Токены рассуждений…
OpenAI: GPT-5.2
70Средний балл по всем бенчмарк-тестам.…
73Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
77.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)5.47sВремя ответа (макс.)6.45sВремя ответа (суммарно)10.94sТест считается полностью пройденным, только если все его прогоны успешны.…
609Выходные токены…
938Токены рассуждений…
Вызов инструментов
Оценка
Стабильность
Доля успешных попыток
Нестабильные тесты
Тестов верно
Выходные токены
Токены рассуждений
OpenAI: GPT-5.4
100Средний балл по всем бенчмарк-тестам.…
100Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)13.28sВремя ответа (макс.)13.28sВремя ответа (суммарно)13.28sТест считается полностью пройденным, только если все его прогоны успешны.…
264Выходные токены…
1,031Токены рассуждений…
OpenAI: GPT-5.3-Codex
100Средний балл по всем бенчмарк-тестам.…
100Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)6.37sВремя ответа (макс.)6.37sВремя ответа (суммарно)6.37sТест считается полностью пройденным, только если все его прогоны успешны.…
254Выходные токены…
492Токены рассуждений…
OpenAI: GPT-5.2
100Средний балл по всем бенчмарк-тестам.…
16Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)10.30sВремя ответа (макс.)10.30sВремя ответа (суммарно)10.30sТест считается полностью пройденным, только если все его прогоны успешны.…