Hy3 previewHy3 previewhighАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.Релиз: 2026-04-22
Оценка
5.6Средний балл по всем бенчмарк-тестам.…
8.0Средний балл по всем бенчмарк-тестам.…
Ранг
#114
#22
Надежность
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
8.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
9.5Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Ошибка API: 1Время ответа (среднее)56.77sВремя ответа (макс.)149.94sВремя ответа (суммарно)851.49sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
46.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
77.1%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
5Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
60Всего запусков…
60Всего запусков…
Стоимость за результат
0.254Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
0.000Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
8.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
12.5%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Лишнее форматирование: 2Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)9.35sВремя ответа (макс.)16.77sВремя ответа (суммарно)37.40sТест считается полностью пройденным, только если все его прогоны успешны.…
9.35sВремя ответа (среднее)…
1,073Выходные токены…
0Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
8.9Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)15.12sВремя ответа (макс.)19.99sВремя ответа (суммарно)45.37sТест считается полностью пройденным, только если все его прогоны успешны.…
5.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
16.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)20.87sВремя ответа (макс.)34.11sВремя ответа (суммарно)41.73sТест считается полностью пройденным, только если все его прогоны успешны.…
20.87sВремя ответа (среднее)…
4,522Выходные токены…
0Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)99.76sВремя ответа (макс.)99.76sВремя ответа (суммарно)99.76sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Недопустимый вызов инструмента: 1Время ответа (среднее)115.89sВремя ответа (макс.)115.89sВремя ответа (суммарно)115.89sТест считается полностью пройденным, только если все его прогоны успешны.…
115.89sВремя ответа (среднее)…
2,887Выходные токены…
0Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)113.09sВремя ответа (макс.)113.09sВремя ответа (суммарно)113.09sТест считается полностью пройденным, только если все его прогоны успешны.…
5.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)9.42sВремя ответа (макс.)16.20sВремя ответа (суммарно)18.84sТест считается полностью пройденным, только если все его прогоны успешны.…
9.42sВремя ответа (среднее)…
1,710Выходные токены…
0Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
6.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)12.11sВремя ответа (макс.)12.11sВремя ответа (суммарно)12.11sТест считается полностью пройденным, только если все его прогоны успешны.…
6.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
16.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Время ответа (среднее)4.17sВремя ответа (макс.)9.09sВремя ответа (суммарно)12.51sТест считается полностью пройденным, только если все его прогоны успешны.…
4.17sВремя ответа (среднее)…
21Выходные токены…
0Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
5.3Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
44.4%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)109.04sВремя ответа (макс.)149.94sВремя ответа (суммарно)327.11sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)9.32sВремя ответа (макс.)9.32sВремя ответа (суммарно)9.32sТест считается полностью пройденным, только если все его прогоны успешны.…
9.32sВремя ответа (среднее)…
43Выходные токены…
0Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
0.0Средний балл по всем бенчмарк-тестам.…
0.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)0msВремя ответа (макс.)0msВремя ответа (суммарно)0msТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)1.52sВремя ответа (макс.)1.99sВремя ответа (суммарно)3.04sТест считается полностью пройденным, только если все его прогоны успешны.…
1.52sВремя ответа (среднее)…
66Выходные токены…
0Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
9.9Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)34.02sВремя ответа (макс.)41.83sВремя ответа (суммарно)68.04sТест считается полностью пройденным, только если все его прогоны успешны.…
7.7Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
88.9%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)7.13sВремя ответа (макс.)10.09sВремя ответа (суммарно)21.40sТест считается полностью пройденным, только если все его прогоны успешны.…
7.13sВремя ответа (среднее)…
302Выходные токены…
0Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)29.74sВремя ответа (макс.)45.06sВремя ответа (суммарно)59.48sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)11.85sВремя ответа (макс.)11.85sВремя ответа (суммарно)11.85sТест считается полностью пройденным, только если все его прогоны успешны.…
11.85sВремя ответа (среднее)…
522Выходные токены…
0Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)78.83sВремя ответа (макс.)78.83sВремя ответа (суммарно)78.83sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)17.23sВремя ответа (макс.)17.23sВремя ответа (суммарно)17.23sТест считается полностью пройденным, только если все его прогоны успешны.…
17.23sВремя ответа (среднее)…
17Выходные токены…
0Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)47.71sВремя ответа (макс.)47.71sВремя ответа (суммарно)47.71sТест считается полностью пройденным, только если все его прогоны успешны.…