Hy3 previewHy3 previewhighАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.Релиз: 2026-04-22
Оценка
6.7Средний балл по всем бенчмарк-тестам.…
8.0Средний балл по всем бенчмарк-тестам.…
Ранг
#79
#22
Надежность
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
6.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
9.5Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 5Не соблюдены инструкции: 2Нет ответа: 2Тайм-аут: 2Время ответа (среднее)89.36sВремя ответа (макс.)281.00sВремя ответа (суммарно)1161.65sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Ошибка API: 1Время ответа (среднее)56.77sВремя ответа (макс.)149.94sВремя ответа (суммарно)851.49sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
77.1%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
8Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
60Всего запусков…
60Всего запусков…
Стоимость за результат
3.479Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
0.000Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
5.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
83.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Неверный ответ: 1Время ответа (среднее)51.38sВремя ответа (макс.)85.28sВремя ответа (суммарно)102.75sТест считается полностью пройденным, только если все его прогоны успешны.…
51.38sВремя ответа (среднее)…
2,789Выходные токены…
8,880Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
8.9Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)15.12sВремя ответа (макс.)19.99sВремя ответа (суммарно)45.37sТест считается полностью пройденным, только если все его прогоны успешны.…
1.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Тайм-аут: 1Время ответа (среднее)215.89sВремя ответа (макс.)281.00sВремя ответа (суммарно)431.77sТест считается полностью пройденным, только если все его прогоны успешны.…
215.89sВремя ответа (среднее)…
5,700Выходные токены…
45,419Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)99.76sВремя ответа (макс.)99.76sВремя ответа (суммарно)99.76sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)71.37sВремя ответа (макс.)71.37sВремя ответа (суммарно)71.37sТест считается полностью пройденным, только если все его прогоны успешны.…
71.37sВремя ответа (среднее)…
703Выходные токены…
3,713Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)113.09sВремя ответа (макс.)113.09sВремя ответа (суммарно)113.09sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)49.78sВремя ответа (макс.)49.78sВремя ответа (суммарно)49.78sТест считается полностью пройденным, только если все его прогоны успешны.…
49.78sВремя ответа (среднее)…
563Выходные токены…
7,940Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
6.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)12.11sВремя ответа (макс.)12.11sВремя ответа (суммарно)12.11sТест считается полностью пройденным, только если все его прогоны успешны.…
4.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Тайм-аут: 1Время ответа (среднее)137.29sВремя ответа (макс.)137.29sВремя ответа (суммарно)137.29sТест считается полностью пройденным, только если все его прогоны успешны.…
137.29sВремя ответа (среднее)…
20,753Выходные токены…
30,564Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
5.3Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
44.4%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)109.04sВремя ответа (макс.)149.94sВремя ответа (суммарно)327.11sТест считается полностью пройденным, только если все его прогоны успешны.…
3.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)69.73sВремя ответа (макс.)69.73sВремя ответа (суммарно)69.73sТест считается полностью пройденным, только если все его прогоны успешны.…
69.73sВремя ответа (среднее)…
3,815Выходные токены…
4,262Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
0.0Средний балл по всем бенчмарк-тестам.…
0.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)0msВремя ответа (макс.)0msВремя ответа (суммарно)0msТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)92.47sВремя ответа (макс.)92.47sВремя ответа (суммарно)92.47sТест считается полностью пройденным, только если все его прогоны успешны.…
92.47sВремя ответа (среднее)…
5,371Выходные токены…
6,547Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
9.9Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)34.02sВремя ответа (макс.)41.83sВремя ответа (суммарно)68.04sТест считается полностью пройденным, только если все его прогоны успешны.…
7.3Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
44.4%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)45.40sВремя ответа (макс.)82.75sВремя ответа (суммарно)90.79sТест считается полностью пройденным, только если все его прогоны успешны.…
45.40sВремя ответа (среднее)…
6,671Выходные токены…
12,403Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)29.74sВремя ответа (макс.)45.06sВремя ответа (суммарно)59.48sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)31.74sВремя ответа (макс.)31.74sВремя ответа (суммарно)31.74sТест считается полностью пройденным, только если все его прогоны успешны.…
31.74sВремя ответа (среднее)…
242Выходные токены…
812Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)78.83sВремя ответа (макс.)78.83sВремя ответа (суммарно)78.83sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)83.95sВремя ответа (макс.)83.95sВремя ответа (суммарно)83.95sТест считается полностью пройденным, только если все его прогоны успешны.…
83.95sВремя ответа (среднее)…
12Выходные токены…
7,644Токены рассуждений…
Hy3 previewАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)47.71sВремя ответа (макс.)47.71sВремя ответа (суммарно)47.71sТест считается полностью пройденным, только если все его прогоны успешны.…