Grok 4.20 BetaGrok 4.20 BetanoneАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.Релиз: 2026-03-12
Оценка
8.5Средний балл по всем бенчмарк-тестам.…
5.3Средний балл по всем бенчмарк-тестам.…
Ранг
#11
#93
Надежность
Н/ДОценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Н/ДОценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
8.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
9.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 2Неверный ответ: 2Ошибка API: 1Время ответа (среднее)55.19sВремя ответа (макс.)149.94sВремя ответа (суммарно)938.23sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)32.69sВремя ответа (макс.)85.41sВремя ответа (суммарно)130.78sТест считается полностью пройденным, только если все его прогоны успешны.…
32.69sВремя ответа (среднее)…
26,550Выходные токены…
0Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
4.0Средний балл по всем бенчмарк-тестам.…
8.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
16.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 4Время ответа (среднее)597msВремя ответа (макс.)866msВремя ответа (суммарно)2.39sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)99.76sВремя ответа (макс.)99.76sВремя ответа (суммарно)99.76sТест считается полностью пройденным, только если все его прогоны успешны.…
99.76sВремя ответа (среднее)…
38,167Выходные токены…
0Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
5.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)1.14sВремя ответа (макс.)1.14sВремя ответа (суммарно)1.14sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)113.09sВремя ответа (макс.)113.09sВремя ответа (суммарно)113.09sТест считается полностью пройденным, только если все его прогоны успешны.…
113.09sВремя ответа (среднее)…
31,319Выходные токены…
0Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Недопустимый вызов инструмента: 1Время ответа (среднее)6.48sВремя ответа (макс.)6.48sВремя ответа (суммарно)6.48sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)12.11sВремя ответа (макс.)12.11sВремя ответа (суммарно)12.11sТест считается полностью пройденным, только если все его прогоны успешны.…
12.11sВремя ответа (среднее)…
4,323Выходные токены…
0Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)601msВремя ответа (макс.)634msВремя ответа (суммарно)1.20sТест считается полностью пройденным, только если все его прогоны успешны.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
44.4%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)109.04sВремя ответа (макс.)149.94sВремя ответа (суммарно)327.11sТест считается полностью пройденным, только если все его прогоны успешны.…
109.04sВремя ответа (среднее)…
87,559Выходные токены…
0Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Время ответа (среднее)611msВремя ответа (макс.)616msВремя ответа (суммарно)1.83sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)24.31sВремя ответа (макс.)24.31sВремя ответа (суммарно)24.31sТест считается полностью пройденным, только если все его прогоны успешны.…
24.31sВремя ответа (среднее)…
5,490Выходные токены…
0Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
5.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)541msВремя ответа (макс.)541msВремя ответа (суммарно)541msТест считается полностью пройденным, только если все его прогоны успешны.…
6.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
83.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)34.02sВремя ответа (макс.)41.83sВремя ответа (суммарно)68.04sТест считается полностью пройденным, только если все его прогоны успешны.…
34.02sВремя ответа (среднее)…
13,331Выходные токены…
0Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
4.8Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)687msВремя ответа (макс.)952msВремя ответа (суммарно)1.37sТест считается полностью пройденным, только если все его прогоны успешны.…
7.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
88.9%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)28.07sВремя ответа (макс.)45.06sВремя ответа (суммарно)84.21sТест считается полностью пройденным, только если все его прогоны успешны.…
28.07sВремя ответа (среднее)…
21,811Выходные токены…
0Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
5.9Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
55.6%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)541msВремя ответа (макс.)677msВремя ответа (суммарно)1.62sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)78.83sВремя ответа (макс.)78.83sВремя ответа (суммарно)78.83sТест считается полностью пройденным, только если все его прогоны успешны.…
78.83sВремя ответа (среднее)…
10,370Выходные токены…
0Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.79sВремя ответа (макс.)4.79sВремя ответа (суммарно)4.79sТест считается полностью пройденным, только если все его прогоны успешны.…