Сравнение benchmark Nemotron 3 Ultra 550b A55b vs Grok 4.20 Beta: Grok 4.20 Beta лидирует по среднему баллу: 8.5 vs 7.5. Nemotron 3 Ultra 550b A55b имеет более низкую стоимость benchmark: $0.177 vs $0.750. Grok 4.20 Beta быстрее: 9.75s vs 15.05s, с долей успешных попыток 69.8% vs 81.5%.
Рекомендуемая модель: Nemotron 3 Ultra 550b A55b - Он дает лучший общий компромисс: конкурентный балл (7.5), ниже стоимость, чем у Grok 4.20 Beta, и сбалансированное время ответа.
Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-10
Grok 4.20 BetaGrok 4.20 BetamediumАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.Релиз: 2026-03-12
Оценка
7.5Средний балл по всем бенчмарк-тестам.…
8.5Средний балл по всем бенчмарк-тестам.…
Ранг
#42
#14
Надежность
9.7Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Н/ДОценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
8.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
9.5Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 7Ошибка API: 1Время ответа (среднее)15.05sВремя ответа (макс.)43.93sВремя ответа (суммарно)316.09sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Не соблюдены инструкции: 1Время ответа (среднее)9.75sВремя ответа (макс.)31.36sВремя ответа (суммарно)175.48sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
69.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
81.5%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
3Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
63Всего запусков…
52Всего запусков…
Стоимость за результат
0.000Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
4.505Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
Общая стоимость
$0.177Общая стоимость (текущая цена)…
$0.750Общая стоимость (текущая цена)…
Цена входа
$0.500 / 1MЦена входа…
$5.805 / 1MЦена входа…
Цена выхода
$2.500 / 1MЦена выхода…
$5.805 / 1MЦена выхода…
Общее число входных токенов
46,813Общее число входных токенов…
35,955Общее число входных токенов…
Выходные токены
18,002Выходные токены…
1,647Выходные токены…
Токены рассуждений
53,091Токены рассуждений…
91,565Токены рассуждений…
Время ответа (среднее)
15.05sВремя ответа (среднее)…
9.75sВремя ответа (среднее)…
Время ответа (макс.)
43.93sВремя ответа (макс.)…
31.36sВремя ответа (макс.)…
Время ответа (суммарно)
316.09sВремя ответа (суммарно)…
175.48sВремя ответа (суммарно)…
Generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#42 Nemotron 3 Ultra 550b A55b
medium
No showcase result has been generated for this model yet.
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)8.62sВремя ответа (макс.)16.86sВремя ответа (суммарно)34.49sТест считается полностью пройденным, только если все его прогоны успешны.…
8.62sВремя ответа (среднее)…
780Общее число входных токенов…
835Выходные токены…
1,485Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
8.7Средний балл по всем бенчмарк-тестам.…
7.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
91.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)3.16sВремя ответа (макс.)3.44sВремя ответа (суммарно)12.65sТест считается полностью пройденным, только если все его прогоны успешны.…
7.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
88.9%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)26.53sВремя ответа (макс.)31.91sВремя ответа (суммарно)79.58sТест считается полностью пройденным, только если все его прогоны успешны.…
26.53sВремя ответа (среднее)…
7,686Общее число входных токенов…
2,854Выходные токены…
17,725Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)31.36sВремя ответа (макс.)31.36sВремя ответа (суммарно)31.36sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)43.93sВремя ответа (макс.)43.93sВремя ответа (суммарно)43.93sТест считается полностью пройденным, только если все его прогоны успешны.…
43.93sВремя ответа (среднее)…
17,574Общее число входных токенов…
1,040Выходные токены…
3,590Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)20.93sВремя ответа (макс.)20.93sВремя ответа (суммарно)20.93sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.68sВремя ответа (макс.)7.94sВремя ответа (суммарно)11.36sТест считается полностью пройденным, только если все его прогоны успешны.…
5.68sВремя ответа (среднее)…
7,989Общее число входных токенов…
473Выходные токены…
1,285Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.01sВремя ответа (макс.)4.27sВремя ответа (суммарно)8.02sТест считается полностью пройденным, только если все его прогоны успешны.…
4.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Время ответа (среднее)24.90sВремя ответа (макс.)34.96sВремя ответа (суммарно)74.71sТест считается полностью пройденным, только если все его прогоны успешны.…
24.90sВремя ответа (среднее)…
858Общее число входных токенов…
11,169Выходные токены…
16,249Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
5.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)21.33sВремя ответа (макс.)24.21sВремя ответа (суммарно)64.00sТест считается полностью пройденным, только если все его прогоны успешны.…
9.5Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)2.52sВремя ответа (макс.)2.52sВремя ответа (суммарно)2.52sТест считается полностью пройденным, только если все его прогоны успешны.…
2.52sВремя ответа (среднее)…
360Общее число входных токенов…
70Выходные токены…
235Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.78sВремя ответа (макс.)5.78sВремя ответа (суммарно)5.78sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)6.35sВремя ответа (макс.)9.38sВремя ответа (суммарно)12.69sТест считается полностью пройденным, только если все его прогоны успешны.…
6.35sВремя ответа (среднее)…
765Общее число входных токенов…
182Выходные токены…
1,243Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
9.8Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.89sВремя ответа (макс.)5.89sВремя ответа (суммарно)9.78sТест считается полностью пройденным, только если все его прогоны успешны.…
9.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)3.54sВремя ответа (макс.)6.03sВремя ответа (суммарно)10.62sТест считается полностью пройденным, только если все его прогоны успешны.…
3.54sВремя ответа (среднее)…
792Общее число входных токенов…
771Выходные токены…
2,055Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.52sВремя ответа (макс.)4.53sВремя ответа (суммарно)10.57sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)7.72sВремя ответа (макс.)7.72sВремя ответа (суммарно)7.72sТест считается полностью пройденным, только если все его прогоны успешны.…
7.72sВремя ответа (среднее)…
9,781Общее число входных токенов…
304Выходные токены…
984Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)12.39sВремя ответа (макс.)12.39sВремя ответа (суммарно)12.39sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)38.47sВремя ответа (макс.)38.47sВремя ответа (суммарно)38.47sТест считается полностью пройденным, только если все его прогоны успешны.…
38.47sВремя ответа (среднее)…
228Общее число входных токенов…
304Выходные токены…
8,240Токены рассуждений…
Grok 4.20 BetaАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.