Сравнение benchmark Nemotron 3 Ultra 550b A55b vs Laguna M.1: Nemotron 3 Ultra 550b A55b лидирует по среднему баллу: 8.1 vs 5.7. Laguna M.1 имеет более низкую стоимость benchmark: $0.000 vs $0.177. Laguna M.1 быстрее: 14.73s vs 15.05s, с долей успешных попыток 69.8% vs 52.6%.
Рекомендуемая модель: Nemotron 3 Ultra 550b A55b - У него самый высокий балл в этом сравнении (8.1) и лучший общий баланс стоимости и времени ответа среди всех 2 моделей.
Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-12
Laguna M.1Laguna M.1mediumАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.Релиз: 2026-04-28Бесплатно доступно
Оценка
8.1Средний балл по всем бенчмарк-тестам.…
5.7Средний балл по всем бенчмарк-тестам.…
Ранг
#29
#117
Надежность
9.7Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
8.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
9.1Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 7Ошибка API: 1Время ответа (среднее)15.05sВремя ответа (макс.)43.93sВремя ответа (суммарно)316.09sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 4Неверный ответ: 4Не соблюдены инструкции: 1Нет ответа: 1Время ответа (среднее)14.73sВремя ответа (макс.)53.14sВремя ответа (суммарно)220.93sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
69.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
52.6%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
3Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
63Всего запусков…
57Всего запусков…
Стоимость за результат
0.000Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
0.000Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)8.62sВремя ответа (макс.)16.86sВремя ответа (суммарно)34.49sТест считается полностью пройденным, только если все его прогоны успешны.…
8.62sВремя ответа (среднее)…
780Общее число входных токенов…
835Выходные токены…
1,485Токены рассуждений…
Laguna M.1Архивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
6.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Неверный ответ: 1Время ответа (среднее)4.87sВремя ответа (макс.)6.30sВремя ответа (суммарно)14.62sТест считается полностью пройденным, только если все его прогоны успешны.…
7.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
88.9%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)26.53sВремя ответа (макс.)31.91sВремя ответа (суммарно)79.58sТест считается полностью пройденным, только если все его прогоны успешны.…
26.53sВремя ответа (среднее)…
7,686Общее число входных токенов…
2,854Выходные токены…
17,725Токены рассуждений…
Laguna M.1Архивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
4.3Средний балл по всем бенчмарк-тестам.…
1.1Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)35.61sВремя ответа (макс.)35.61sВремя ответа (суммарно)35.61sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)43.93sВремя ответа (макс.)43.93sВремя ответа (суммарно)43.93sТест считается полностью пройденным, только если все его прогоны успешны.…
43.93sВремя ответа (среднее)…
17,574Общее число входных токенов…
1,040Выходные токены…
3,590Токены рассуждений…
Laguna M.1Архивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет ответа: 1Время ответа (среднее)53.14sВремя ответа (макс.)53.14sВремя ответа (суммарно)53.14sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.68sВремя ответа (макс.)7.94sВремя ответа (суммарно)11.36sТест считается полностью пройденным, только если все его прогоны успешны.…
5.68sВремя ответа (среднее)…
7,989Общее число входных токенов…
473Выходные токены…
1,285Токены рассуждений…
Laguna M.1Архивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.93sВремя ответа (макс.)5.03sВремя ответа (суммарно)9.86sТест считается полностью пройденным, только если все его прогоны успешны.…
4.4Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
2Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Время ответа (среднее)24.90sВремя ответа (макс.)34.96sВремя ответа (суммарно)74.71sТест считается полностью пройденным, только если все его прогоны успешны.…
24.90sВремя ответа (среднее)…
858Общее число входных токенов…
11,169Выходные токены…
16,249Токены рассуждений…
Laguna M.1Архивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
5.3Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
44.4%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)24.14sВремя ответа (макс.)45.83sВремя ответа (суммарно)72.43sТест считается полностью пройденным, только если все его прогоны успешны.…
9.5Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)2.52sВремя ответа (макс.)2.52sВремя ответа (суммарно)2.52sТест считается полностью пройденным, только если все его прогоны успешны.…
2.52sВремя ответа (среднее)…
360Общее число входных токенов…
70Выходные токены…
235Токены рассуждений…
Laguna M.1Архивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)0msВремя ответа (макс.)0msВремя ответа (суммарно)0msТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)6.35sВремя ответа (макс.)9.38sВремя ответа (суммарно)12.69sТест считается полностью пройденным, только если все его прогоны успешны.…
6.35sВремя ответа (среднее)…
765Общее число входных токенов…
182Выходные токены…
1,243Токены рассуждений…
Laguna M.1Архивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.30sВремя ответа (макс.)6.00sВремя ответа (суммарно)8.59sТест считается полностью пройденным, только если все его прогоны успешны.…
9.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)3.54sВремя ответа (макс.)6.03sВремя ответа (суммарно)10.62sТест считается полностью пройденным, только если все его прогоны успешны.…
3.54sВремя ответа (среднее)…
792Общее число входных токенов…
771Выходные токены…
2,055Токены рассуждений…
Laguna M.1Архивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
5.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Неверный ответ: 1Время ответа (среднее)10.19sВремя ответа (макс.)14.92sВремя ответа (суммарно)20.37sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)7.72sВремя ответа (макс.)7.72sВремя ответа (суммарно)7.72sТест считается полностью пройденным, только если все его прогоны успешны.…
7.72sВремя ответа (среднее)…
9,781Общее число входных токенов…
304Выходные токены…
984Токены рассуждений…
Laguna M.1Архивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)6.31sВремя ответа (макс.)6.31sВремя ответа (суммарно)6.31sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)38.47sВремя ответа (макс.)38.47sВремя ответа (суммарно)38.47sТест считается полностью пройденным, только если все его прогоны успешны.…
38.47sВремя ответа (среднее)…
228Общее число входных токенов…
304Выходные токены…
8,240Токены рассуждений…
Laguna M.1Архивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)0msВремя ответа (макс.)0msВремя ответа (суммарно)0msТест считается полностью пройденным, только если все его прогоны успешны.…