Сравнение benchmark GPT-5.5 vs Mimo V2 Omni: GPT-5.5 лидирует по среднему баллу: 9.3 vs 6.8. Mimo V2 Omni имеет более низкую стоимость benchmark: $0.683 vs $0.907. GPT-5.5 быстрее: 9.76s vs 41.16s, с долей успешных попыток 85.7% vs 55.6%.
Рекомендуемая модель: GPT-5.5 - Здесь у него лучший балл (9.3), и он отвечает примерно в 4.2 раза быстрее, чем Mimo V2 Omni.
Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-18
Mimo V2 OmniMimo V2 OmnimediumАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.Релиз: 2026-03-18
Оценка
9.3Средний балл по всем бенчмарк-тестам.…
6.8Средний балл по всем бенчмарк-тестам.…
Ранг
#4
#73
Надежность
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
8.7Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Время ответа (среднее)9.76sВремя ответа (макс.)56.19sВремя ответа (суммарно)204.92sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.41sВремя ответа (макс.)6.32sВремя ответа (суммарно)17.64sТест считается полностью пройденным, только если все его прогоны успешны.…
4.41sВремя ответа (среднее)…
606Общее число входных токенов…
238Выходные токены…
1,020Токены рассуждений…
Mimo V2 OmniАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.75sВремя ответа (макс.)4.59sВремя ответа (суммарно)10.98sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)15.04sВремя ответа (макс.)21.06sВремя ответа (суммарно)45.11sТест считается полностью пройденным, только если все его прогоны успешны.…
15.04sВремя ответа (среднее)…
7,302Общее число входных токенов…
423Выходные токены…
6,402Токены рассуждений…
Mimo V2 OmniАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.3Средний балл по всем бенчмарк-тестам.…
6.5Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
11.1%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Нет ответа: 1Неверный ответ: 1Время ответа (среднее)183.89sВремя ответа (макс.)299.23sВремя ответа (суммарно)367.78sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)9.56sВремя ответа (макс.)9.56sВремя ответа (суммарно)9.56sТест считается полностью пройденным, только если все его прогоны успешны.…
9.56sВремя ответа (среднее)…
11,019Общее число входных токенов…
303Выходные токены…
717Токены рассуждений…
Mimo V2 OmniАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)25.87sВремя ответа (макс.)25.87sВремя ответа (суммарно)25.87sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.28sВремя ответа (макс.)5.13sВремя ответа (суммарно)6.56sТест считается полностью пройденным, только если все его прогоны успешны.…
3.28sВремя ответа (среднее)…
7,140Общее число входных токенов…
228Выходные токены…
157Токены рассуждений…
Mimo V2 OmniАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.04sВремя ответа (макс.)4.12sВремя ответа (суммарно)6.07sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)28.05sВремя ответа (макс.)56.19sВремя ответа (суммарно)84.16sТест считается полностью пройденным, только если все его прогоны успешны.…
28.05sВремя ответа (среднее)…
723Общее число входных токенов…
69Выходные токены…
11,609Токены рассуждений…
Mimo V2 OmniАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Лишнее форматирование: 1Нет ответа: 1Неверный ответ: 1Время ответа (среднее)47.89sВремя ответа (макс.)134.52sВремя ответа (суммарно)143.67sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.17sВремя ответа (макс.)5.17sВремя ответа (суммарно)5.17sТест считается полностью пройденным, только если все его прогоны успешны.…
5.17sВремя ответа (среднее)…
477Общее число входных токенов…
133Выходные токены…
245Токены рассуждений…
Mimo V2 OmniАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
5.4Средний балл по всем бенчмарк-тестам.…
2.5Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)3.61sВремя ответа (макс.)3.61sВремя ответа (суммарно)3.61sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.74sВремя ответа (макс.)3.99sВремя ответа (суммарно)7.48sТест считается полностью пройденным, только если все его прогоны успешны.…
3.74sВремя ответа (среднее)…
660Общее число входных токенов…
93Выходные токены…
415Токены рассуждений…
Mimo V2 OmniАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
8.3Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)4.99sВремя ответа (макс.)7.14sВремя ответа (суммарно)9.99sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.74sВремя ответа (макс.)5.61sВремя ответа (суммарно)14.21sТест считается полностью пройденным, только если все его прогоны успешны.…
4.74sВремя ответа (среднее)…
642Общее число входных токенов…
279Выходные токены…
954Токены рассуждений…
Mimo V2 OmniАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
5.9Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
55.6%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)2.38sВремя ответа (макс.)3.69sВремя ответа (суммарно)7.13sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.96sВремя ответа (макс.)4.96sВремя ответа (суммарно)4.96sТест считается полностью пройденным, только если все его прогоны успешны.…
4.96sВремя ответа (среднее)…
5,445Общее число входных токенов…
250Выходные токены…
101Токены рассуждений…
Mimo V2 OmniАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)13.98sВремя ответа (макс.)13.98sВремя ответа (суммарно)13.98sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)10.06sВремя ответа (макс.)10.06sВремя ответа (суммарно)10.06sТест считается полностью пройденным, только если все его прогоны успешны.…
10.06sВремя ответа (среднее)…
195Общее число входных токенов…
30Выходные токены…
840Токены рассуждений…
Mimo V2 OmniАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)234.19sВремя ответа (макс.)234.19sВремя ответа (суммарно)234.19sТест считается полностью пройденным, только если все его прогоны успешны.…