Сравнение benchmark GPT-5.5 vs MiMo-V2-Flash: GPT-5.5 лидирует по среднему баллу: 9.3 vs 7.1. MiMo-V2-Flash имеет более низкую стоимость benchmark: $0.043 vs $0.907. GPT-5.5 быстрее: 9.76s vs 20.11s, с долей успешных попыток 85.7% vs 65.1%.
Рекомендуемая модель: GPT-5.5 - Здесь у него лучший балл (9.3), и он отвечает примерно в 2.1 раза быстрее, чем MiMo-V2-Flash.
Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-07-02
MiMo-V2-FlashMiMo-V2-FlashmediumАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.Релиз: 2025-12-16
Оценка
9.3Средний балл по всем бенчмарк-тестам.…
7.1Средний балл по всем бенчмарк-тестам.…
Ранг
#4
#64
Надежность
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
8.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 3Время ответа (среднее)9.76sВремя ответа (макс.)56.19sВремя ответа (суммарно)204.92sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.41sВремя ответа (макс.)6.32sВремя ответа (суммарно)17.64sТест считается полностью пройденным, только если все его прогоны успешны.…
4.41sВремя ответа (среднее)…
606Общее число входных токенов…
238Выходные токены…
1,020Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
8.1Средний балл по всем бенчмарк-тестам.…
7.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
83.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Лишнее форматирование: 1Время ответа (среднее)15.85sВремя ответа (макс.)20.83sВремя ответа (суммарно)47.55sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)15.04sВремя ответа (макс.)21.06sВремя ответа (суммарно)45.11sТест считается полностью пройденным, только если все его прогоны успешны.…
15.04sВремя ответа (среднее)…
7,302Общее число входных токенов…
423Выходные токены…
6,402Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
6.0Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
55.6%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Тайм-аут: 1Неверный ответ: 1Время ответа (среднее)10.71sВремя ответа (макс.)17.72sВремя ответа (суммарно)32.13sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)9.56sВремя ответа (макс.)9.56sВремя ответа (суммарно)9.56sТест считается полностью пройденным, только если все его прогоны успешны.…
9.56sВремя ответа (среднее)…
11,019Общее число входных токенов…
303Выходные токены…
717Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
9.8Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)75.68sВремя ответа (макс.)75.68sВремя ответа (суммарно)75.68sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.28sВремя ответа (макс.)5.13sВремя ответа (суммарно)6.56sТест считается полностью пройденным, только если все его прогоны успешны.…
3.28sВремя ответа (среднее)…
7,140Общее число входных токенов…
228Выходные токены…
157Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
6.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)0msВремя ответа (макс.)0msВремя ответа (суммарно)0msТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)28.05sВремя ответа (макс.)56.19sВремя ответа (суммарно)84.16sТест считается полностью пройденным, только если все его прогоны успешны.…
28.05sВремя ответа (среднее)…
723Общее число входных токенов…
69Выходные токены…
11,609Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
5.9Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
55.6%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)96.01sВремя ответа (макс.)96.01sВремя ответа (суммарно)96.01sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)5.17sВремя ответа (макс.)5.17sВремя ответа (суммарно)5.17sТест считается полностью пройденным, только если все его прогоны успешны.…
5.17sВремя ответа (среднее)…
477Общее число входных токенов…
133Выходные токены…
245Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
4.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)4.20sВремя ответа (макс.)4.20sВремя ответа (суммарно)4.20sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.74sВремя ответа (макс.)3.99sВремя ответа (суммарно)7.48sТест считается полностью пройденным, только если все его прогоны успешны.…
3.74sВремя ответа (среднее)…
660Общее число входных токенов…
93Выходные токены…
415Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.28sВремя ответа (макс.)7.37sВремя ответа (суммарно)8.55sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.74sВремя ответа (макс.)5.61sВремя ответа (суммарно)14.21sТест считается полностью пройденным, только если все его прогоны успешны.…
4.74sВремя ответа (среднее)…
642Общее число входных токенов…
279Выходные токены…
954Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
7.7Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)3.87sВремя ответа (макс.)5.26sВремя ответа (суммарно)7.74sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.96sВремя ответа (макс.)4.96sВремя ответа (суммарно)4.96sТест считается полностью пройденным, только если все его прогоны успешны.…
4.96sВремя ответа (среднее)…
5,445Общее число входных токенов…
250Выходные токены…
101Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)27.78sВремя ответа (макс.)27.78sВремя ответа (суммарно)27.78sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)10.06sВремя ответа (макс.)10.06sВремя ответа (суммарно)10.06sТест считается полностью пройденным, только если все его прогоны успешны.…
10.06sВремя ответа (среднее)…
195Общее число входных токенов…
30Выходные токены…
840Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)1.96sВремя ответа (макс.)1.96sВремя ответа (суммарно)1.96sТест считается полностью пройденным, только если все его прогоны успешны.…