Сравнение benchmark Gemini 3.5 Flash vs MiMo-V2-Flash: MiMo-V2-Flash лидирует по среднему баллу: 7.1 vs 6.8. MiMo-V2-Flash имеет более низкую стоимость benchmark: $0.043 vs $0.108. Gemini 3.5 Flash быстрее: 1.57s vs 20.11s, с долей успешных попыток 68.3% vs 65.1%.
Рекомендуемая модель: MiMo-V2-Flash - Здесь у него лучший балл (7.1), при этом он примерно в 2.5 раза дешевле, чем Gemini 3.5 Flash.
Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-18
MiMo-V2-FlashMiMo-V2-FlashmediumАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.Релиз: 2025-12-16
Оценка
6.8Средний балл по всем бенчмарк-тестам.…
7.1Средний балл по всем бенчмарк-тестам.…
Ранг
#71
#62
Надежность
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
9.6Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
8.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 5Не соблюдены инструкции: 1Недопустимый вызов инструмента: 1Время ответа (среднее)1.57sВремя ответа (макс.)5.51sВремя ответа (суммарно)33.02sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)892msВремя ответа (макс.)1.38sВремя ответа (суммарно)3.57sТест считается полностью пройденным, только если все его прогоны успешны.…
892msВремя ответа (среднее)…
492Общее число входных токенов…
405Выходные токены…
0Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
8.1Средний балл по всем бенчмарк-тестам.…
7.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
83.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Лишнее форматирование: 1Время ответа (среднее)15.85sВремя ответа (макс.)20.83sВремя ответа (суммарно)47.55sТест считается полностью пройденным, только если все его прогоны успешны.…
9.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)2.75sВремя ответа (макс.)5.51sВремя ответа (суммарно)8.26sТест считается полностью пройденным, только если все его прогоны успешны.…
2.75sВремя ответа (среднее)…
8,122Общее число входных токенов…
3,456Выходные токены…
0Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
6.0Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
55.6%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Тайм-аут: 1Неверный ответ: 1Время ответа (среднее)10.71sВремя ответа (макс.)17.72sВремя ответа (суммарно)32.13sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Недопустимый вызов инструмента: 1Время ответа (среднее)3.56sВремя ответа (макс.)3.56sВремя ответа (суммарно)3.56sТест считается полностью пройденным, только если все его прогоны успешны.…
3.56sВремя ответа (среднее)…
15,780Общее число входных токенов…
404Выходные токены…
0Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
9.8Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)75.68sВремя ответа (макс.)75.68sВремя ответа (суммарно)75.68sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)1.66sВремя ответа (макс.)2.11sВремя ответа (суммарно)3.32sТест считается полностью пройденным, только если все его прогоны успешны.…
1.66sВремя ответа (среднее)…
7,548Общее число входных токенов…
279Выходные токены…
0Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
6.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Время ответа (среднее)0msВремя ответа (макс.)0msВремя ответа (суммарно)0msТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)899msВремя ответа (макс.)1.04sВремя ответа (суммарно)2.70sТест считается полностью пройденным, только если все его прогоны успешны.…
899msВремя ответа (среднее)…
633Общее число входных токенов…
12Выходные токены…
0Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
5.9Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
55.6%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)96.01sВремя ответа (макс.)96.01sВремя ответа (суммарно)96.01sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)922msВремя ответа (макс.)922msВремя ответа (суммарно)922msТест считается полностью пройденным, только если все его прогоны успешны.…
922msВремя ответа (среднее)…
486Общее число входных токенов…
117Выходные токены…
0Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
4.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)4.20sВремя ответа (макс.)4.20sВремя ответа (суммарно)4.20sТест считается полностью пройденным, только если все его прогоны успешны.…
5.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)893msВремя ответа (макс.)964msВремя ответа (суммарно)1.79sТест считается полностью пройденным, только если все его прогоны успешны.…
893msВремя ответа (среднее)…
615Общее число входных токенов…
76Выходные токены…
0Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.28sВремя ответа (макс.)7.37sВремя ответа (суммарно)8.55sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)1.45sВремя ответа (макс.)2.30sВремя ответа (суммарно)4.36sТест считается полностью пройденным, только если все его прогоны успешны.…
1.45sВремя ответа (среднее)…
558Общее число входных токенов…
282Выходные токены…
0Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
7.7Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
66.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)3.87sВремя ответа (макс.)5.26sВремя ответа (суммарно)7.74sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.79sВремя ответа (макс.)2.79sВремя ответа (суммарно)2.79sТест считается полностью пройденным, только если все его прогоны успешны.…
2.79sВремя ответа (среднее)…
5,457Общее число входных токенов…
234Выходные токены…
0Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)27.78sВремя ответа (макс.)27.78sВремя ответа (суммарно)27.78sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)1.76sВремя ответа (макс.)1.76sВремя ответа (суммарно)1.76sТест считается полностью пройденным, только если все его прогоны успешны.…
1.76sВремя ответа (среднее)…
156Общее число входных токенов…
12Выходные токены…
0Токены рассуждений…
MiMo-V2-FlashАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)1.96sВремя ответа (макс.)1.96sВремя ответа (суммарно)1.96sТест считается полностью пройденным, только если все его прогоны успешны.…