Сравнение benchmark Gemini 3.5 Flash vs Mimo V2 PRO: Gemini 3.5 Flash лидирует по среднему баллу: 9.8 vs 5.8. Mimo V2 PRO имеет более низкую стоимость benchmark: $0.045 vs $1.115. Mimo V2 PRO быстрее: 2.27s vs 8.84s, с долей успешных попыток 96.8% vs 41.3%.
Рекомендуемая модель: Gemini 3.5 Flash - У него самый высокий балл в этом сравнении (9.8) и лучший общий баланс стоимости и времени ответа среди всех 2 моделей.
Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-18
Mimo V2 PROMimo V2 PROnoneАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.Релиз: 2026-03-18
Оценка
9.8Средний балл по всем бенчмарк-тестам.…
5.8Средний балл по всем бенчмарк-тестам.…
Ранг
#1
#109
Надежность
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
10.0Оценка успеха с первой попытки: 10.0 означает отсутствие повторяемых сбоев целевого API или лимитов до успешных вызовов; зафиксированные сбои снижают оценку.…
Стабильность
9.6Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
8.8Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
Тестов верно
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)8.84sВремя ответа (макс.)34.82sВремя ответа (суммарно)185.57sТест считается полностью пройденным, только если все его прогоны успешны.…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 11Не соблюдены инструкции: 2Ошибка API: 1Время ответа (среднее)2.27sВремя ответа (макс.)6.58sВремя ответа (суммарно)45.50sТест считается полностью пройденным, только если все его прогоны успешны.…
Доля успешных попыток
96.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
41.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
Нестабильные тесты
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
3Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Всего запусков
63Всего запусков…
63Всего запусков…
Стоимость за результат
5.575Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
0.663Показывает среднюю стоимость одного правильного ответа в бенчмарке в центах (меньше — лучше).…
Общая стоимость
$1.115Общая стоимость (текущая цена)…
$0.045Общая стоимость (текущая цена)…
Цена входа
$1.500 / 1MЦена входа…
$1.076 / 1MЦена входа…
Цена выхода
$9.000 / 1MЦена выхода…
$1.076 / 1MЦена выхода…
Общее число входных токенов
37,594Общее число входных токенов…
39,344Общее число входных токенов…
Выходные токены
1,975Выходные токены…
2,352Выходные токены…
Токены рассуждений
115,638Токены рассуждений…
0Токены рассуждений…
Время ответа (среднее)
8.84sВремя ответа (среднее)…
2.27sВремя ответа (среднее)…
Время ответа (макс.)
34.82sВремя ответа (макс.)…
6.58sВремя ответа (макс.)…
Время ответа (суммарно)
185.57sВремя ответа (суммарно)…
45.50sВремя ответа (суммарно)…
Генерация showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#1 Gemini 3.5 Flash
high
Стоимость
$0.208
Время
118.2s
Токены
23,158 tok
#109 Mimo V2 PRO
none
This model has been deprecated. It is recommended to migrate to xiaomi/mimo-v2.5-pro
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)2.57sВремя ответа (макс.)3.60sВремя ответа (суммарно)10.27sТест считается полностью пройденным, только если все его прогоны успешны.…
2.57sВремя ответа (среднее)…
492Общее число входных токенов…
174Выходные токены…
4,997Токены рассуждений…
Mimo V2 PROАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.5Средний балл по всем бенчмарк-тестам.…
8.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
16.7%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 4Время ответа (среднее)1.80sВремя ответа (макс.)2.62sВремя ответа (суммарно)7.19sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)22.96sВремя ответа (макс.)34.82sВремя ответа (суммарно)68.88sТест считается полностью пройденным, только если все его прогоны успешны.…
22.96sВремя ответа (среднее)…
8,118Общее число входных токенов…
456Выходные токены…
47,129Токены рассуждений…
Mimo V2 PROАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
5.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
33.3%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Ошибка API: 1Неверный ответ: 1Время ответа (среднее)2.65sВремя ответа (макс.)3.82sВремя ответа (суммарно)5.30sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)22.37sВремя ответа (макс.)22.37sВремя ответа (суммарно)22.37sТест считается полностью пройденным, только если все его прогоны успешны.…
22.37sВремя ответа (среднее)…
12,873Общее число входных токенов…
351Выходные токены…
16,323Токены рассуждений…
Mimo V2 PROАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)6.58sВремя ответа (макс.)6.58sВремя ответа (суммарно)6.58sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)6.43sВремя ответа (макс.)8.51sВремя ответа (суммарно)12.87sТест считается полностью пройденным, только если все его прогоны успешны.…
6.43sВремя ответа (среднее)…
7,548Общее число входных токенов…
279Выходные токены…
8,466Токены рассуждений…
Mimo V2 PROАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)1.39sВремя ответа (макс.)1.42sВремя ответа (суммарно)2.78sТест считается полностью пройденным, только если все его прогоны успешны.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
77.8%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)14.09sВремя ответа (макс.)22.00sВремя ответа (суммарно)42.27sТест считается полностью пройденным, только если все его прогоны успешны.…
14.09sВремя ответа (среднее)…
633Общее число входных токенов…
12Выходные токены…
24,721Токены рассуждений…
Mimo V2 PROАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
5.3Средний балл по всем бенчмарк-тестам.…
7.2Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
44.4%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 2Время ответа (среднее)1.78sВремя ответа (макс.)2.49sВремя ответа (суммарно)5.34sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.63sВремя ответа (макс.)3.63sВремя ответа (суммарно)3.63sТест считается полностью пройденным, только если все его прогоны успешны.…
3.63sВремя ответа (среднее)…
486Общее число входных токенов…
115Выходные токены…
1,650Токены рассуждений…
Mimo V2 PROАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
4.3Средний балл по всем бенчмарк-тестам.…
9.9Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Время ответа (среднее)2.44sВремя ответа (макс.)2.44sВремя ответа (суммарно)2.44sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.35sВремя ответа (макс.)3.42sВремя ответа (суммарно)6.69sТест считается полностью пройденным, только если все его прогоны успешны.…
3.35sВремя ответа (среднее)…
615Общее число входных токенов…
70Выходные токены…
3,799Токены рассуждений…
Mimo V2 PROАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
6.5Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
50.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)2.51sВремя ответа (макс.)2.95sВремя ответа (суммарно)5.02sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.23sВремя ответа (макс.)3.68sВремя ответа (суммарно)9.69sТест считается полностью пройденным, только если все его прогоны успешны.…
3.23sВремя ответа (среднее)…
558Общее число входных токенов…
241Выходные токены…
4,940Токены рассуждений…
Mimo V2 PROАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
6.0Средний балл по всем бенчмарк-тестам.…
7.1Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
55.6%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
1Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Не соблюдены инструкции: 1Неверный ответ: 1Время ответа (среднее)1.61sВремя ответа (макс.)2.15sВремя ответа (суммарно)4.83sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.96sВремя ответа (макс.)4.96sВремя ответа (суммарно)4.96sТест считается полностью пройденным, только если все его прогоны успешны.…
4.96sВремя ответа (среднее)…
6,115Общее число входных токенов…
265Выходные токены…
1,608Токены рассуждений…
Mimo V2 PROАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
10.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)4.39sВремя ответа (макс.)4.39sВремя ответа (суммарно)4.39sТест считается полностью пройденным, только если все его прогоны успешны.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
100.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Нет проваленных ответов.Время ответа (среднее)3.94sВремя ответа (макс.)3.94sВремя ответа (суммарно)3.94sТест считается полностью пройденным, только если все его прогоны успешны.…
3.94sВремя ответа (среднее)…
156Общее число входных токенов…
12Выходные токены…
2,005Токены рассуждений…
Mimo V2 PROАрхивная модель: эта модель больше не обновляется и не тестируется на новых тестах.
3.0Средний балл по всем бенчмарк-тестам.…
10.0Оценка стабильности отражает устойчивость между прогонами (10 = очень стабильно, даже если стабильно неверно).…
0.0%Доля успешных попыток = успешные попытки / все попытки по всем прогонам.…
0Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).…
Тест считается полностью пройденным, только если все его прогоны успешны.Неверный ответ: 1Время ответа (среднее)1.63sВремя ответа (макс.)1.63sВремя ответа (суммарно)1.63sТест считается полностью пройденным, только если все его прогоны успешны.…