Навигация
AI BENCHY
Advertise here

AI BENCHY Compare

Google: Gemini 3.5 Flash vs Inception: Mercury 2

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-03

Метрика Gemini 3.5 Flash Gemini 3.5 Flash high Релиз: 2026-05-19 Mercury 2 Mercury 2 medium Релиз: 2026-02-24
Оценка 9.6 6.5
Ранг #2 #89
Надежность 10.0 10.0
Стабильность 9.6 8.8
Тестов верно
Доля успешных попыток 96.7% 51.7%
Нестабильные тесты 1 3
Всего запусков 60 60
Стоимость за результат 5.231 0.611
Общая стоимость $0.994 $0.055
Цена входа $1.500 / 1M $0.250 / 1M
Цена выхода $9.000 / 1M $0.750 / 1M
Общее число входных токенов 34,591 32,570
Выходные токены 1,969 4,022
Токены рассуждений 102,679 58,405
Время ответа (среднее) 8.30s 2.27s
Время ответа (макс.) 34.82s 14.63s
Время ответа (суммарно) 165.92s 43.20s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.5 Flash 10.0 10.0 100.0% 0 2.57s 492 174 4,997
Mercury 2 6.9 9.9 50.0% 0 1.12s 554 2,546 2,609
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.5 Flash 10.0 10.0 100.0% 0 24.62s 5,115 450 34,170
Mercury 2 7.2 6.5 66.7% 1 2.29s 4,519 270 8,514
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.5 Flash 10.0 10.0 100.0% 0 22.37s 12,873 351 16,323
Mercury 2 10.0 10.0 100.0% 0 3.28s 12,909 268 4,887
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.5 Flash 10.0 10.0 100.0% 0 6.43s 7,548 279 8,466
Mercury 2 7.3 5.9 83.3% 1 1.11s 6,234 183 1,656
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.5 Flash 7.6 7.2 77.8% 1 14.09s 633 12 24,721
Mercury 2 2.9 7.2 11.1% 1 6.48s 695 41 30,754
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.5 Flash 10.0 10.0 100.0% 0 3.63s 486 115 1,650
Mercury 2 4.8 10.0 0.0% 0 821ms 456 137 542
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.5 Flash 10.0 10.0 100.0% 0 3.35s 615 70 3,799
Mercury 2 10.0 10.0 100.0% 0 1.07s 340 14 958
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.5 Flash 10.0 10.0 100.0% 0 3.23s 558 241 4,940
Mercury 2 5.4 10.0 33.3% 0 949ms 601 361 2,781
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.5 Flash 9.8 10.0 100.0% 0 4.96s 6,115 265 1,608
Mercury 2 10.0 10.0 100.0% 0 1.89s 6,080 180 1,956
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Gemini 3.5 Flash 10.0 10.0 100.0% 0 3.94s 156 12 2,005
Mercury 2 3.0 10.0 0.0% 0 2.58s 182 22 3,748

Быстрое сравнение

Сменить пару сравнения