Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Inception: Mercury 2 vs Mistral: Mistral Small 4

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-03-17

Метрика Mercury 2 Mercury 2 medium Релиз: 2026-02-24 Mistral Small 4 Mistral Small 4 none Релиз: 2026-03-16
Ранг #42 #61
Оценка 6.3 5.3
Стабильность 8.5 9.5
Стоимость за результат 0.634 0.108
Общая стоимость $0.045 $0.006
Тестов верно
Доля успешных попыток 51.0% 33.3%
Нестабильные тесты 3 1
Всего запусков 51 51
Выходные токены 3,723 1,624
Токены рассуждений 46,120 0
Время ответа (среднее) 2.25s 629ms
Время ответа (макс.) 14.63s 1.72s
Время ответа (суммарно) 35.99s 10.70s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Mercury 2 6.9 9.9 50.0% 0 1.12s 2,546 2,609
Mistral Small 4 3.4 7.9 16.7% 1 395ms 182 0
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Mercury 2 10.0 10.0 100.0% 0 3.28s 268 4,887
Mistral Small 4 3.0 10.0 0.0% 0 1.72s 496 0
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Mercury 2 7.3 5.9 83.3% 1 1.11s 183 1,656
Mistral Small 4 10.0 10.0 100.0% 0 822ms 261 0
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Mercury 2 2.9 7.2 11.1% 1 6.48s 41 30,754
Mistral Small 4 5.3 10.0 33.3% 0 367ms 28 0
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Mercury 2 4.8 10.0 0.0% 0 821ms 137 542
Mistral Small 4 4.0 10.0 0.0% 0 729ms 205 0
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Mercury 2 10.0 10.0 100.0% 0 1.07s 14 958
Mistral Small 4 6.5 10.0 50.0% 0 380ms 69 0
Puzzle Solving Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Mercury 2 3.9 7.5 22.2% 1 934ms 354 2,758
Mistral Small 4 3.1 9.9 0.0% 0 589ms 170 0
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Mercury 2 10.0 10.0 100.0% 0 1.89s 180 1,956
Mistral Small 4 10.0 10.0 100.0% 0 1.40s 213 0

Быстрое сравнение

Сменить пару сравнения