Навигация
AI BENCHY
Advertise here

AI BENCHY Compare

Inception: Mercury 2 vs Elephant Alpha

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-03

Метрика Mercury 2 Mercury 2 none Релиз: 2026-02-24 Elephant Alpha Elephant Alpha medium Релиз: 2026-04-14
Оценка 4.6 5.3
Ранг #153 #134
Надежность 10.0 Н/Д
Стабильность 9.1 9.7
Тестов верно
Доля успешных попыток 25.0% 31.7%
Нестабильные тесты 2 1
Всего запусков 60 60
Стоимость за результат 0.216 0.000
Общая стоимость $0.009 $0.000
Цена входа $0.250 / 1M $0.000 / 1M
Цена выхода $0.750 / 1M $0.000 / 1M
Общее число входных токенов 25,515 33,744
Выходные токены 3,001 2,596
Токены рассуждений 0 0
Время ответа (среднее) 614ms 1.27s
Время ответа (макс.) 1.27s 3.70s
Время ответа (суммарно) 12.28s 22.82s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Mercury 2 3.0 10.0 0.0% 0 483ms 631 286 0
Elephant Alpha 6.6 10.0 50.0% 0 1.19s 726 815 0
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Mercury 2 3.5 9.4 0.0% 0 831ms 4,631 1,650 0
Elephant Alpha 4.0 6.7 16.7% 1 1.30s 813 365 0
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Mercury 2 3.0 10.0 0.0% 0 606ms 4,821 131 0
Elephant Alpha 3.0 10.0 0.0% 0 3.70s 14,046 562 0
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Mercury 2 7.3 5.9 83.3% 1 667ms 6,362 180 0
Elephant Alpha 6.5 10.0 50.0% 0 979ms 8,004 246 0
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Mercury 2 5.3 7.2 44.4% 1 534ms 784 46 0
Elephant Alpha 3.0 10.0 0.0% 0 925ms 810 24 0
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Mercury 2 4.8 10.0 0.0% 0 628ms 495 159 0
Elephant Alpha 4.3 10.0 0.0% 0 920ms 540 105 0
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Mercury 2 6.5 10.0 50.0% 0 551ms 691 82 0
Elephant Alpha 9.8 10.0 100.0% 0 987ms 732 82 0
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Mercury 2 3.1 10.0 0.0% 0 535ms 694 251 0
Elephant Alpha 5.3 10.0 33.3% 0 868ms 729 166 0
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Mercury 2 10.0 10.0 100.0% 0 1.27s 6,193 197 0
Elephant Alpha 3.0 10.0 0.0% 0 2.83s 7,344 231 0
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Mercury 2 3.0 10.0 0.0% 0 548ms 213 19 0
Elephant Alpha 3.0 10.0 0.0% 0 0ms 0 0 0

Быстрое сравнение

Сменить пару сравнения