Навигация
AI BENCHY
Advertise here

AI BENCHY Compare

ByteDance Seed: Seed-2.0-Mini vs Inception: Mercury 2

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-04

Метрика Seed-2.0-Mini Seed-2.0-Mini medium Релиз: 2026-02-14 Mercury 2 Mercury 2 medium Релиз: 2026-02-24
Оценка 6.9 6.6
Ранг #73 #81
Надежность 6.7 10.0
Стабильность 9.3 8.8
Тестов верно
Доля успешных попыток 57.1% 54.0%
Нестабильные тесты 2 3
Всего запусков 63 63
Стоимость за результат 0.397 0.578
Общая стоимость $0.044 $0.058
Цена входа $0.100 / 1M $0.250 / 1M
Цена выхода $0.400 / 1M $0.750 / 1M
Общее число входных токенов 41,904 35,116
Выходные токены 2,555 4,048
Токены рассуждений 95,974 61,219
Время ответа (среднее) 80.22s 2.24s
Время ответа (макс.) 262.83s 14.63s
Время ответа (суммарно) 1363.72s 44.72s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Mini 6.6 10.0 50.0% 0 74.75s 791 360 9,520
Mercury 2 6.9 9.9 50.0% 0 1.12s 554 2,546 2,609
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Mini 5.5 9.8 33.3% 0 220.48s 3,823 464 34,964
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Mini 10.0 10.0 100.0% 0 262.83s 16,533 404 29,806
Mercury 2 10.0 10.0 100.0% 0 3.28s 12,909 268 4,887
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Mini 10.0 10.0 100.0% 0 24.27s 8,568 246 2,743
Mercury 2 7.3 5.9 83.3% 1 1.11s 6,234 183 1,656
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Mini 3.0 10.0 0.0% 0 0ms 0 0 0
Mercury 2 2.9 7.2 11.1% 1 6.48s 695 41 30,754
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Mini 5.1 3.4 33.3% 1 36.65s 585 213 4,210
Mercury 2 4.8 10.0 0.0% 0 821ms 456 137 542
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Mini 10.0 10.0 100.0% 0 17.47s 840 69 2,050
Mercury 2 10.0 10.0 100.0% 0 1.07s 340 14 958
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Mini 8.2 7.2 88.9% 1 31.79s 903 527 5,667
Mercury 2 5.4 10.0 33.3% 0 949ms 601 361 2,781
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Mini 10.0 10.0 100.0% 0 88.68s 9,585 222 5,235
Mercury 2 10.0 10.0 100.0% 0 1.89s 6,080 180 1,956
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Mini 3.0 10.0 0.0% 0 56.76s 276 50 1,779
Mercury 2 3.0 10.0 0.0% 0 2.58s 182 22 3,748

Быстрое сравнение

Сменить пару сравнения