Навигация
AI BENCHY
Advertise here

AI BENCHY Compare

ByteDance Seed: Seed-2.0-Lite vs Google: Gemini 2.5 Flash

Сводка

Сравнение benchmark Seed-2.0-Lite vs Gemini 2.5 Flash: Seed-2.0-Lite лидирует по среднему баллу: 8.5 vs 8.2. Seed-2.0-Lite имеет более низкую стоимость benchmark: $0.175 vs $0.379. Gemini 2.5 Flash быстрее: 15.49s vs 47.07s, с долей успешных попыток 76.2% vs 69.8%.

Рекомендуемая модель: Seed-2.0-Lite - Здесь у него лучший балл (8.5), при этом он примерно в 2.2 раза дешевле, чем Gemini 2.5 Flash.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-18

Метрика Seed-2.0-Lite Seed-2.0-Lite medium Релиз: 2026-02-14 Gemini 2.5 Flash Gemini 2.5 Flash medium Релиз: 2025-06-17
Оценка 8.5 8.2
Ранг #18 #24
Надежность 10.0 10.0
Стабильность 9.0 9.6
Тестов верно
Доля успешных попыток 76.2% 69.8%
Нестабильные тесты 3 1
Всего запусков 63 63
Стоимость за результат 1.250 2.701
Общая стоимость $0.175 $0.379
Цена входа $0.250 / 1M $0.300 / 1M
Цена выхода $2.000 / 1M $2.500 / 1M
Общее число входных токенов 46,740 34,476
Выходные токены 3,230 1,930
Токены рассуждений 78,406 145,145
Время ответа (среднее) 47.07s 15.49s
Время ответа (макс.) 254.92s 95.48s
Время ответа (суммарно) 988.37s 325.39s

Генерация showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#18 Seed-2.0-Lite

medium
Стоимость
$0.005
Время
86.7s
Токены
2,354 tok

#24 Gemini 2.5 Flash

medium
Неверный SVG
Стоимость
$0.000
Время
274.0s
Токены
0 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Lite 8.3 10.0 75.0% 0 17.99s 942 996 7,142
Gemini 2.5 Flash 8.4 10.0 75.0% 0 6.30s 492 255 10,233
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Lite 8.0 9.8 66.7% 0 156.74s 8,247 458 31,890
Gemini 2.5 Flash 7.8 10.0 66.7% 0 41.01s 6,669 543 32,303
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Lite 10.0 10.0 100.0% 0 37.67s 16,254 506 4,299
Gemini 2.5 Flash 10.0 10.0 100.0% 0 28.44s 12,522 303 11,922
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Lite 10.0 10.0 100.0% 0 9.07s 8,562 246 1,742
Gemini 2.5 Flash 10.0 10.0 100.0% 0 4.06s 7,257 279 2,325
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Lite 5.9 7.2 55.6% 1 88.74s 843 15 23,897
Gemini 2.5 Flash 5.9 7.2 55.6% 1 37.34s 633 18 80,702
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Lite 6.7 3.6 66.7% 1 18.25s 582 304 1,620
Gemini 2.5 Flash 4.8 10.0 0.0% 0 4.86s 486 92 1,899
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Lite 10.0 10.0 100.0% 0 7.26s 834 71 1,480
Gemini 2.5 Flash 9.8 10.0 100.0% 0 2.62s 615 69 1,203
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Lite 9.0 7.9 88.9% 1 10.23s 894 403 3,285
Gemini 2.5 Flash 7.7 10.0 66.7% 0 3.18s 558 126 2,499
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Lite 10.0 10.0 100.0% 0 12.38s 9,306 222 1,011
Gemini 2.5 Flash 10.0 10.0 100.0% 0 6.20s 5,088 234 1,140
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Seed-2.0-Lite 3.0 10.0 0.0% 0 48.32s 276 9 2,040
Gemini 2.5 Flash 3.0 10.0 0.0% 0 2.76s 156 11 919

Быстрое сравнение

Сменить пару сравнения