Навигация
AI BENCHY
Your ad here

AI BENCHY Compare

ByteDance Seed: Seed-2.0-Lite vs Google: Gemini 3.1 Pro Preview

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-03-12

Метрика Seed-2.0-Lite Seed-2.0-Lite medium Релиз: 2026-02-14 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Релиз: 2026-02-19
Ранг #3 #2
Средний балл 8.5 9.4
Стабильность 8.7 10.0
Стоимость за результат 0.870 3.417
Общая стоимость $0.105 $0.513
Тестов верно
Доля успешных попыток 87.5% 93.8%
Нестабильные тесты 3 0
Всего запусков 48 48
Выходные токены 2,815 1,521
Токены рассуждений 44,618 35,656
Время ответа (среднее) 29.39s 16.60s
Время ответа (макс.) 168.71s 40.61s
Время ответа (суммарно) 470.29s 149.36s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Средний балл vs Время ответа (среднее)

Общее число выходных токенов

Средний балл vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Seed-2.0-Lite 10.0 10.0 100.0% 0 23.34s 990 7,037
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 9.52s 106 2,533
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Seed-2.0-Lite 10.0 10.0 100.0% 0 37.67s 506 4,299
Gemini 3.1 Pro Preview 9.0 10.0 100.0% 0 40.61s 432 9,281
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Seed-2.0-Lite 9.9 10.0 100.0% 0 9.07s 246 1,742
Gemini 3.1 Pro Preview 9.9 10.0 100.0% 0 7.72s 279 3,904
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Seed-2.0-Lite 4.0 7.2 55.6% 1 88.74s 15 23,897
Gemini 3.1 Pro Preview 7.0 10.0 66.7% 0 32.73s 18 12,424
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Seed-2.0-Lite 7.0 3.6 66.7% 1 18.25s 304 1,620
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 11.77s 108 1,179
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Seed-2.0-Lite 10.0 10.0 100.0% 0 7.26s 71 1,480
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 9.56s 72 2,236
Puzzle Solving Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Seed-2.0-Lite 9.3 7.9 88.9% 1 11.03s 461 3,532
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 7.15s 232 3,117
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Seed-2.0-Lite 10.0 10.0 100.0% 0 12.38s 222 1,011
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 23.15s 274 982

Быстрое сравнение

Сменить пару сравнения