AI BENCHY Compare

ByteDance Seed: Seed-2.0-Lite vs Google: Gemini 3.5 Flash

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-19

Метрика	Seed-2.0-Lite Seed-2.0-Lite medium Релиз: 2026-02-14	Gemini 3.5 Flash Gemini 3.5 Flash minimal Релиз: 2026-05-19

Метрика	Seed-2.0-Lite Seed-2.0-Lite medium Релиз: 2026-02-14	Gemini 3.5 Flash Gemini 3.5 Flash minimal Релиз: 2026-05-19
Оценка	8.3	8.1
Ранг	#15	#21
Надежность	10.0	10.0
Стабильность	8.9	9.6
Тестов верно
Доля успешных попыток	79.0%	75.4%
Нестабильные тесты	3	1
Всего запусков	57	57
Стоимость за результат	0.958	0.494
Общая стоимость	$0.125	$0.070
???? ?????	$0.250 / 1M	$1.500 / 1M
???? ??????	$2.000 / 1M	$9.000 / 1M
Выходные токены	3,266	2,262
Токены рассуждений	54,082	0
Время ответа (среднее)	31.32s	1.37s
Время ответа (макс.)	168.71s	3.56s
Время ответа (суммарно)	595.04s	26.04s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	8.3	10.0	75.0%	0		17.99s	996	7,142
Gemini 3.5 Flash	6.5	10.0	50.0%	0		892ms	405	0

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	10.0	10.0	100.0%	0		74.49s	436	7,319
Gemini 3.5 Flash	10.0	10.0	100.0%	0		1.28s	441	0

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	10.0	10.0	100.0%	0		37.67s	506	4,299
Gemini 3.5 Flash	3.0	10.0	0.0%	0		3.56s	404	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	10.0	10.0	100.0%	0		9.07s	246	1,742
Gemini 3.5 Flash	10.0	10.0	100.0%	0		1.66s	279	0

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	5.9	7.2	55.6%	1		88.74s	15	23,897
Gemini 3.5 Flash	10.0	10.0	100.0%	0		899ms	12	0

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	6.7	3.6	66.7%	1		18.25s	304	1,620
Gemini 3.5 Flash	10.0	10.0	100.0%	0		922ms	117	0

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	10.0	10.0	100.0%	0		7.26s	71	1,480
Gemini 3.5 Flash	6.4	5.8	66.7%	1		893ms	76	0

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	9.0	7.9	88.9%	1		11.03s	461	3,532
Gemini 3.5 Flash	10.0	10.0	100.0%	0		1.45s	282	0

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	10.0	10.0	100.0%	0		12.38s	222	1,011
Gemini 3.5 Flash	10.0	10.0	100.0%	0		2.79s	234	0

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	3.0	10.0	0.0%	0		48.32s	9	2,040
Gemini 3.5 Flash	3.0	10.0	0.0%	0		1.76s	12	0

Быстрое сравнение

Сменить пару сравнения

Gemini 3.5 FlashminimalvsQwen3.5-27Bmedium Gemini 3.5 FlashminimalvsMiMo-V2.5-Promedium Gemini 3.5 FlashminimalvsGLM 5medium Gemini 3.5 FlashminimalvsGLM 5 Turbomedium Gemini 3.5 FlashminimalvsQwen3.6 35B A3Bmedium Gemini 3.5 FlashminimalvsGPT-5.3-Codexmedium Gemini 3.5 FlashminimalvsQwen3.5 Plus 2026-02-15medium Gemini 3.5 FlashminimalvsGrok 4.3medium Gemini 3.5 FlashminimalvsGPT-5.4medium Gemini 3.5 FlashminimalvsQwen3.6 Plusmedium Gemini 3.5 FlashminimalvsQwen3.5-122B-A10Bmedium Gemini 3.5 FlashminimalvsMiMo-V2.5medium