AI BENCHY Compare

ByteDance Seed: Seed-2.0-Lite vs Z.ai: GLM 5 Turbo

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-08

Метрика	Seed-2.0-Lite Seed-2.0-Lite medium Релиз: 2026-02-14	GLM 5 Turbo GLM 5 Turbo medium Релиз: 2026-03-15

Метрика	Seed-2.0-Lite Seed-2.0-Lite medium Релиз: 2026-02-14	GLM 5 Turbo GLM 5 Turbo medium Релиз: 2026-03-15
Оценка	8.3	8.1
Ранг	#11	#20
Надежность	10.0	6.7
Стабильность	8.9	8.4
Тестов верно
Доля успешных попыток	79.0%	77.2%
Нестабильные тесты	3	4
Всего запусков	57	57
Стоимость за результат	0.958	1.438
Общая стоимость	$0.125	$0.187
???? ?????	$0.250 / 1M	$1.200 / 1M
???? ??????	$2.000 / 1M	$4.000 / 1M
Выходные токены	3,266	12,217
Токены рассуждений	54,082	40,252
Время ответа (среднее)	31.32s	18.85s
Время ответа (макс.)	168.71s	194.23s
Время ответа (суммарно)	595.04s	358.15s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	8.3	10.0	75.0%	0		17.99s	996	7,142
GLM 5 Turbo	10.0	10.0	100.0%	0		4.82s	362	3,137

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	10.0	10.0	100.0%	0		74.49s	436	7,319
GLM 5 Turbo	10.0	10.0	100.0%	0		12.26s	332	3,301

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	10.0	10.0	100.0%	0		37.67s	506	4,299
GLM 5 Turbo	10.0	10.0	100.0%	0		13.88s	390	2,037

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	10.0	10.0	100.0%	0		9.07s	246	1,742
GLM 5 Turbo	10.0	10.0	100.0%	0		6.19s	577	3,632

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	5.9	7.2	55.6%	1		88.74s	15	23,897
GLM 5 Turbo	2.9	4.4	22.2%	2		71.07s	9,665	19,279

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	6.7	3.6	66.7%	1		18.25s	304	1,620
GLM 5 Turbo	6.1	3.1	66.7%	1		10.05s	60	2,216

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	10.0	10.0	100.0%	0		7.26s	71	1,480
GLM 5 Turbo	10.0	10.0	100.0%	0		5.38s	255	2,183

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	9.0	7.9	88.9%	1		11.03s	461	3,532
GLM 5 Turbo	8.7	7.9	77.8%	1		5.44s	315	2,702

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	10.0	10.0	100.0%	0		12.38s	222	1,011
GLM 5 Turbo	10.0	10.0	100.0%	0		9.84s	241	446

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	3.0	10.0	0.0%	0		48.32s	9	2,040
GLM 5 Turbo	3.0	10.0	0.0%	0		40.17s	20	1,319

Быстрое сравнение

Сменить пару сравнения

Gemini 3 Flash PreviewnonevsGLM 5 Turbomedium Gemini 3.1 Flash Lite PreviewlowvsGLM 5 Turbomedium Gemini 3.1 Flash Lite PreviewnonevsGLM 5 Turbomedium Seed-2.0-LitemediumvsGemini 3 Flash Previewnone GPT-5.2 ChatnonevsGLM 5 Turbomedium Seed-2.0-LitemediumvsGemini 3.1 Flash Lite Previewlow Gemini 3.1 Flash LitelowvsGLM 5 Turbomedium GPT-5.3 ChatnonevsGLM 5 Turbomedium DeepSeek V4 FlashhighvsGLM 5 Turbomedium Seed-2.0-LitemediumvsGemini 3 Flash Previewlow Seed-2.0-LitemediumvsGPT-5.5low Seed-2.0-LitemediumvsGemini 3.1 Flash Lite Previewnone