AI BENCHY Compare

ByteDance Seed: Seed-2.0-Lite vs Qwen: Qwen3.6 Max Preview

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-04-27

Метрика	Seed-2.0-Lite Seed-2.0-Lite medium Релиз: 2026-02-14	Qwen3.6 Max Preview Qwen3.6 Max Preview medium Релиз: 2026-04-20

Метрика	Seed-2.0-Lite Seed-2.0-Lite medium Релиз: 2026-02-14	Qwen3.6 Max Preview Qwen3.6 Max Preview medium Релиз: 2026-04-20
Оценка	8.6	8.8
Ранг	#10	#8
Надежность	Н/Д	10.0
Стабильность	8.8	9.5
Тестов верно
Доля успешных попыток	83.3%	85.2%
Нестабильные тесты	3	1
Всего запусков	54	54
Стоимость за результат	0.926	5.486
Общая стоимость	$0.121	$0.823
???? ?????	$0.250 / 1M	$1.300 / 1M
???? ??????	$2.000 / 1M	$7.800 / 1M
Выходные токены	3,257	2,158
Токены рассуждений	52,042	97,495
Время ответа (среднее)	30.37s	48.31s
Время ответа (макс.)	168.71s	186.74s
Время ответа (суммарно)	546.72s	869.64s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	8.3	10.0	75.0%	0		17.99s	996	7,142
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		22.13s	228	10,075

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	10.0	10.0	100.0%	0		74.49s	436	7,319
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		117.87s	368	13,790

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	10.0	10.0	100.0%	0		37.67s	506	4,299
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		121.49s	390	14,575

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	10.0	10.0	100.0%	0		9.07s	246	1,742
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		41.15s	270	10,106

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	5.9	7.2	55.6%	1		88.74s	15	23,897
Qwen3.6 Max Preview	2.9	7.2	11.1%	1		95.91s	60	30,371

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	6.7	3.6	66.7%	1		18.25s	304	1,620
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		32.24s	129	3,510

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	10.0	10.0	100.0%	0		7.26s	71	1,480
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		24.31s	103	5,848

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	9.0	7.9	88.9%	1		11.03s	461	3,532
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		24.19s	301	7,649

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Seed-2.0-Lite	10.0	10.0	100.0%	0		12.38s	222	1,011
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		18.32s	309	1,571

Быстрое сравнение

Сменить пару сравнения

Gemini 3 Flash PreviewlowvsQwen3.6 Max Previewmedium Seed-2.0-LitemediumvsHY3 PreviewhighБесплатно доступно GPT-5.5lowvsQwen3.6 Max Previewmedium Seed-2.0-LitemediumvsGemini 3 Flash Previewlow Qwen3.6 Max PreviewmediumvsHY3 PreviewhighБесплатно доступно Claude Opus 4.7nonevsQwen3.6 Max Previewmedium Seed-2.0-LitemediumvsGPT-5.5low Seed-2.0-LitemediumvsHY3 PreviewlowБесплатно доступно Seed-2.0-LitemediumvsGemini 3 Flash Previewnone Seed-2.0-LitemediumvsGemini 3.1 Flash Lite Previewlow Claude Opus 4.7nonevsSeed-2.0-Litemedium Seed-2.0-LitemediumvsGPT-5.2 Chatnone