AI BENCHY Compare

ByteDance Seed: Seed-2.0-Lite vs Qwen: Qwen3.6 Max Preview

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-04-27

المقياس	Seed-2.0-Lite Seed-2.0-Lite medium الإصدار: 2026-02-14	Qwen3.6 Max Preview Qwen3.6 Max Preview medium الإصدار: 2026-04-20

المقياس	Seed-2.0-Lite Seed-2.0-Lite medium الإصدار: 2026-02-14	Qwen3.6 Max Preview Qwen3.6 Max Preview medium الإصدار: 2026-04-20
النتيجة	8.6	8.8
الترتيب	#10	#8
الموثوقية	غير متاح	10.0
الاتساق	8.8	9.5
اختبارات صحيحة
معدل النجاح لكل محاولة	83.3%	85.2%
اختبارات غير مستقرة	3	1
إجمالي مرات التشغيل	54	54
التكلفة لكل نتيجة	0.926	5.486
إجمالي التكلفة	$0.121	$0.823
??? ???????	$0.250 / 1M	$1.300 / 1M
??? ???????	$2.000 / 1M	$7.800 / 1M
رموز الإخراج	3,257	2,158
رموز الاستدلال	52,042	97,495
زمن الاستجابة (المتوسط)	30.37s	48.31s
زمن الاستجابة (الحد الأقصى)	168.71s	186.74s
زمن الاستجابة (الإجمالي)	546.72s	869.64s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Seed-2.0-Lite	8.3	10.0	75.0%	0		17.99s	996	7,142
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		22.13s	228	10,075

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Seed-2.0-Lite	10.0	10.0	100.0%	0		74.49s	436	7,319
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		117.87s	368	13,790

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Seed-2.0-Lite	10.0	10.0	100.0%	0		37.67s	506	4,299
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		121.49s	390	14,575

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Seed-2.0-Lite	10.0	10.0	100.0%	0		9.07s	246	1,742
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		41.15s	270	10,106

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Seed-2.0-Lite	5.9	7.2	55.6%	1		88.74s	15	23,897
Qwen3.6 Max Preview	2.9	7.2	11.1%	1		95.91s	60	30,371

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Seed-2.0-Lite	6.7	3.6	66.7%	1		18.25s	304	1,620
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		32.24s	129	3,510

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Seed-2.0-Lite	10.0	10.0	100.0%	0		7.26s	71	1,480
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		24.31s	103	5,848

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Seed-2.0-Lite	9.0	7.9	88.9%	1		11.03s	461	3,532
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		24.19s	301	7,649

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Seed-2.0-Lite	10.0	10.0	100.0%	0		12.38s	222	1,011
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		18.32s	309	1,571

مقارنة سريعة

تبديل زوج المقارنة

Gemini 3 Flash PreviewlowvsQwen3.6 Max Previewmedium Seed-2.0-LitemediumvsHY3 Previewhighمتاح مجانًا GPT-5.5lowvsQwen3.6 Max Previewmedium Seed-2.0-LitemediumvsGemini 3 Flash Previewlow Qwen3.6 Max PreviewmediumvsHY3 Previewhighمتاح مجانًا Claude Opus 4.7nonevsQwen3.6 Max Previewmedium Seed-2.0-LitemediumvsGPT-5.5low Seed-2.0-LitemediumvsHY3 Previewlowمتاح مجانًا Seed-2.0-LitemediumvsGemini 3 Flash Previewnone Seed-2.0-LitemediumvsGemini 3.1 Flash Lite Previewlow Claude Opus 4.7nonevsSeed-2.0-Litemedium Seed-2.0-LitemediumvsGPT-5.2 Chatnone