AI BENCHY Compare

OpenAI: GPT-5.5 vs Qwen3.6 Plus Preview

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-04-24

المقياس	GPT-5.5 GPT-5.5 medium الإصدار: 2026-04-24	Qwen3.6 Plus Preview Qwen3.6 Plus Preview medium الإصدار: 2026-03-30 متاح مجانًا

المقياس	GPT-5.5 GPT-5.5 medium الإصدار: 2026-04-24	Qwen3.6 Plus Preview Qwen3.6 Plus Preview medium الإصدار: 2026-03-30 متاح مجانًا
النتيجة	9.0	8.5
الترتيب	#5	#11
الموثوقية	غير متاح	غير متاح
الاتساق	9.2	10.0
اختبارات صحيحة
معدل النجاح لكل محاولة	87.0%	76.5%
اختبارات غير مستقرة	2	0
إجمالي مرات التشغيل	54	49
التكلفة لكل نتيجة	19.226	0.000
إجمالي التكلفة	$2.884	$0.000
??? ???????	$5.000 / 1M	$0.000 / 1M
??? ???????	$30.000 / 1M	$0.000 / 1M
رموز الإخراج	1,920	1,756
رموز الاستدلال	89,632	77,213
زمن الاستجابة (المتوسط)	32.75s	13.94s
زمن الاستجابة (الحد الأقصى)	332.10s	43.55s
زمن الاستجابة (الإجمالي)	589.59s	237.01s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		4.66s	250	1,335
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		9.90s	207	7,557

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		9.09s	318	1,391
Qwen3.6 Plus Preview	-	-	-	-	-	-	-	-

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		19.29s	312	2,841
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		34.95s	452	13,073

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		4.18s	234	593
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		14.95s	270	10,706

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.5	5.3	7.2	44.4%	1		164.14s	67	79,625
Qwen3.6 Plus Preview	3.0	10.0	0.0%	0		22.08s	49	26,895

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		4.16s	138	223
Qwen3.6 Plus Preview	5.1	10.0	0.0%	0		27.05s	111	5,232

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		3.36s	93	538
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		7.54s	102	5,552

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.5	8.6	7.9	77.8%	1		6.78s	250	2,254
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		6.11s	298	6,868

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		10.57s	258	832
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		5.87s	267	1,330

مقارنة سريعة

تبديل زوج المقارنة

Qwen3.6 Plus Previewmediumمتاح مجانًاvsHY3 Previewhighمتاح مجانًا Gemini 3 Flash PreviewlowvsGPT-5.5medium Claude Opus 4.7nonevsGPT-5.5medium DeepSeek V4 ProhighvsQwen3.6 Plus Previewmediumمتاح مجانًا Qwen3.6 Plus Previewmediumمتاح مجانًاvsHY3 Previewlowمتاح مجانًا Gemini 3 Flash PreviewnonevsQwen3.6 Plus Previewmediumمتاح مجانًا Gemini 3 Flash PreviewlowvsQwen3.6 Plus Previewmediumمتاح مجانًا Gemini 3.1 Flash Lite PreviewlowvsQwen3.6 Plus Previewmediumمتاح مجانًا GPT-5.5mediumvsHY3 Previewhighمتاح مجانًا GPT-5.2 ChatnonevsQwen3.6 Plus Previewmediumمتاح مجانًا Gemini 3.1 Flash Lite PreviewnonevsQwen3.6 Plus Previewmediumمتاح مجانًا DeepSeek V4 FlashhighvsQwen3.6 Plus Previewmediumمتاح مجانًا