AI BENCHY Compare

OpenAI: GPT-5.4 Mini vs Qwen3.6 Plus Preview

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-04-29

المقياس	GPT-5.4 Mini GPT-5.4 Mini medium الإصدار: 2026-03-17	Qwen3.6 Plus Preview Qwen3.6 Plus Preview medium الإصدار: 2026-04-20 متاح مجانًا

المقياس	GPT-5.4 Mini GPT-5.4 Mini medium الإصدار: 2026-03-17	Qwen3.6 Plus Preview Qwen3.6 Plus Preview medium الإصدار: 2026-04-20 متاح مجانًا
النتيجة	7.3	8.5
الترتيب	#57	#14
الموثوقية	غير متاح	غير متاح
الاتساق	7.4	10.0
اختبارات صحيحة
معدل النجاح لكل محاولة	70.4%	76.5%
اختبارات غير مستقرة	6	0
إجمالي مرات التشغيل	54	49
التكلفة لكل نتيجة	3.313	0.000
إجمالي التكلفة	$0.299	$0.000
??? ???????	$0.750 / 1M	$0.000 / 1M
??? ???????	$4.500 / 1M	$0.000 / 1M
رموز الإخراج	2,131	1,756
رموز الاستدلال	59,567	77,213
زمن الاستجابة (المتوسط)	15.22s	13.94s
زمن الاستجابة (الحد الأقصى)	102.91s	43.55s
زمن الاستجابة (الإجمالي)	273.90s	237.01s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.4 Mini	8.6	7.9	91.7%	1		4.05s	296	2,876
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		9.90s	207	7,557

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.4 Mini	10.0	10.0	100.0%	0		7.76s	423	1,548
Qwen3.6 Plus Preview	-	-	-	-	-	-	-	-

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.4 Mini	10.0	10.0	100.0%	0		17.81s	317	4,317
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		34.95s	452	13,073

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.4 Mini	10.0	10.0	100.0%	0		2.43s	234	650
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		14.95s	270	10,706

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.4 Mini	4.1	4.4	44.5%	2		65.31s	60	43,286
Qwen3.6 Plus Preview	3.0	10.0	0.0%	0		22.08s	49	26,895

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.4 Mini	4.5	10.0	0.0%	0		3.72s	150	510
Qwen3.6 Plus Preview	5.1	10.0	0.0%	0		27.05s	111	5,232

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.4 Mini	7.4	6.5	66.7%	1		2.50s	129	1,337
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		7.54s	102	5,552

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.4 Mini	6.8	7.9	55.6%	1		4.33s	271	2,449
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		6.11s	298	6,868

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.4 Mini	4.7	1.6	66.7%	1		9.62s	251	2,594
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		5.87s	267	1,330

مقارنة سريعة

تبديل زوج المقارنة

Qwen3.6 Plus Previewmediumمتاح مجانًاvsHY3 Previewhighمتاح مجانًا GPT-5.4 MinimediumvsQwen3.6 Max Previewnone Claude Sonnet 4.6nonevsGPT-5.4 Minimedium DeepSeek V4 ProhighvsGPT-5.4 Minimedium Qwen3.6 Plus Previewmediumمتاح مجانًاvsHY3 Previewlowمتاح مجانًا Gemini 3 Flash PreviewnonevsQwen3.6 Plus Previewmediumمتاح مجانًا Gemini 3 Flash PreviewlowvsQwen3.6 Plus Previewmediumمتاح مجانًا Gemini 3.1 Flash Lite PreviewlowvsQwen3.6 Plus Previewmediumمتاح مجانًا Gemma 4 31Bnoneمتاح مجانًاvsGPT-5.4 Minimedium GPT-5.4 MinimediumvsQwen3.5 Plus 2026-02-15none GPT-5.2 ChatnonevsQwen3.6 Plus Previewmediumمتاح مجانًا Gemini 3.1 Flash Lite PreviewnonevsQwen3.6 Plus Previewmediumمتاح مجانًا