قارن الرسوم البيانية المنهجية

اللغة:

❤️ Made by XCS

AI BENCHY Compare

OpenAI: GPT-5.4 vs Qwen: Qwen3.5 Plus 2026-02-15

قارن:

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-03-06

المقياس	OpenAI: GPT-5.4 medium الإصدار: 2026-03-05	Qwen: Qwen3.5 Plus 2026-02-15 none الإصدار: 2026-02-15
الترتيب	#9	#29
متوسط الدرجة	8.0	6.2
الاتساق	8.5	9.6
التكلفة لكل نتيجة	6.601	0.172
إجمالي التكلفة	$0.793	$0.016
اختبارات صحيحة
معدل النجاح لكل محاولة	83.3%	58.3%
اختبارات غير مستقرة	3	1
إجمالي مرات التشغيل	48 (16 x 3)	48 (16 x 3)
رموز الإخراج	1,756	2,015
رموز الاستدلال	46,642	0
زمن الاستجابة (المتوسط)	20.05s	2.65s
زمن الاستجابة (الحد الأقصى)	100.41s	6.65s
زمن الاستجابة (الإجمالي)	320.87s	26.52s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

متوسط الدرجة vs زمن الاستجابة (المتوسط)

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		5.02s	216	1,466
Qwen: Qwen3.5 Plus 2026-02-15	4.0	10.0	33.3%	0		2.74s	514	0

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		20.57s	301	3,543
Qwen: Qwen3.5 Plus 2026-02-15	10.0	10.0	0.0%	0		6.65s	314	0

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
OpenAI: GPT-5.4	9.9	10.0	100.0%	0		5.32s	234	804
Qwen: Qwen3.5 Plus 2026-02-15	9.9	10.0	100.0%	0		1.89s	243	0

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
OpenAI: GPT-5.4	4.0	7.2	44.4%	1		74.27s	61	34,748
Qwen: Qwen3.5 Plus 2026-02-15	4.0	10.0	33.3%	0		1.17s	17	0

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
OpenAI: GPT-5.4	5.0	3.1	33.3%	1		4.92s	145	321
Qwen: Qwen3.5 Plus 2026-02-15	4.0	3.0	33.3%	1		2.26s	117	0

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		3.11s	93	897
Qwen: Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		1.67s	72	0

Puzzle Solving	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
OpenAI: GPT-5.4	7.0	7.2	88.9%	1		9.13s	442	3,832
Qwen: Qwen3.5 Plus 2026-02-15	7.0	10.0	66.7%	0		2.82s	516	0

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		13.28s	264	1,031
Qwen: Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		3.33s	222	0

مقارنة سريعة

تبديل زوج المقارنة

Qwen3.5 Plus 2026-02-15nonevsGrok 4.1 Fastmedium Gemini 3.1 Flash Lite PreviewhighvsGPT-5.4medium Gemini 3 Flash PreviewlowvsGPT-5.4medium Kimi K2.5mediumvsQwen3.5 Plus 2026-02-15none GPT-5 MinimediumvsQwen3.5 Plus 2026-02-15none GPT-5.2mediumvsQwen3.5 Plus 2026-02-15none Claude Opus 4.6mediumvsQwen3.5 Plus 2026-02-15none GPT-5 NanomediumvsQwen3.5 Plus 2026-02-15none Seed-2.0-MinimediumvsQwen3.5 Plus 2026-02-15none Gemini 3.1 Flash Lite PreviewlowvsGPT-5.4medium Gemini 3 Flash PreviewnonevsGPT-5.4medium Mercury 2mediumvsQwen3.5 Plus 2026-02-15none