AI BENCHY Compare

OpenAI: GPT-5.3 Chat vs Qwen: Qwen3.5 Plus 2026-02-15

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-03-12

المقياس	GPT-5.3 Chat GPT-5.3 Chat none الإصدار: 2026-03-03	Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 medium الإصدار: 2026-02-15

المقياس	GPT-5.3 Chat GPT-5.3 Chat none الإصدار: 2026-03-03	Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 medium الإصدار: 2026-02-15
الترتيب	#20	#5
متوسط الدرجة	7.3	8.3
الاتساق	8.5	9.5
التكلفة لكل نتيجة	3.163	1.264
إجمالي التكلفة	$0.317	$0.165
اختبارات صحيحة
معدل النجاح لكل محاولة	70.8%	85.4%
اختبارات غير مستقرة	3	1
إجمالي مرات التشغيل	48	48
رموز الإخراج	19,272	1,735
رموز الاستدلال	0	77,212
زمن الاستجابة (المتوسط)	5.96s	34.45s
زمن الاستجابة (الحد الأقصى)	18.33s	79.86s
زمن الاستجابة (الإجمالي)	95.30s	310.09s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

متوسط الدرجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

متوسط الدرجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.3 Chat	7.3	7.5	77.8%	1		4.72s	3,091	0
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		10.37s	186	5,926

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.3 Chat	10.0	10.0	100.0%	0		11.96s	2,614	0
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		46.85s	421	7,906

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.3 Chat	9.9	10.0	100.0%	0		2.21s	942	0
Qwen3.5 Plus 2026-02-15	9.9	10.0	100.0%	0		46.91s	270	14,916

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.3 Chat	10.0	4.4	33.3%	2		13.01s	8,264	0
Qwen3.5 Plus 2026-02-15	4.0	10.0	33.3%	0		17.50s	35	16,680

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.3 Chat	4.0	10.0	0.0%	0		1.99s	319	0
Qwen3.5 Plus 2026-02-15	10.0	1.6	66.7%	1		79.86s	73	8,675

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.3 Chat	9.0	10.0	50.0%	0		3.29s	1,455	0
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		31.93s	101	7,704

Puzzle Solving	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.93s	1,726	0
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		34.57s	340	14,496

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
GPT-5.3 Chat	10.0	10.0	100.0%	0		8.36s	861	0
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		7.54s	309	909

مقارنة سريعة

تبديل زوج المقارنة

DeepSeek V3.2mediumvsGPT-5.3 Chatnone Gemini 3.1 Flash Lite PreviewlowvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsMiMo-V2-Flashmedium Gemini 2.5 FlashmediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsGLM 5medium GPT-5.3 ChatnonevsStep 3.5 Flashmediumمتاح مجانًا Gemini 3 Flash PreviewlowvsQwen3.5 Plus 2026-02-15medium Gemini 3.1 Flash Lite PreviewmediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsGrok 4.20 Betamedium Seed-2.0-MinimediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsQwen3.5-Flashmedium Claude Sonnet 4.6mediumvsGPT-5.3 Chatnone