AI BENCHY Compare

OpenAI: GPT-5.5 vs Qwen: Qwen3.6 27B

الملخص

مقارنة benchmark بين GPT-5.5 و Qwen3.6 27B: يتقدم Qwen3.6 27B في متوسط النتيجة بـ 6.8 مقابل 6.4. لدى GPT-5.5 تكلفة benchmark أقل عند $0.231 مقابل $0.336. GPT-5.5 أسرع عند 1.89s مقابل 59.71s، مع معدلات نجاح 54.0% مقابل 60.3%.

النموذج الموصى به: GPT-5.5 - Its score stays close to the best score here (6.4 vs 6.8), while responding about 31.6x faster than Qwen3.6 27B.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-06-10

المقياس	GPT-5.5 GPT-5.5 none الإصدار: 2026-04-24	Qwen3.6 27B Qwen3.6 27B medium الإصدار: 2026-04-20

المقياس	GPT-5.5 GPT-5.5 none الإصدار: 2026-04-24	Qwen3.6 27B Qwen3.6 27B medium الإصدار: 2026-04-20
النتيجة	6.4	6.8
الترتيب	#92	#79
الموثوقية	10.0	10.0
الاتساق	8.8	8.2
اختبارات صحيحة
معدل النجاح لكل محاولة	54.0%	60.3%
اختبارات غير مستقرة	3	5
إجمالي مرات التشغيل	63	63
التكلفة لكل نتيجة	2.302	3.361
إجمالي التكلفة	$0.231	$0.336
سعر الإدخال	$5.000 / 1M	$0.290 / 1M
سعر الإخراج	$30.000 / 1M	$2.400 / 1M
إجمالي رموز الإدخال	34,212	39,376
رموز الإخراج	1,971	16,189
رموز الاستدلال	0	122,521
زمن الاستجابة (المتوسط)	1.89s	59.71s
زمن الاستجابة (الحد الأقصى)	5.56s	168.22s
زمن الاستجابة (الإجمالي)	39.64s	1254.01s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#92 GPT-5.5

none

Cost: $0.090
Time: 54.3s
Tokens: 3,063 tok

#79 Qwen3.6 27B

medium

Cost: $0.009
Time: 39.6s
Tokens: 3,090 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	6.9	7.9	66.7%	1		1.31s	606	213	0
Qwen3.6 27B	8.3	10.0	75.0%	0		12.62s	453	582	4,311

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	5.5	10.0	33.3%	0		1.35s	7,305	462	0
Qwen3.6 27B	7.7	10.0	66.7%	0		142.99s	5,051	7,968	43,367

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	3.0	10.0	0.0%	0		5.56s	11,019	300	0
Qwen3.6 27B	7.0	3.7	66.7%	1		83.07s	15,104	2,088	14,689

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		1.18s	7,140	222	0
Qwen3.6 27B	3.5	1.4	50.0%	2		37.30s	7,778	568	9,404

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	2.9	7.2	11.1%	1		1.31s	723	52	0
Qwen3.6 27B	2.9	7.2	11.1%	1		73.38s	662	3,510	20,352

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		3.41s	477	124	0
Qwen3.6 27B	6.5	3.4	66.7%	1		39.53s	516	81	3,045

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	6.2	5.8	66.7%	1		1.15s	660	81	0
Qwen3.6 27B	10.0	10.0	100.0%	0		37.96s	699	346	6,548

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	7.7	10.0	66.7%	0		1.29s	642	252	0
Qwen3.6 27B	7.7	10.0	66.7%	0		61.14s	696	255	12,044

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		3.90s	5,445	247	0
Qwen3.6 27B	10.0	10.0	100.0%	0		16.88s	8,213	390	2,954

معلومات عامة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	3.0	10.0	0.0%	0		5.01s	195	18	0
Qwen3.6 27B	3.0	10.0	0.0%	0		80.99s	204	401	5,807

مقارنة سريعة

تبديل زوج المقارنة

Gemini 3.1 Flash LiteminimalvsGPT-5.5none Claude Sonnet 4.6nonevsQwen3.6 27Bmedium Gemma 4 31Bnoneمتاح مجانًاvsQwen3.6 27Bmedium Mercury 2mediumvsGPT-5.5none Qwen3.6 27BmediumvsStep 3.7 Flashhigh Claude Opus 4.8nonevsQwen3.6 27Bmedium Gemini 3.1 Flash LiteminimalvsQwen3.6 27Bmedium Gemini 3.1 Flash LitenonevsQwen3.6 27Bmedium DeepSeek V4 ProhighvsGPT-5.5none Kimi K2.5mediumvsGPT-5.5none GPT-5.3 ChatnonevsQwen3.6 27Bmedium Ring-2.6-1TmediumvsGPT-5.5none