AI BENCHY Compare

OpenAI: GPT-5.5 vs Grok 4.20 Multi Agent Beta

الملخص

مقارنة benchmark بين GPT-5.5 و Grok 4.20 Multi Agent Beta: يتقدم GPT-5.5 في متوسط النتيجة بـ 9.3 مقابل 5.0. لدى GPT-5.5 تكلفة benchmark أقل عند $0.907 مقابل $5.599. Grok 4.20 Multi Agent Beta أسرع عند 9.69s مقابل 9.76s، مع معدلات نجاح 85.7% مقابل 50.8%.

النموذج الموصى به: GPT-5.5 - It has the best score here (9.3), while costing about 6.2x less than Grok 4.20 Multi Agent Beta.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-06-18

المقياس	GPT-5.5 GPT-5.5 low الإصدار: 2026-04-24	Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium الإصدار: 2026-03-12

المقياس	GPT-5.5 GPT-5.5 low الإصدار: 2026-04-24	Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium الإصدار: 2026-03-12
النتيجة	9.3	5.0
الترتيب	#4	#136
الموثوقية	10.0	غير متاح
الاتساق	10.0	6.7
اختبارات صحيحة
معدل النجاح لكل محاولة	85.7%	50.8%
اختبارات غير مستقرة	0	5
إجمالي مرات التشغيل	63	52
التكلفة لكل نتيجة	5.035	62.923
إجمالي التكلفة	$0.907	$5.599
سعر الإدخال	$5.000 / 1M	$4.235 / 1M
سعر الإخراج	$30.000 / 1M	$4.235 / 1M
إجمالي رموز الإدخال	34,209	721,952
رموز الإخراج	2,046	294,668
رموز الاستدلال	22,460	305,374
زمن الاستجابة (المتوسط)	9.76s	9.69s
زمن الاستجابة (الحد الأقصى)	56.19s	35.28s
زمن الاستجابة (الإجمالي)	204.92s	155.07s

عرض إنشاء

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#4 GPT-5.5

low

التكلفة: $0.068
الوقت: 37.0s
الرموز: 2,339 tok

#136 Grok 4.20 Multi Agent Beta

medium

التكلفة: $0.261
الوقت: 123.4s
الرموز: 199,344 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		4.41s	606	238	1,020
Grok 4.20 Multi Agent Beta	6.9	5.8	75.0%	2		3.46s	90,925	33,706	33,077

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		15.04s	7,302	423	6,402
Grok 4.20 Multi Agent Beta	3.3	3.3	33.3%	0		27.11s	13,212	86	13,141

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		9.56s	11,019	303	717
Grok 4.20 Multi Agent Beta	3.0	10.0	0.0%	0		0ms	0	0	0

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		3.28s	7,140	228	157
Grok 4.20 Multi Agent Beta	10.0	10.0	100.0%	0		5.54s	97,232	25,306	25,051

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	5.3	10.0	33.3%	0		28.05s	723	69	11,609
Grok 4.20 Multi Agent Beta	2.9	7.2	11.1%	1		24.67s	328,253	164,609	163,647

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		5.17s	477	133	245
Grok 4.20 Multi Agent Beta	5.8	2.8	66.7%	1		6.40s	41,387	15,848	15,746

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	9.9	10.0	100.0%	0		3.74s	660	93	415
Grok 4.20 Multi Agent Beta	9.8	10.0	100.0%	0		3.52s	43,923	19,752	19,617

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		4.74s	642	279	954
Grok 4.20 Multi Agent Beta	6.7	7.9	55.6%	1		5.19s	107,020	35,361	35,095

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	10.0	10.0	100.0%	0		4.96s	5,445	250	101
Grok 4.20 Multi Agent Beta	3.0	10.0	0.0%	0		0ms	0	0	0

معلومات عامة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
GPT-5.5	3.0	10.0	0.0%	0		10.06s	195	30	840
Grok 4.20 Multi Agent Beta	0.0	0.0	0.0%	0		0ms	0	0	0

مقارنة سريعة

تبديل زوج المقارنة

GPT-5.5lowvsQwen3.7 Maxmedium Claude Fable 5mediumvsGPT-5.5low Gemini 3.1 Pro PreviewmediumvsGPT-5.5low Gemini 3.5 FlashmediumvsGPT-5.5low Gemini 3 Flash PreviewmediumvsGPT-5.5low GPT-5.5lowvsQwen3.6 Max Previewmedium Claude Opus 4.8mediumvsGPT-5.5low Gemini 3.5 FlashhighvsGPT-5.5low Claude Opus 4.7mediumvsGPT-5.5low GPT-5.5lowvsGLM 5.2medium GPT-5.5lowvsGLM 5medium Seed-2.0-LitemediumvsGPT-5.5low