AI BENCHY Compare

xAI: Grok 4.20 vs Z.ai: GLM 5.2

الملخص

مقارنة benchmark بين Grok 4.20 و GLM 5.2: يتقدم Grok 4.20 في متوسط النتيجة بـ 7.3 مقابل 7.1. لدى GLM 5.2 تكلفة benchmark أقل عند $0.076 مقابل $0.609. GLM 5.2 أسرع عند 6.34s مقابل 27.68s، مع معدلات نجاح 63.5% مقابل 60.3%.

النموذج الموصى به: GLM 5.2 - Its score stays close to the best score here (7.1 vs 7.3), while costing about 8.1x less than Grok 4.20.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-06-17

المقياس	Grok 4.20 Grok 4.20 medium الإصدار: 2026-03-31	GLM 5.2 GLM 5.2 none الإصدار: 2026-06-17

المقياس	Grok 4.20 Grok 4.20 medium الإصدار: 2026-03-31	GLM 5.2 GLM 5.2 none الإصدار: 2026-06-17
النتيجة	7.3	7.1
الترتيب	#53	#61
الموثوقية	10.0	9.9
الاتساق	8.8	9.6
اختبارات صحيحة
معدل النجاح لكل محاولة	63.5%	60.3%
اختبارات غير مستقرة	3	1
إجمالي مرات التشغيل	63	63
التكلفة لكل نتيجة	8.309	0.628
إجمالي التكلفة	$0.609	$0.076
سعر الإدخال	$1.250 / 1M	$1.400 / 1M
سعر الإخراج	$2.500 / 1M	$4.400 / 1M
إجمالي رموز الإدخال	44,433	38,671
رموز الإخراج	1,819	4,817
رموز الاستدلال	219,524	0
زمن الاستجابة (المتوسط)	27.68s	6.34s
زمن الاستجابة (الحد الأقصى)	199.66s	20.69s
زمن الاستجابة (الإجمالي)	581.26s	133.19s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#53 xAI: Grok 4.20

medium

Cost: $0.041
Time: 110.3s
Tokens: 16,336 tok

#61 GLM 5.2

none

Invalid SVG

Cost: $0.033
Time: 87.7s
Tokens: 7,455 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Grok 4.20	8.2	7.9	83.3%	1		3.95s	2,010	287	8,312
GLM 5.2	8.3	10.0	75.0%	0		3.70s	567	313	0

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Grok 4.20	6.3	6.6	55.6%	1		109.93s	8,307	268	103,150
GLM 5.2	3.7	9.5	0.0%	0		7.55s	7,263	1,958	0

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Grok 4.20	10.0	10.0	100.0%	0		17.40s	12,909	232	9,556
GLM 5.2	10.0	10.0	100.0%	0		20.69s	14,296	1,489	0

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Grok 4.20	10.0	10.0	100.0%	0		4.17s	7,761	180	5,333
GLM 5.2	10.0	10.0	100.0%	0		7.17s	7,113	204	0

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Grok 4.20	5.3	10.0	33.3%	0		27.03s	1,764	375	49,339
GLM 5.2	5.3	10.0	33.3%	0		6.50s	696	27	0

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Grok 4.20	3.9	2.6	33.3%	1		24.48s	825	65	6,440
GLM 5.2	6.1	3.1	66.7%	1		4.42s	480	82	0

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Grok 4.20	9.8	10.0	100.0%	0		4.26s	1,362	57	6,419
GLM 5.2	9.8	10.0	100.0%	0		3.84s	642	66	0

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Grok 4.20	7.7	10.0	66.7%	0		6.22s	1,689	149	7,913
GLM 5.2	7.7	10.0	66.7%	0		3.31s	618	265	0

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Grok 4.20	3.0	10.0	0.0%	0		13.68s	7,275	197	6,620
GLM 5.2	10.0	10.0	100.0%	0		15.76s	6,807	400	0

معلومات عامة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Grok 4.20	3.0	10.0	0.0%	0		63.48s	531	9	16,442
GLM 5.2	3.0	10.0	0.0%	0		3.41s	189	13	0

مقارنة سريعة

تبديل زوج المقارنة

Gemini 3 Flash PreviewlowvsGrok 4.20medium Gemma 4 26B A4Bmediumمتاح مجانًاvsGLM 5.2none Claude Sonnet 4.6nonevsGrok 4.20medium MiMo-V2-FlashmediumvsGLM 5.2none Step 3.7 FlashhighvsGLM 5.2none Claude Opus 4.8nonevsGrok 4.20medium Kimi K2.7 CodemediumvsGLM 5.2none GPT-5.3 ChatnonevsGrok 4.20medium DeepSeek V4 PrononevsGrok 4.20medium Qwen3.7 PlusnonevsGrok 4.20medium Gemini 3 Flash PreviewlowvsGLM 5.2none Step 3.7 FlashhighvsGrok 4.20medium