AI BENCHY Compare

Elephant Alpha vs xAI: Grok 4.20

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-05-29

المقياس	Elephant Alpha Elephant Alpha medium الإصدار: 2026-04-14	Grok 4.20 Grok 4.20 none الإصدار: 2026-03-31

المقياس	Elephant Alpha Elephant Alpha medium الإصدار: 2026-04-14	Grok 4.20 Grok 4.20 none الإصدار: 2026-03-31
النتيجة	5.4	5.4
الترتيب	#127	#125
الموثوقية	غير متاح	غير متاح
الاتساق	9.6	10.0
اختبارات صحيحة
معدل النجاح لكل محاولة	33.3%	33.3%
اختبارات غير مستقرة	1	0
إجمالي مرات التشغيل	60	54
التكلفة لكل نتيجة	0.000	1.570
إجمالي التكلفة	$0.000	$0.095
سعر الإدخال	$0.000 / 1M	$1.250 / 1M
سعر الإخراج	$0.000 / 1M	$2.500 / 1M
رموز الإخراج	2,596	1,923
رموز الاستدلال	0	0
زمن الاستجابة (المتوسط)	1.27s	1.11s
زمن الاستجابة (الحد الأقصى)	3.70s	6.04s
زمن الاستجابة (الإجمالي)	22.82s	19.96s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Elephant Alpha	6.6	10.0	50.0%	0		1.19s	815	0
Grok 4.20	4.8	10.0	25.0%	0		501ms	267	0

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Elephant Alpha	4.0	6.7	16.7%	1		1.30s	365	0
Grok 4.20	3.4	9.3	0.0%	0		1.22s	312	0

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Elephant Alpha	3.0	10.0	0.0%	0		3.70s	562	0
Grok 4.20	3.0	10.0	0.0%	0		6.04s	282	0

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Elephant Alpha	6.5	10.0	50.0%	0		979ms	246	0
Grok 4.20	10.0	10.0	100.0%	0		522ms	207	0

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Elephant Alpha	3.0	10.0	0.0%	0		925ms	24	0
Grok 4.20	3.0	10.0	0.0%	0		687ms	325	0

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Elephant Alpha	4.3	10.0	0.0%	0		920ms	105	0
Grok 4.20	4.8	10.0	0.0%	0		659ms	83	0

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Elephant Alpha	9.8	10.0	100.0%	0		987ms	82	0
Grok 4.20	6.3	10.0	50.0%	0		445ms	60	0

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Elephant Alpha	5.3	10.0	33.3%	0		868ms	166	0
Grok 4.20	5.3	10.0	33.3%	0		473ms	198	0

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Elephant Alpha	3.0	10.0	0.0%	0		2.83s	231	0
Grok 4.20	10.0	10.0	100.0%	0		4.63s	189	0

معلومات عامة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Elephant Alpha	0.0	0.0	0.0%	0		0ms	0	0
Grok 4.20	-	-	-	-	-	-	-	-

مقارنة سريعة

تبديل زوج المقارنة

MiniMax M2.5mediumمتاح مجانًاvsGrok 4.20none Elephant AlphamediumvsQwen3.5-122B-A10Bnone Mistral Small 4mediumvsGrok 4.20none MiniMax M2.7mediumvsGrok 4.20none gpt-oss-120bnoneمتاح مجانًاvsElephant Alphamedium Elephant AlphamediumvsGLM 5 Turbonone Kimi K2.5nonevsElephant Alphamedium Ling-2.6-flashnonevsElephant Alphamedium Elephant AlphamediumvsQwen3.6 Flashnone Elephant AlphamediumvsMiMo-V2.5-Pronone GPT-5.4nonevsElephant Alphamedium Kimi K2.6noneمتاح مجانًاvsElephant Alphamedium