AI BENCHY Compare

Inception: Mercury 2 vs Z.ai: GLM 5

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-06-03

المقياس	Mercury 2 Mercury 2 medium الإصدار: 2026-02-24	GLM 5 GLM 5 none الإصدار: 2026-02-12

المقياس	Mercury 2 Mercury 2 medium الإصدار: 2026-02-24	GLM 5 GLM 5 none الإصدار: 2026-02-12
النتيجة	6.5	6.3
الترتيب	#89	#96
الموثوقية	10.0	10.0
الاتساق	8.8	9.7
اختبارات صحيحة
معدل النجاح لكل محاولة	51.7%	46.7%
اختبارات غير مستقرة	3	1
إجمالي مرات التشغيل	60	60
التكلفة لكل نتيجة	0.611	0.246
إجمالي التكلفة	$0.055	$0.025
سعر الإدخال	$0.250 / 1M	$0.600 / 1M
سعر الإخراج	$0.750 / 1M	$1.920 / 1M
إجمالي رموز الإدخال	32,570	34,537
رموز الإخراج	4,022	1,985
رموز الاستدلال	58,405	0
زمن الاستجابة (المتوسط)	2.27s	3.95s
زمن الاستجابة (الحد الأقصى)	14.63s	11.07s
زمن الاستجابة (الإجمالي)	43.20s	51.38s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	6.9	9.9	50.0%	0		1.12s	554	2,546	2,609
GLM 5	4.8	10.0	25.0%	0		2.37s	510	275	0

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	7.2	6.5	66.7%	1		2.29s	4,519	270	8,514
GLM 5	4.6	6.8	16.7%	1		5.18s	4,658	424	0

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	10.0	10.0	100.0%	0		3.28s	12,909	268	4,887
GLM 5	3.0	10.0	0.0%	0		4.98s	12,812	406	0

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	7.3	5.9	83.3%	1		1.11s	6,234	183	1,656
GLM 5	10.0	10.0	100.0%	0		5.78s	7,107	203	0

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	2.9	7.2	11.1%	1		6.48s	695	41	30,754
GLM 5	3.0	10.0	0.0%	0		2.24s	643	19	0

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	4.8	10.0	0.0%	0		821ms	456	137	542
GLM 5	10.0	10.0	100.0%	0		3.27s	477	103	0

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	10.0	10.0	100.0%	0		1.07s	340	14	958
GLM 5	10.0	10.0	100.0%	0		1.48s	636	61	0

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	5.4	10.0	33.3%	0		949ms	601	361	2,781
GLM 5	7.7	10.0	66.7%	0		1.91s	609	261	0

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	10.0	10.0	100.0%	0		1.89s	6,080	180	1,956
GLM 5	10.0	10.0	100.0%	0		11.07s	6,899	220	0

معلومات عامة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	3.0	10.0	0.0%	0		2.58s	182	22	3,748
GLM 5	3.0	10.0	0.0%	0		3.62s	186	13	0

مقارنة سريعة

تبديل زوج المقارنة

Mercury 2mediumvsGPT-5.5none Gemini 3.1 Flash LitenonevsMercury 2medium Mercury 2mediumvsQwen3.7 Plusnone Mercury 2mediumvsQwen3.5 Plus 2026-02-15none Mercury 2mediumvsRing-2.6-1Tnone Gemini 2.5 FlashnonevsMercury 2medium Gemini 3.1 Flash LiteminimalvsMercury 2medium GPT-5 NanomediumvsGLM 5none Gemma 4 31Bnoneمتاح مجانًاvsMercury 2medium DeepSeek V4 ProhighvsGLM 5none Qwen3.6 27BmediumvsGLM 5none Gemma 4 26B A4Bnoneمتاح مجانًاvsMercury 2medium