AI BENCHY Compare

OpenAI: gpt-oss-120b vs Z.ai: GLM 4.7 Flash

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-05-22

المقياس	gpt-oss-120b gpt-oss-120b none الإصدار: 2025-08-05 متاح مجانًا	GLM 4.7 Flash GLM 4.7 Flash none الإصدار: 2026-01-19

المقياس	gpt-oss-120b gpt-oss-120b none الإصدار: 2025-08-05 متاح مجانًا	GLM 4.7 Flash GLM 4.7 Flash none الإصدار: 2026-01-19
النتيجة	5.2	5.6
الترتيب	#129	#109
الموثوقية	10.0	10.0
الاتساق	8.7	8.7
اختبارات صحيحة
معدل النجاح لكل محاولة	36.8%	38.3%
اختبارات غير مستقرة	3	3
إجمالي مرات التشغيل	57	60
التكلفة لكل نتيجة	0.201	0.053
إجمالي التكلفة	$0.011	$0.004
??? ???????	$0.000 / 1M	$0.060 / 1M
??? ???????	$0.000 / 1M	$0.400 / 1M
رموز الإخراج	51,505	2,516
رموز الاستدلال	0	0
زمن الاستجابة (المتوسط)	21.86s	2.98s
زمن الاستجابة (الحد الأقصى)	113.71s	7.05s
زمن الاستجابة (الإجمالي)	349.78s	38.73s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	6.5	10.0	50.0%	0		32.84s	8,676	0
GLM 4.7 Flash	5.2	7.9	41.7%	1		5.51s	438	0

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	4.3	1.1	66.7%	1		9.57s	3,232	0
GLM 4.7 Flash	5.0	10.0	0.0%	0		3.35s	644	0

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0
GLM 4.7 Flash	3.0	10.0	0.0%	0		3.22s	704	0

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	6.5	10.0	50.0%	0		7.12s	598	0
GLM 4.7 Flash	7.3	5.8	83.3%	1		4.82s	196	0

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	3.0	10.0	0.0%	0		34.98s	29,483	0
GLM 4.7 Flash	7.7	10.0	66.7%	0		744ms	19	0

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	4.8	10.0	0.0%	0		10.79s	615	0
GLM 4.7 Flash	4.0	10.0	0.0%	0		1.59s	134	0

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	9.8	10.0	100.0%	0		5.10s	1,982	0
GLM 4.7 Flash	6.5	10.0	50.0%	0		888ms	62	0

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	4.4	4.5	44.5%	2		9.51s	3,781	0
GLM 4.7 Flash	6.4	10.0	33.3%	0		1.00s	98	0

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0
GLM 4.7 Flash	2.8	1.6	33.3%	1		7.05s	212	0

معلومات عامة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	3.0	10.0	0.0%	0		47.29s	3,138	0
GLM 4.7 Flash	3.0	10.0	0.0%	0		692ms	9	0

مقارنة سريعة

تبديل زوج المقارنة

gpt-oss-120bmediumمتاح مجانًاvsGLM 4.7 Flashnone Cobuddymediumمتاح مجانًاvsGLM 4.7 Flashnone MiniMax M2.7mediumvsgpt-oss-120bnoneمتاح مجانًا gpt-oss-120bnoneمتاح مجانًاvsElephant Alphamedium Mistral Small 4mediumvsgpt-oss-120bnoneمتاح مجانًا MiniMax M2.5mediumمتاح مجانًاvsGLM 4.7 Flashnone Owl AlphamediumvsGLM 4.7 Flashnone MiniMax M2.5mediumمتاح مجانًاvsgpt-oss-120bnoneمتاح مجانًا Mistral Small 4mediumvsGLM 4.7 Flashnone Elephant AlphamediumvsGLM 4.7 Flashnone Nemotron 3 Supermediumمتاح مجانًاvsGLM 4.7 Flashnone GPT-5 NanomediumvsGLM 4.7 Flashnone