AI BENCHY Compare

OpenAI: gpt-oss-120b vs Laguna Xs.2

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-04-29

المقياس	gpt-oss-120b gpt-oss-120b none الإصدار: 2025-08-05 متاح مجانًا	Laguna Xs.2 Laguna Xs.2 none الإصدار: 2026-04-28 متاح مجانًا

المقياس	gpt-oss-120b gpt-oss-120b none الإصدار: 2025-08-05 متاح مجانًا	Laguna Xs.2 Laguna Xs.2 none الإصدار: 2026-04-28 متاح مجانًا
النتيجة	5.2	5.0
الترتيب	#110	#118
الموثوقية	غير متاح	9.9
الاتساق	7.9	10.0
اختبارات صحيحة
معدل النجاح لكل محاولة	38.9%	27.8%
اختبارات غير مستقرة	5	0
إجمالي مرات التشغيل	54	54
التكلفة لكل نتيجة	0.221	0.000
إجمالي التكلفة	$0.009	$0.000
??? ???????	$0.000 / 1M	$0.000 / 1M
??? ???????	$0.000 / 1M	$0.000 / 1M
رموز الإخراج	44,652	3,824
رموز الاستدلال	0	0
زمن الاستجابة (المتوسط)	11.96s	1.68s
زمن الاستجابة (الحد الأقصى)	68.97s	16.04s
زمن الاستجابة (الإجمالي)	179.34s	30.26s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	6.6	8.0	58.3%	1		6.03s	4,867	0
Laguna Xs.2	3.2	10.0	0.0%	0		743ms	933	0

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	4.3	1.1	66.7%	1		9.57s	3,232	0
Laguna Xs.2	2.5	10.0	0.0%	0		1.96s	866	0

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0
Laguna Xs.2	3.0	10.0	0.0%	0		2.01s	521	0

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	6.5	10.0	50.0%	0		7.12s	598	0
Laguna Xs.2	10.0	10.0	100.0%	0		646ms	246	0

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	3.0	10.0	0.0%	0		34.98s	29,483	0
Laguna Xs.2	5.3	10.0	33.3%	0		371ms	33	0

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	4.6	10.0	0.0%	0		2.83s	586	0
Laguna Xs.2	5.0	10.0	0.0%	0		16.04s	200	0

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	8.4	6.9	83.3%	1		5.10s	1,982	0
Laguna Xs.2	6.5	10.0	50.0%	0		439ms	81	0

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	4.5	4.8	44.5%	2		6.86s	3,904	0
Laguna Xs.2	5.4	10.0	33.3%	0		688ms	552	0

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0
Laguna Xs.2	3.0	10.0	0.0%	0		1.93s	392	0

مقارنة سريعة

تبديل زوج المقارنة

Nemotron 3 Nano Omni 30b A3b Reasoningmediumمتاح مجانًاvsgpt-oss-120bnoneمتاح مجانًا gpt-oss-120bnoneمتاح مجانًاvsElephant Alphamedium MiniMax M2.7mediumvsgpt-oss-120bnoneمتاح مجانًا Nemotron 3 Nano Omni 30b A3b Reasoningmediumمتاح مجانًاvsLaguna Xs.2noneمتاح مجانًا Elephant AlphamediumvsLaguna Xs.2noneمتاح مجانًا MiniMax M2.7mediumvsLaguna Xs.2noneمتاح مجانًا Laguna Xs.2noneمتاح مجانًاvsQwen3 Coder Nextmedium Laguna Xs.2noneمتاح مجانًاvsGLM 4.7 Flashmedium Mistral Small 4mediumvsgpt-oss-120bnoneمتاح مجانًا gpt-oss-120bnoneمتاح مجانًاvsQwen3 Coder Nextmedium MiniMax M2.5mediumمتاح مجانًاvsgpt-oss-120bnoneمتاح مجانًا gpt-oss-120bnoneمتاح مجانًاvsGLM 4.7 Flashmedium