AI BENCHY Compare

OpenAI: gpt-oss-120b vs Qwen3.6 Plus Preview

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-04-11

المقياس	gpt-oss-120b gpt-oss-120b none الإصدار: 2025-08-05 متاح مجانًا	Qwen3.6 Plus Preview Qwen3.6 Plus Preview medium الإصدار: 2026-03-30 متاح مجانًا

المقياس	gpt-oss-120b gpt-oss-120b none الإصدار: 2025-08-05 متاح مجانًا	Qwen3.6 Plus Preview Qwen3.6 Plus Preview medium الإصدار: 2026-03-30 متاح مجانًا
النتيجة	5.2	8.5
الترتيب	#79	#7
الاتساق	7.9	10.0
اختبارات صحيحة
معدل النجاح لكل محاولة	38.9%	76.5%
اختبارات غير مستقرة	5	0
إجمالي مرات التشغيل	54	49
التكلفة لكل نتيجة	0.221	0.000
إجمالي التكلفة	$0.009	$0.000
??? ???????	$0.039 / 1M	$0.000 / 1M
??? ???????	$0.190 / 1M	$0.000 / 1M
رموز الإخراج	44,652	1,756
رموز الاستدلال	0	77,213
زمن الاستجابة (المتوسط)	11.96s	13.94s
زمن الاستجابة (الحد الأقصى)	68.97s	43.55s
زمن الاستجابة (الإجمالي)	179.34s	237.01s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	6.6	8.0	58.3%	1		6.03s	4,867	0
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		9.90s	207	7,557

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	4.3	1.1	66.7%	1		9.57s	3,232	0
Qwen3.6 Plus Preview	-	-	-	-	-	-	-	-

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		34.95s	452	13,073

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	6.5	10.0	50.0%	0		7.12s	598	0
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		14.95s	270	10,706

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	3.0	10.0	0.0%	0		34.98s	29,483	0
Qwen3.6 Plus Preview	3.0	10.0	0.0%	0		22.08s	49	26,895

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	4.6	10.0	0.0%	0		2.83s	586	0
Qwen3.6 Plus Preview	5.1	10.0	0.0%	0		27.05s	111	5,232

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	8.4	6.9	83.3%	1		5.10s	1,982	0
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		7.54s	102	5,552

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	4.5	4.8	44.5%	2		6.86s	3,904	0
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		6.11s	298	6,868

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		5.87s	267	1,330

مقارنة سريعة

تبديل زوج المقارنة

MiniMax M2.7mediumvsgpt-oss-120bnoneمتاح مجانًا Gemini 3 Flash PreviewnonevsQwen3.6 Plus Previewmediumمتاح مجانًا Gemini 3 Flash PreviewlowvsQwen3.6 Plus Previewmediumمتاح مجانًا Gemini 3.1 Flash Lite PreviewlowvsQwen3.6 Plus Previewmediumمتاح مجانًا Mistral Small 4mediumvsgpt-oss-120bnoneمتاح مجانًا gpt-oss-120bnoneمتاح مجانًاvsQwen3 Coder Nextmedium MiniMax M2.5mediumمتاح مجانًاvsgpt-oss-120bnoneمتاح مجانًا GPT-5.2 ChatnonevsQwen3.6 Plus Previewmediumمتاح مجانًا Gemini 3.1 Flash Lite PreviewnonevsQwen3.6 Plus Previewmediumمتاح مجانًا gpt-oss-120bnoneمتاح مجانًاvsGLM 4.7 Flashmedium GPT-5.3 ChatnonevsQwen3.6 Plus Previewmediumمتاح مجانًا gpt-oss-120bnoneمتاح مجانًاvsQwen3.5-9Bmedium