AI BENCHY Compare

MoonshotAI: Kimi K2.5 vs OpenAI: gpt-oss-120b

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-04-11

المقياس	Kimi K2.5 Kimi K2.5 none الإصدار: 2026-01-27	gpt-oss-120b gpt-oss-120b medium الإصدار: 2025-08-05 متاح مجانًا

المقياس	Kimi K2.5 Kimi K2.5 none الإصدار: 2026-01-27	gpt-oss-120b gpt-oss-120b medium الإصدار: 2025-08-05 متاح مجانًا
النتيجة	5.5	5.8
الترتيب	#72	#65
الاتساق	8.7	7.2
اختبارات صحيحة
معدل النجاح لكل محاولة	40.7%	51.9%
اختبارات غير مستقرة	3	6
إجمالي مرات التشغيل	54	54
التكلفة لكل نتيجة	0.271	0.144
إجمالي التكلفة	$0.017	$0.011
??? ???????	$0.383 / 1M	$0.039 / 1M
??? ???????	$1.720 / 1M	$0.190 / 1M
رموز الإخراج	2,659	13,493
رموز الاستدلال	0	36,879
زمن الاستجابة (المتوسط)	13.37s	16.08s
زمن الاستجابة (الحد الأقصى)	42.13s	50.92s
زمن الاستجابة (الإجمالي)	147.05s	176.88s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	3.6	8.4	8.3%	1		6.24s	373	0
gpt-oss-120b	6.7	9.9	50.0%	0		10.21s	3,518	2,177

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	10.0	10.0	100.0%	0		38.78s	649	0
gpt-oss-120b	4.3	1.1	66.7%	1		26.33s	228	2,549

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	2.8	2.1	33.3%	1		19.16s	748	0
gpt-oss-120b	10.0	10.0	100.0%	0		31.18s	694	5,072

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	7.3	5.8	83.3%	1		42.13s	187	0
gpt-oss-120b	6.4	5.9	66.7%	1		1.98s	241	1,114

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	5.3	10.0	33.3%	0		4.38s	29	0
gpt-oss-120b	2.9	4.4	22.2%	2		50.92s	6,784	20,606

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	10.0	10.0	100.0%	0		4.00s	76	0
gpt-oss-120b	4.3	10.0	0.0%	0		7.90s	107	387

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	6.5	10.0	50.0%	0		2.67s	60	0
gpt-oss-120b	9.9	10.0	100.0%	0		7.63s	126	1,799

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	3.1	10.0	0.0%	0		4.73s	317	0
gpt-oss-120b	3.2	4.7	22.2%	2		11.80s	1,508	2,092

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	10.0	10.0	100.0%	0		13.99s	220	0
gpt-oss-120b	9.8	10.0	100.0%	0		6.91s	287	1,083

مقارنة سريعة

تبديل زوج المقارنة

gpt-oss-120bmediumمتاح مجانًاvsQwen3.5-27Bnone Mistral Small 4mediumvsKimi K2.5none gpt-oss-120bmediumمتاح مجانًاvsQwen3.5-122B-A10Bnone MiniMax M2.5mediumمتاح مجانًاvsKimi K2.5none gpt-oss-120bmediumمتاح مجانًاvsMiMo-V2-Pronone gpt-oss-120bmediumمتاح مجانًاvsGLM 4.7 Flashnone gpt-oss-120bmediumمتاح مجانًاvsGLM 5.1none MiniMax M2.7mediumvsKimi K2.5none DeepSeek V3.2nonevsgpt-oss-120bmediumمتاح مجانًا gpt-oss-120bmediumمتاح مجانًاvsQwen3.5-35B-A3Bnone Gemini 2.5 Flashnonevsgpt-oss-120bmediumمتاح مجانًا Seed-2.0-Litenonevsgpt-oss-120bmediumمتاح مجانًا