AI BENCHY Compare

MoonshotAI: Kimi K2.5 vs Elephant

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-04-14

المقياس	Kimi K2.5 Kimi K2.5 none الإصدار: 2026-01-27	Elephant Elephant none الإصدار: 2026-04-14

المقياس	Kimi K2.5 Kimi K2.5 none الإصدار: 2026-01-27	Elephant Elephant none الإصدار: 2026-04-14
النتيجة	5.5	5.2
الترتيب	#72	#81
الاتساق	8.7	9.6
اختبارات صحيحة
معدل النجاح لكل محاولة	40.7%	31.5%
اختبارات غير مستقرة	3	1
إجمالي مرات التشغيل	54	54
التكلفة لكل نتيجة	0.271	0.000
إجمالي التكلفة	$0.017	$0.000
??? ???????	$0.383 / 1M	$0.000 / 1M
??? ???????	$1.720 / 1M	$0.000 / 1M
رموز الإخراج	2,659	2,573
رموز الاستدلال	0	0
زمن الاستجابة (المتوسط)	13.37s	1.23s
زمن الاستجابة (الحد الأقصى)	42.13s	3.81s
زمن الاستجابة (الإجمالي)	147.05s	22.16s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	3.6	8.4	8.3%	1		6.24s	373	0
Elephant	6.6	10.0	50.0%	0		963ms	610	0

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	10.0	10.0	100.0%	0		38.78s	649	0
Elephant	6.4	3.3	66.7%	1		1.39s	375	0

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	2.8	2.1	33.3%	1		19.16s	748	0
Elephant	3.0	10.0	0.0%	0		3.81s	731	0

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	7.3	5.8	83.3%	1		42.13s	187	0
Elephant	6.5	10.0	50.0%	0		1.04s	246	0

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	5.3	10.0	33.3%	0		4.38s	29	0
Elephant	3.0	10.0	0.0%	0		927ms	24	0

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	10.0	10.0	100.0%	0		4.00s	76	0
Elephant	4.0	10.0	0.0%	0		854ms	106	0

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	6.5	10.0	50.0%	0		2.67s	60	0
Elephant	9.8	10.0	100.0%	0		1.03s	81	0

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	3.1	10.0	0.0%	0		4.73s	317	0
Elephant	3.3	10.0	0.0%	0		849ms	170	0

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	10.0	10.0	100.0%	0		13.99s	220	0
Elephant	3.0	10.0	0.0%	0		2.79s	230	0

مقارنة سريعة

تبديل زوج المقارنة

MiniMax M2.7mediumvsElephantnone Mistral Small 4mediumvsKimi K2.5none MiniMax M2.5mediumمتاح مجانًاvsKimi K2.5none MiniMax M2.7mediumvsKimi K2.5none Kimi K2.5nonevsgpt-oss-120bmediumمتاح مجانًا Kimi K2.5nonevsElephantmedium Mistral Small 4mediumvsElephantnone ElephantnonevsQwen3 Coder Nextmedium MiniMax M2.5mediumمتاح مجانًاvsElephantnone ElephantnonevsGLM 4.7 Flashmedium gpt-oss-120bmediumمتاح مجانًاvsElephantnone Kimi K2.5nonevsGPT-5 Nanomedium