AI BENCHY Compare

MoonshotAI: Kimi K2.5 vs xAI: Grok Build 0.1

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-05-22

المقياس	Kimi K2.5 Kimi K2.5 medium الإصدار: 2026-01-27	Grok Build 0.1 Grok Build 0.1 none الإصدار: 2026-05-21

المقياس	Kimi K2.5 Kimi K2.5 medium الإصدار: 2026-01-27	Grok Build 0.1 Grok Build 0.1 none الإصدار: 2026-05-21
النتيجة	6.7	6.6
الترتيب	#79	#82
الموثوقية	10.0	10.0
الاتساق	6.8	8.0
اختبارات صحيحة
معدل النجاح لكل محاولة	66.7%	60.4%
اختبارات غير مستقرة	8	4
إجمالي مرات التشغيل	60	57
التكلفة لكل نتيجة	3.479	7.805
إجمالي التكلفة	$0.314	$0.547
??? ???????	$0.400 / 1M	$1.000 / 1M
??? ???????	$1.900 / 1M	$2.000 / 1M
رموز الإخراج	46,619	267,275
رموز الاستدلال	128,184	0
زمن الاستجابة (المتوسط)	89.36s	28.69s
زمن الاستجابة (الحد الأقصى)	281.00s	138.35s
زمن الاستجابة (الإجمالي)	1161.65s	459.00s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	7.3	5.8	83.3%	2		51.38s	2,789	8,880
Grok Build 0.1	8.7	7.9	91.7%	1		6.30s	11,162	0

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	4.1	1.9	50.0%	2		215.89s	5,700	45,419
Grok Build 0.1	10.0	10.0	100.0%	0		21.41s	16,568	0

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	10.0	10.0	100.0%	0		71.37s	703	3,713
Grok Build 0.1	0.0	0.0	0.0%	0		0ms	0	0

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	10.0	10.0	100.0%	0		49.78s	563	7,940
Grok Build 0.1	4.7	1.6	66.7%	1		9.33s	6,359	0

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	3.5	4.4	33.3%	2		137.29s	20,753	30,564
Grok Build 0.1	3.6	7.2	22.2%	1		103.71s	179,469	0

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	6.5	3.4	66.7%	1		69.73s	3,815	4,262
Grok Build 0.1	4.3	10.0	0.0%	0		12.47s	6,647	0

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	10.0	10.0	100.0%	0		92.47s	5,371	6,547
Grok Build 0.1	9.8	10.0	100.0%	0		7.36s	8,970	0

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	5.3	7.3	44.4%	1		45.40s	6,671	12,403
Grok Build 0.1	6.4	7.7	55.6%	1		9.55s	14,982	0

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	10.0	10.0	100.0%	0		31.74s	242	812
Grok Build 0.1	0.0	0.0	0.0%	0		0ms	0	0

معلومات عامة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Kimi K2.5	3.0	10.0	0.0%	0		83.95s	12	7,644
Grok Build 0.1	3.0	10.0	0.0%	0		36.09s	23,118	0

مقارنة سريعة

تبديل زوج المقارنة

Gemini 3.1 Flash LiteminimalvsKimi K2.5medium DeepSeek V4 ProhighvsKimi K2.5medium Qwen3.6 27BmediumvsGrok Build 0.1none DeepSeek V4 ProhighvsGrok Build 0.1none Gemma 4 31Bnoneمتاح مجانًاvsKimi K2.5medium Gemini 3.1 Flash LiteminimalvsGrok Build 0.1none Gemini 3.1 Flash LitenonevsKimi K2.5medium Kimi K2.5mediumvsGPT-5.5none Kimi K2.5mediumvsQwen3.5 Plus 2026-02-15none GPT-5 MinimediumvsGrok Build 0.1none Grok Build 0.1nonevsMiMo-V2-Omnimedium Mercury 2mediumvsGrok Build 0.1none