التنقل
AI BENCHY
قارن الرسوم البيانية
❤️ Made by XCS
Your ad here

AI BENCHY Compare

Google: Gemini 3.1 Flash Lite Preview vs MoonshotAI: Kimi K2.5

قارن:

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-03-03

المقياس Google: Gemini 3.1 Flash Lite Preview none الإصدار: 2026-03-03 MoonshotAI: Kimi K2.5 medium الإصدار: 2026-01-27
الترتيب #10 #25
متوسط الدرجة 7.70 6.29
الاتساق 9.54 7.69
التكلفة لكل نتيجة 0.116 2.335
إجمالي التكلفة $0.011 $0.187
اختبارات صحيحة
معدل النجاح لكل محاولة 69.1% 73.8%
اختبارات غير مستقرة 1 4
رموز الإخراج 4,307 30,504
رموز الاستدلال 0 58,467

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة رموز الإخراج رموز الاستدلال
Google: Gemini 3.1 Flash Lite Preview 6.00 7.85 55.6% 1 1,086 0
MoonshotAI: Kimi K2.5 7.00 7.21 88.9% 1 335 6,255
تحليل البيانات واستخراجها النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة رموز الإخراج رموز الاستدلال
Google: Gemini 3.1 Flash Lite Preview 9.88 10.00 100.0% 0 399 0
MoonshotAI: Kimi K2.5 10.00 10.00 100.0% 0 1,181 6,049
خاص بالمجال النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة رموز الإخراج رموز الاستدلال
Google: Gemini 3.1 Flash Lite Preview 4.00 10.00 33.3% 0 568 0
MoonshotAI: Kimi K2.5 1.00 4.41 33.3% 2 20,696 30,894
اتباع التعليمات النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة رموز الإخراج رموز الاستدلال
Google: Gemini 3.1 Flash Lite Preview 9.00 10.00 50.0% 0 574 0
MoonshotAI: Kimi K2.5 9.50 10.00 100.0% 0 3,777 4,967
Puzzle Solving النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة رموز الإخراج رموز الاستدلال
Google: Gemini 3.1 Flash Lite Preview 10.00 10.00 100.0% 0 898 0
MoonshotAI: Kimi K2.5 5.00 7.61 55.6% 1 4,273 9,490
استدعاء الأدوات النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة رموز الإخراج رموز الاستدلال
Google: Gemini 3.1 Flash Lite Preview 10.00 10.00 100.0% 0 782 0
MoonshotAI: Kimi K2.5 10.00 10.00 100.0% 0 242 812

مقارنة سريعة

تبديل زوج المقارنة