AI BENCHY Compare
MoonshotAI: Kimi K2.5 vs xAI: Grok 4.20
تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-04-02
| المقياس | Kimi K2.5 Kimi K2.5 medium | Grok 4.20 Grok 4.20 medium |
|---|---|---|
| النتيجة | 7.2 | 7.1 |
| الترتيب | #39 | #40 |
| الاتساق | 7.2 | 8.2 |
| اختبارات صحيحة | ||
| معدل النجاح لكل محاولة | 72.6% | 66.7% |
| اختبارات غير مستقرة | 6 | 4 |
| إجمالي مرات التشغيل | 51 | 51 |
| التكلفة لكل نتيجة | 2.232 | 7.358 |
| إجمالي التكلفة | $0.201 | $0.663 |
| ??? ??????? | $0.383 / 1M | $2.000 / 1M |
| ??? ??????? | $1.909 / 1M | $6.000 / 1M |
| رموز الإخراج | 40,907 | 1,494 |
| رموز الاستدلال | 75,121 | 97,078 |
| زمن الاستجابة (المتوسط) | 64.59s | 9.50s |
| زمن الاستجابة (الحد الأقصى) | 137.29s | 29.87s |
| زمن الاستجابة (الإجمالي) | 645.93s | 161.54s |
الدرجة مقابل التكلفة الإجمالية
زمن الاستجابة (المتوسط)
النتيجة vs زمن الاستجابة (المتوسط)
إجمالي رموز الإخراج
النتيجة vs إجمالي رموز الإخراج
تفصيل الفئات
مقارنة سريعة
تبديل زوج المقارنة
Claude Sonnet 4.6nonevsKimi K2.5mediumClaude Sonnet 4.6nonevsGrok 4.20mediumQwen3.5 Plus 2026-02-15nonevsGrok 4.20mediumKimi K2.5mediumvsGPT-5.3 ChatnoneGemma 4 31BnonevsGrok 4.20mediumGrok 4.20mediumvsGLM 5noneKimi K2.5mediumvsQwen3.5 Plus 2026-02-15noneGPT-5.3 ChatnonevsGrok 4.20mediumGemma 4 31BnonevsKimi K2.5mediumKimi K2.5mediumvsGLM 5noneKimi K2.5mediumvsGPT-5.2 ChatnoneGemini 3.1 Flash Lite PreviewnonevsKimi K2.5medium