AI BENCHY Compare
Inception: Mercury 2 vs MoonshotAI: Kimi K2.5
تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-06-03
| المقياس | Mercury 2 Mercury 2 medium | Kimi K2.5 Kimi K2.5 medium |
|---|---|---|
| النتيجة | 6.5 | 6.7 |
| الترتيب | #89 | #81 |
| الموثوقية | 10.0 | 10.0 |
| الاتساق | 8.8 | 6.8 |
| اختبارات صحيحة | ||
| معدل النجاح لكل محاولة | 51.7% | 66.7% |
| اختبارات غير مستقرة | 3 | 8 |
| إجمالي مرات التشغيل | 60 | 60 |
| التكلفة لكل نتيجة | 0.611 | 3.486 |
| إجمالي التكلفة | $0.055 | $0.272 |
| سعر الإدخال | $0.250 / 1M | $0.400 / 1M |
| سعر الإخراج | $0.750 / 1M | $1.900 / 1M |
| إجمالي رموز الإدخال | 32,570 | 31,717 |
| رموز الإخراج | 4,022 | 48,374 |
| رموز الاستدلال | 58,405 | 128,473 |
| زمن الاستجابة (المتوسط) | 2.27s | 89.02s |
| زمن الاستجابة (الحد الأقصى) | 14.63s | 281.00s |
| زمن الاستجابة (الإجمالي) | 43.20s | 1157.32s |
الدرجة مقابل التكلفة الإجمالية
زمن الاستجابة (المتوسط)
النتيجة vs زمن الاستجابة (المتوسط)
إجمالي رموز الإخراج
النتيجة vs إجمالي رموز الإخراج
تفصيل الفئات
مقارنة سريعة
تبديل زوج المقارنة
Gemini 3.1 Flash LiteminimalvsKimi K2.5mediumGemma 4 31Bnoneمتاح مجانًاvsKimi K2.5mediumMercury 2mediumvsGPT-5.5noneGemini 3.1 Flash LitenonevsMercury 2mediumKimi K2.5mediumvsQwen3.7 PlusnoneMercury 2mediumvsQwen3.7 PlusnoneMercury 2mediumvsQwen3.5 Plus 2026-02-15noneMercury 2mediumvsRing-2.6-1TnoneGemini 3.1 Flash LitenonevsKimi K2.5mediumKimi K2.5mediumvsGPT-5.5noneGemini 2.5 FlashnonevsMercury 2mediumGemini 3.1 Flash LiteminimalvsMercury 2medium