AI BENCHY Compare
Inception: Mercury 2 vs xAI: Grok 4.20
تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-05-10
| المقياس | Mercury 2 Mercury 2 medium | Grok 4.20 Grok 4.20 none |
|---|---|---|
| النتيجة | 6.3 | 5.4 |
| الترتيب | #82 | #115 |
| الموثوقية | 10.0 | غير متاح |
| الاتساق | 8.7 | 9.5 |
| اختبارات صحيحة | ||
| معدل النجاح لكل محاولة | 50.9% | 35.2% |
| اختبارات غير مستقرة | 3 | 1 |
| إجمالي مرات التشغيل | 57 | 54 |
| التكلفة لكل نتيجة | 0.616 | 1.574 |
| إجمالي التكلفة | $0.050 | $0.095 |
| ??? ??????? | $0.250 / 1M | $1.250 / 1M |
| ??? ??????? | $0.750 / 1M | $2.500 / 1M |
| رموز الإخراج | 3,994 | 1,967 |
| رموز الاستدلال | 52,081 | 0 |
| زمن الاستجابة (المتوسط) | 2.23s | 1.11s |
| زمن الاستجابة (الحد الأقصى) | 14.63s | 6.04s |
| زمن الاستجابة (الإجمالي) | 40.10s | 20.02s |
الدرجة مقابل التكلفة الإجمالية
زمن الاستجابة (المتوسط)
النتيجة vs زمن الاستجابة (المتوسط)
إجمالي رموز الإخراج
النتيجة vs إجمالي رموز الإخراج
تفصيل الفئات
مقارنة سريعة
تبديل زوج المقارنة
Gemini 2.5 FlashnonevsMercury 2mediumMercury 2mediumvsMiMo-V2-OmninoneGemma 4 26B A4Bnoneمتاح مجانًاvsMercury 2mediumElephant AlphamediumvsGrok 4.20noneDeepSeek V4 PrononevsMercury 2mediumMistral Small 4mediumvsGrok 4.20noneMiniMax M2.5mediumمتاح مجانًاvsGrok 4.20noneMercury 2mediumvsGLM 5noneMercury 2mediumvsQwen3.5 Plus 2026-02-15noneSeed-2.0-LitenonevsMercury 2mediumMercury 2mediumvsGLM 5V TurbononeMercury 2mediumvsQwen3.5-Flashnone