AI BENCHY Compare
Inception: Mercury 2 vs xAI: Grok 4.20
تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-04-16
| المقياس | Mercury 2 Mercury 2 none | Grok 4.20 Grok 4.20 none |
|---|---|---|
| النتيجة | 4.8 | 5.2 |
| الترتيب | #89 | #80 |
| الاتساق | 9.0 | 9.5 |
| اختبارات صحيحة | ||
| معدل النجاح لكل محاولة | 27.8% | 29.6% |
| اختبارات غير مستقرة | 2 | 1 |
| إجمالي مرات التشغيل | 54 | 54 |
| التكلفة لكل نتيجة | 0.165 | 1.889 |
| إجمالي التكلفة | $0.007 | $0.095 |
| ??? ??????? | $0.250 / 1M | $2.000 / 1M |
| ??? ??????? | $0.750 / 1M | $6.000 / 1M |
| رموز الإخراج | 1,625 | 1,967 |
| رموز الاستدلال | 0 | 0 |
| زمن الاستجابة (المتوسط) | 613ms | 1.11s |
| زمن الاستجابة (الحد الأقصى) | 1.27s | 6.04s |
| زمن الاستجابة (الإجمالي) | 11.04s | 20.02s |
الدرجة مقابل التكلفة الإجمالية
زمن الاستجابة (المتوسط)
النتيجة vs زمن الاستجابة (المتوسط)
إجمالي رموز الإخراج
النتيجة vs إجمالي رموز الإخراج
تفصيل الفئات
مقارنة سريعة
تبديل زوج المقارنة
ElephantmediumvsGrok 4.20noneMiniMax M2.7mediumvsGrok 4.20noneMercury 2nonevsQwen3 Coder NextmediumMercury 2nonevsGLM 4.7 FlashmediumMercury 2nonevsQwen3.5-9BmediumMistral Small 4mediumvsGrok 4.20noneMercury 2nonevsElephantmediumMiniMax M2.5mediumمتاح مجانًاvsGrok 4.20noneMercury 2nonevsMiniMax M2.7mediumQwen3 Coder NextmediumvsGrok 4.20noneGrok 4.20nonevsGLM 4.7 Flashmediumgpt-oss-120bmediumمتاح مجانًاvsGrok 4.20none