AI BENCHY Compare
Inception: Mercury 2 vs Owl Alpha
تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-06-03
| المقياس | Mercury 2 Mercury 2 none | Owl Alpha Owl Alpha medium |
|---|---|---|
| النتيجة | 4.6 | 5.8 |
| الترتيب | #153 | #107 |
| الموثوقية | 10.0 | 10.0 |
| الاتساق | 9.1 | 9.6 |
| اختبارات صحيحة | ||
| معدل النجاح لكل محاولة | 25.0% | 41.7% |
| اختبارات غير مستقرة | 2 | 1 |
| إجمالي مرات التشغيل | 60 | 60 |
| التكلفة لكل نتيجة | 0.216 | 0.000 |
| إجمالي التكلفة | $0.009 | $0.000 |
| سعر الإدخال | $0.250 / 1M | $0.000 / 1M |
| سعر الإخراج | $0.750 / 1M | $0.000 / 1M |
| إجمالي رموز الإدخال | 25,515 | 40,601 |
| رموز الإخراج | 3,001 | 2,965 |
| رموز الاستدلال | 0 | 0 |
| زمن الاستجابة (المتوسط) | 614ms | 11.64s |
| زمن الاستجابة (الحد الأقصى) | 1.27s | 58.63s |
| زمن الاستجابة (الإجمالي) | 12.28s | 232.83s |
الدرجة مقابل التكلفة الإجمالية
زمن الاستجابة (المتوسط)
النتيجة vs زمن الاستجابة (المتوسط)
إجمالي رموز الإخراج
النتيجة vs إجمالي رموز الإخراج
تفصيل الفئات
مقارنة سريعة
تبديل زوج المقارنة
Owl AlphamediumvsGLM 5.1noneDeepSeek V4 PrononevsOwl AlphamediumOwl AlphamediumvsQwen3.5 Plus 2026-04-20noneSeed-2.0-LitenonevsOwl AlphamediumOwl AlphamediumvsQwen3.5-35B-A3BnoneOwl AlphamediumvsGLM 5V TurbononeOwl AlphamediumvsQwen3.5-27BnoneOwl AlphamediumvsQwen3.6 27BnoneOwl AlphamediumvsQwen3.5-FlashnoneMercury 2nonevsQwen3 Coder NextmediumOwl AlphamediumvsMimo V2 PROnoneMercury 2nonevsGLM 4.7 Flashmedium