التنقل
AI BENCHY
Your ad here

AI BENCHY Compare

Inception: Mercury 2 vs OpenAI: gpt-oss-120b

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-04-16

المقياس Mercury 2 Mercury 2 none الإصدار: 2026-02-24 gpt-oss-120b gpt-oss-120b medium الإصدار: 2025-08-05 متاح مجانًا
النتيجة 4.8 5.8
الترتيب #89 #67
الاتساق 9.0 7.2
اختبارات صحيحة
معدل النجاح لكل محاولة 27.8% 51.9%
اختبارات غير مستقرة 2 6
إجمالي مرات التشغيل 54 54
التكلفة لكل نتيجة 0.165 0.144
إجمالي التكلفة $0.007 $0.011
??? ??????? $0.250 / 1M $0.039 / 1M
??? ??????? $0.750 / 1M $0.190 / 1M
رموز الإخراج 1,625 13,493
رموز الاستدلال 0 36,879
زمن الاستجابة (المتوسط) 613ms 16.08s
زمن الاستجابة (الحد الأقصى) 1.27s 50.92s
زمن الاستجابة (الإجمالي) 11.04s 176.88s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Mercury 2 3.0 10.0 0.0% 0 483ms 286 0
gpt-oss-120b 6.7 9.9 50.0% 0 10.21s 3,518 2,177
البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Mercury 2 3.6 8.9 0.0% 0 969ms 310 0
gpt-oss-120b 4.3 1.1 66.7% 1 26.33s 228 2,549
مجمّع النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Mercury 2 3.0 10.0 0.0% 0 606ms 131 0
gpt-oss-120b 10.0 10.0 100.0% 0 31.18s 694 5,072
تحليل البيانات واستخراجها النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Mercury 2 7.3 5.9 83.3% 1 667ms 180 0
gpt-oss-120b 6.4 5.9 66.7% 1 1.98s 241 1,114
خاص بالمجال النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Mercury 2 5.3 7.2 44.4% 1 534ms 46 0
gpt-oss-120b 2.9 4.4 22.2% 2 50.92s 6,784 20,606
الذكاء العام النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Mercury 2 4.8 10.0 0.0% 0 628ms 159 0
gpt-oss-120b 4.3 10.0 0.0% 0 7.90s 107 387
اتباع التعليمات النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Mercury 2 6.5 10.0 50.0% 0 551ms 82 0
gpt-oss-120b 9.9 10.0 100.0% 0 7.63s 126 1,799
حل الألغاز النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Mercury 2 3.1 10.0 0.0% 0 533ms 234 0
gpt-oss-120b 3.2 4.7 22.2% 2 11.80s 1,508 2,092
استدعاء الأدوات النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Mercury 2 10.0 10.0 100.0% 0 1.27s 197 0
gpt-oss-120b 9.8 10.0 100.0% 0 6.91s 287 1,083

مقارنة سريعة

تبديل زوج المقارنة