التنقل
AI BENCHY
قارن الرسوم البيانية
❤️ Made by XCS
Your ad here

AI BENCHY Compare

Inception: Mercury 2 vs OpenAI: gpt-oss-120b

قارن:

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-03-05

المقياس Inception: Mercury 2 none الإصدار: 2026-02-24 OpenAI: gpt-oss-120b medium الإصدار: 2025-08-05 متاح مجانًا
الترتيب #50 #36
متوسط الدرجة 34 52
الاتساق 89 72
التكلفة لكل نتيجة 0.147 0.133
إجمالي التكلفة $0.006 $0.010
زمن الاستجابة (المتوسط) 594ms 17.75s
زمن الاستجابة (الحد الأقصى) 1.27s 50.92s
زمن الاستجابة (الإجمالي) 8.91s 141.98s
اختبارات صحيحة
معدل النجاح لكل محاولة 33.3% 57.8%
اختبارات غير مستقرة 2 5
رموز الإخراج 1,144 13,103
رموز الاستدلال 0 33,843

أفضل النماذج حسب الدرجة

زمن الاستجابة (المتوسط)

الدرجة مقابل التكلفة الإجمالية

متوسط الدرجة vs زمن الاستجابة (المتوسط)

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Inception: Mercury 2 100 100 0.0% 0 466ms 274 0
OpenAI: gpt-oss-120b 70 98 66.7% 0 19.76s 3,463 2,077
مجمّع النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Inception: Mercury 2 100 100 0.0% 0 606ms 131 0
OpenAI: gpt-oss-120b 100 100 100.0% 0 31.18s 694 5,072
تحليل البيانات واستخراجها النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Inception: Mercury 2 55 59 83.3% 1 667ms 180 0
OpenAI: gpt-oss-120b 55 59 66.7% 1 1.98s 241 1,114
خاص بالمجال النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Inception: Mercury 2 40 72 44.4% 1 534ms 46 0
OpenAI: gpt-oss-120b 100 44 22.2% 2 50.92s 6,784 20,606
اتباع التعليمات النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Inception: Mercury 2 55 100 50.0% 0 551ms 82 0
OpenAI: gpt-oss-120b 95 100 100.0% 0 7.63s 126 1,799
Puzzle Solving النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Inception: Mercury 2 100 100 0.0% 0 533ms 234 0
OpenAI: gpt-oss-120b 17 47 22.2% 2 11.80s 1,508 2,092
استدعاء الأدوات النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Inception: Mercury 2 100 100 100.0% 0 1.27s 197 0
OpenAI: gpt-oss-120b 90 100 100.0% 0 6.91s 287 1,083

مقارنة سريعة

تبديل زوج المقارنة