التنقل
AI BENCHY
قارن الرسوم البيانية
❤️ Made by XCS
Your ad here

AI BENCHY Compare

Inception: Mercury 2 vs Qwen: Qwen3.5-35B-A3B

قارن:

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-03-05

المقياس Inception: Mercury 2 none الإصدار: 2026-02-24 Qwen: Qwen3.5-35B-A3B medium الإصدار: 2026-02-24
الترتيب #50 #33
متوسط الدرجة 34 58
الاتساق 89 67
التكلفة لكل نتيجة 0.147 4.189
إجمالي التكلفة $0.006 $0.336
زمن الاستجابة (المتوسط) 594ms 44.84s
زمن الاستجابة (الحد الأقصى) 1.27s 106.00s
زمن الاستجابة (الإجمالي) 8.91s 672.55s
اختبارات صحيحة
معدل النجاح لكل محاولة 33.3% 80.0%
اختبارات غير مستقرة 2 6
رموز الإخراج 1,144 5,475
رموز الاستدلال 0 165,513

أفضل النماذج حسب الدرجة

زمن الاستجابة (المتوسط)

الدرجة مقابل التكلفة الإجمالية

متوسط الدرجة vs زمن الاستجابة (المتوسط)

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Inception: Mercury 2 100 100 0.0% 0 466ms 274 0
Qwen: Qwen3.5-35B-A3B 100 100 100.0% 0 21.75s 429 36,235
مجمّع النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Inception: Mercury 2 100 100 0.0% 0 606ms 131 0
Qwen: Qwen3.5-35B-A3B 100 16 66.7% 1 75.34s 775 12,485
تحليل البيانات واستخراجها النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Inception: Mercury 2 55 59 83.3% 1 667ms 180 0
Qwen: Qwen3.5-35B-A3B 55 59 83.3% 1 59.33s 235 19,493
خاص بالمجال النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Inception: Mercury 2 40 72 44.4% 1 534ms 46 0
Qwen: Qwen3.5-35B-A3B 100 44 44.5% 2 88.34s 41 46,368
اتباع التعليمات النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Inception: Mercury 2 55 100 50.0% 0 551ms 82 0
Qwen: Qwen3.5-35B-A3B 100 100 100.0% 0 24.45s 97 17,361
Puzzle Solving النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Inception: Mercury 2 100 100 0.0% 0 533ms 234 0
Qwen: Qwen3.5-35B-A3B 40 44 77.8% 2 31.58s 3,589 32,206
استدعاء الأدوات النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Inception: Mercury 2 100 100 100.0% 0 1.27s 197 0
Qwen: Qwen3.5-35B-A3B 100 100 100.0% 0 4.65s 309 1,365

مقارنة سريعة

تبديل زوج المقارنة