التنقل
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

النماذج المقارنة

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-03-12

المقياس Grok 4.20 Beta Grok 4.20 Beta medium الإصدار: 2026-03-12 Grok 4.1 Fast Grok 4.1 Fast medium الإصدار: 2025-11-19 Hunter Alpha Hunter Alpha medium الإصدار: تاريخ الإصدار غير معروف
الترتيب #24 #32 #35
متوسط الدرجة 7.0 6.2 5.9
الاتساق 9.0 7.9 7.6
التكلفة لكل نتيجة 5.989 0.563 0.000
إجمالي التكلفة $0.599 $0.051 $0.000
اختبارات صحيحة
معدل النجاح لكل محاولة 70.8% 66.7% 68.8%
اختبارات غير مستقرة 2 4 5
إجمالي مرات التشغيل 48 48 48
رموز الإخراج 1,481 1,183 4,686
رموز الاستدلال 86,628 83,875 17,821
زمن الاستجابة (المتوسط) 8.89s 26.35s 10.71s
زمن الاستجابة (الحد الأقصى) 24.21s 121.79s 30.53s
زمن الاستجابة (الإجمالي) 142.18s 237.11s 171.41s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

متوسط الدرجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

متوسط الدرجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Grok 4.20 Beta 7.0 7.2 88.9% 1 3.19s 262 6,289
Grok 4.1 Fast 10.0 10.0 100.0% 0 5.65s 102 4,021
Hunter Alpha 7.0 7.2 88.9% 1 4.93s 441 1,003
مجمّع النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Grok 4.20 Beta 10.0 10.0 100.0% 0 20.93s 227 12,212
Grok 4.1 Fast 10.0 10.0 100.0% 0 37.64s 261 12,272
Hunter Alpha 10.0 1.6 66.7% 1 30.53s 792 3,456
تحليل البيانات واستخراجها النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Grok 4.20 Beta 9.9 10.0 100.0% 0 4.01s 180 5,281
Grok 4.1 Fast 9.9 10.0 100.0% 0 6.63s 180 5,409
Hunter Alpha 9.9 10.0 100.0% 0 23.16s 1,488 8,017
خاص بالمجال النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Grok 4.20 Beta 4.0 10.0 33.3% 0 21.33s 251 40,255
Grok 4.1 Fast 4.0 4.4 66.7% 2 121.79s 11 37,657
Hunter Alpha 10.0 10.0 0.0% 0 10.52s 892 2,406
الذكاء العام النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Grok 4.20 Beta 10.0 10.0 100.0% 0 5.78s 72 3,440
Grok 4.1 Fast 3.0 9.9 0.0% 0 16.25s 127 3,456
Hunter Alpha 8.0 3.7 66.7% 1 6.44s 116 260
اتباع التعليمات النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Grok 4.20 Beta 9.0 10.0 50.0% 0 4.97s 57 7,107
Grok 4.1 Fast 5.5 10.0 50.0% 0 5.30s 55 3,489
Hunter Alpha 9.5 10.0 100.0% 0 4.18s 208 465
Puzzle Solving النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Grok 4.20 Beta 7.0 7.2 88.9% 1 3.85s 249 6,660
Grok 4.1 Fast 4.0 7.2 44.4% 1 8.08s 187 6,086
Hunter Alpha 4.3 4.7 66.7% 2 5.36s 441 1,310
استدعاء الأدوات النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإخراج رموز الاستدلال
Grok 4.20 Beta 10.0 10.0 0.0% 0 12.39s 183 5,384
Grok 4.1 Fast 10.0 1.6 33.3% 1 27.71s 260 11,485
Hunter Alpha 10.0 10.0 100.0% 0 17.33s 308 904

مقارنة سريعة

تبديل زوج المقارنة