التنقل
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Qwen3.8 2.4T A95B (high) vs Grok Build 0.1 (medium)

يتقدم Grok Build 0.1 (medium) في متوسط النتيجة بـ 7.5 مقابل 7.4. لدى Grok Build 0.1 (medium) تكلفة benchmark أقل عند $1.130 مقابل $2.357. Grok Build 0.1 (medium) أسرع عند 54.50s مقابل 120.59s، مع معدلات نجاح 74.2% مقابل 60.6%.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-08-14

الترتيب
#92
إجمالي رموز الإخراج
456,028
زمن الاستجابة (المتوسط)
120.59s
إجمالي التكلفة
$2.357
الترتيب
#86
إجمالي رموز الإخراج
511,406
زمن الاستجابة (المتوسط)
54.50s
إجمالي التكلفة
$1.130
النموذج الموصى به Grok Build 0.1 (medium)

It has the best score here (7.5), while costing about 2.1x less than Qwen3.8 2.4T A95B (high).

مقارنة تفصيلية

المقياس Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B high الإصدار: 2026-08-12 Grok Build 0.1 Grok Build 0.1 medium الإصدار: 2026-05-21
النتيجة 7.4 7.5
الترتيب #92 #86
الموثوقية 9.4 10.0
الاتساق 8.3 9.6
محاولات 66/66 66/66
اختبارات صحيحة
معدل النجاح لكل محاولة 74.2% 60.6%
اختبارات غير مستقرة 4 1
إجمالي مرات التشغيل 66 66
التكلفة لكل نتيجة 16.832 8.691
إجمالي التكلفة $2.357 $1.130
سعر الإدخال $2.000 / 1M $1.000 / 1M
سعر الإخراج $6.000 / 1M $2.000 / 1M
إجمالي رموز الإدخال 108,931 106,946
رموز الإخراج 112,801 7,993
رموز الاستدلال 343,227 503,413
زمن الاستجابة (المتوسط) 120.59s 54.50s
زمن الاستجابة (الحد الأقصى) 532.28s 252.69s
زمن الاستجابة (الإجمالي) 2653.05s 1199.07s
المعلمات 2.4T الإجمالي (95B النشطة) ~300B الإجمالي (~30B النشطة)
الإتاحة الأوزان متاحة مغلق المصدر

عرض إنشاء النماذج

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#92 Qwen3.8 2.4T A95B

high
SVG غير صالح
التكلفة
$0.000
الوقت
600.0s
الرموز
0 tok

#86 SpaceXAI: Grok Build 0.1

medium
التكلفة
$0.028
الوقت
81.3s
الرموز
14,009 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Qwen3.8 2.4T A95B 5.9 6.3 55.6% 1 160.52s 6,399 3,310 48,078
Grok Build 0.1 5.7 9.7 33.3% 0 108.46s 8,304 1,138 161,452

مقارنة سريعة

تبديل زوج المقارنة