التنقل
Advertise here

النماذج المقارنة

مقارنة benchmark بين Qwen3.8 2.4T A95B (low) vs Qwen3.8 2.4T A95B (high) vs Grok 4.6 (high): يتصدر Grok 4.6 (high) في النتيجة بقيمة 9.3. يتصدر Grok 4.6 (high) في الموثوقية بقيمة 10.0. يمتلك Grok 4.6 (high) أقل إجمالي التكلفة عند $1.908. Grok 4.6 (high) هو الأسرع عند 84.15s.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-09-24

النماذج المقارنة

الترتيب
#78
إجمالي رموز الإخراج
495,541
زمن الاستجابة (المتوسط)
118.97s
إجمالي التكلفة
$2.672
الترتيب
#133
إجمالي رموز الإخراج
456,028
زمن الاستجابة (المتوسط)
120.59s
إجمالي التكلفة
$2.357
الترتيب
#19
إجمالي رموز الإخراج
282,217
زمن الاستجابة (المتوسط)
84.15s
إجمالي التكلفة
$1.908
النموذج الموصى به Grok 4.6 (high)

It has the strongest score in this comparison (9.3) and the best overall balance of cost and response time across all 3 models.

مقارنة تفصيلية

المقياس Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B low الإصدار: 2026-08-12 Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B high الإصدار: 2026-08-12 Grok 4.6 Grok 4.6 high الإصدار: 2026-08-12
النتيجة 8.1 7.4 9.3
الترتيب #78 #133 #19
الموثوقية 9.4 9.4 10.0
الاتساق 9.2 8.3 10.0
محاولات 66/66 66/66 66/66
اختبارات صحيحة
معدل النجاح لكل محاولة 72.7% 74.2% 86.4%
اختبارات غير مستقرة 2 4 0
إجمالي مرات التشغيل 66 66 66
التكلفة لكل نتيجة 17.812 16.832 10.042
إجمالي التكلفة $2.672 $2.357 $1.908
سعر الإدخال $2.000 / 1M $2.000 / 1M $2.000 / 1M
سعر الإخراج $6.000 / 1M $6.000 / 1M $6.000 / 1M
إجمالي رموز الإدخال 113,279 108,931 107,275
رموز الإخراج 121,045 112,801 5,094
رموز الاستدلال 374,496 343,227 277,123
زمن الاستجابة (المتوسط) 118.97s 120.59s 84.15s
زمن الاستجابة (الحد الأقصى) 534.21s 532.28s 618.49s
زمن الاستجابة (الإجمالي) 2617.41s 2653.05s 1851.26s
المعلمات 2.4T الإجمالي (95B النشطة) 2.4T الإجمالي (95B النشطة) ~1.7T الإجمالي (~170B النشطة)
الإتاحة الأوزان متاحة الأوزان متاحة مغلق المصدر

عرض إنشاء النماذج

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#78 Qwen3.8 2.4T A95B

low
التكلفة
$0.100
الوقت
193.2s
الرموز
16,767 tok

#133 Qwen3.8 2.4T A95B

high
Reached the allocated time limit (600 seconds) without receiving showcase output.
التكلفة
$0.000
الوقت
600.0s
الرموز
0 tok

#19 SpaceXAI: Grok 4.6

high
التكلفة
$0.107
الوقت
265.1s
الرموز
18,001 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Qwen3.8 2.4T A95B 7.8 9.3 66.7% 0 172.53s 6,716 21,405 57,399
Qwen3.8 2.4T A95B 5.9 6.3 55.6% 1 160.52s 6,399 3,310 48,078
Grok 4.6 10.0 10.0 100.0% 0 102.20s 9,579 379 51,829

مقارنة سريعة

تبديل زوج المقارنة