التنقل
AI BENCHY
Advertise here

النماذج المقارنة

مقارنة benchmark بين Qwen3.8 2.4T A95B (low) vs Qwen3.8 2.4T A95B (high) vs Grok 4.6 (high): يتصدر Grok 4.6 (high) في النتيجة بقيمة 9.2. يتصدر Grok 4.6 (high) في الموثوقية بقيمة 10.0. يمتلك Grok 4.6 (high) أقل إجمالي التكلفة عند $1.809. Grok 4.6 (high) هو الأسرع عند 79.38s.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-08-12

الترتيب
#46
إجمالي رموز الإخراج
554,485
زمن الاستجابة (المتوسط)
132.39s
إجمالي التكلفة
$3.113
الترتيب
#85
إجمالي رموز الإخراج
512,351
زمن الاستجابة (المتوسط)
134.41s
إجمالي التكلفة
$2.755
الترتيب
#11
إجمالي رموز الإخراج
265,604
زمن الاستجابة (المتوسط)
79.38s
إجمالي التكلفة
$1.809
النموذج الموصى به Grok 4.6 (high)

It has the best score here (9.2), while costing about 1.6x less than النماذج الأخرى في هذه المقارنة.

مقارنة تفصيلية

المقياس Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B low الإصدار: 2026-08-12 Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B high الإصدار: 2026-08-12 Grok 4.6 Grok 4.6 high الإصدار: 2026-08-12
النتيجة 8.2 7.5 9.2
الترتيب #46 #85 #11
الموثوقية 9.1 8.8 10.0
الاتساق 8.9 8.4 9.6
محاولات 66/66 66/66 66/66
اختبارات صحيحة
معدل النجاح لكل محاولة 78.8% 77.3% 84.9%
اختبارات غير مستقرة 3 4 1
إجمالي مرات التشغيل 66 66 66
التكلفة لكل نتيجة 19.453 18.365 10.046
إجمالي التكلفة $3.113 $2.755 $1.809
سعر الإدخال $2.000 / 1M $2.000 / 1M $2.000 / 1M
سعر الإخراج $6.000 / 1M $6.000 / 1M $6.000 / 1M
إجمالي رموز الإدخال 113,340 109,036 107,266
رموز الإخراج 107,311 103,736 5,094
رموز الاستدلال 447,174 408,615 260,510
زمن الاستجابة (المتوسط) 132.39s 134.41s 79.38s
زمن الاستجابة (الحد الأقصى) 534.21s 532.28s 618.49s
زمن الاستجابة (الإجمالي) 2912.56s 2956.97s 1746.29s
المعلمات 2.4T الإجمالي (95B النشطة) 2.4T الإجمالي (95B النشطة) ~1.7T الإجمالي (~170B النشطة)
الإتاحة الأوزان متاحة الأوزان متاحة مغلق المصدر

عرض إنشاء النماذج

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#46 Qwen3.8 2.4T A95B

low
التكلفة
$0.100
الوقت
193.2s
الرموز
16,767 tok

#85 Qwen3.8 2.4T A95B

high
SVG غير صالح
التكلفة
$0.000
الوقت
600.0s
الرموز
0 tok

#11 SpaceXAI: Grok 4.6

high
التكلفة
$0.107
الوقت
265.1s
الرموز
18,001 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Qwen3.8 2.4T A95B 7.6 7.2 77.8% 1 172.53s 6,716 21,405 57,399
Qwen3.8 2.4T A95B 5.9 6.3 55.6% 1 160.52s 6,399 3,310 48,078
Grok 4.6 10.0 10.0 100.0% 0 102.20s 9,579 379 51,829

مقارنة سريعة

تبديل زوج المقارنة