مقارنة benchmark بين Gemini 3.5 Flash و Grok 4.20 Beta: يتقدم Gemini 3.5 Flash في متوسط النتيجة بـ 9.4 مقابل 5.8. لدى Grok 4.20 Beta تكلفة benchmark أقل عند $0.087 مقابل $0.349. Grok 4.20 Beta أسرع عند 1.19s مقابل 3.27s، مع معدلات نجاح 90.5% مقابل 37.0%.
النموذج الموصى به: Gemini 3.5 Flash - It has the strongest score in this comparison (9.4) and the best overall balance of cost and response time across all 2 models.
تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-06-10
Grok 4.20 BetaGrok 4.20 Betanoneنموذج مؤرشف: لن يتم تحديث هذا النموذج أو اختباره على اختبارات جديدة بعد الآن.الإصدار: 2026-03-12
النتيجة
9.4متوسط الدرجة عبر جميع اختبارات القياس.…
5.8متوسط الدرجة عبر جميع اختبارات القياس.…
الترتيب
#3
#107
الموثوقية
10.0درجة النجاح من المحاولة الأولى: 10.0 تعني عدم وجود إخفاقات قابلة لإعادة المحاولة من واجهة API الهدف أو حدود المعدل قبل النداءات الناجحة؛ الإخفاقات المسجلة تخفض الدرجة.…
غير متاحدرجة النجاح من المحاولة الأولى: 10.0 تعني عدم وجود إخفاقات قابلة لإعادة المحاولة من واجهة API الهدف أو حدود المعدل قبل النداءات الناجحة؛ الإخفاقات المسجلة تخفض الدرجة.…
الاتساق
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
9.6تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
اختبارات صحيحة
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2زمن الاستجابة (المتوسط)3.27sزمن الاستجابة (الحد الأقصى)9.05sزمن الاستجابة (الإجمالي)68.65sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 10لم يتبع التعليمات: 1استدعاء أداة غير صالح: 1زمن الاستجابة (المتوسط)1.19sزمن الاستجابة (الحد الأقصى)6.48sزمن الاستجابة (الإجمالي)21.43sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
معدل النجاح لكل محاولة
90.5%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
37.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
اختبارات غير مستقرة
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
إجمالي مرات التشغيل
63إجمالي مرات التشغيل…
52إجمالي مرات التشغيل…
التكلفة لكل نتيجة
1.834يعرض متوسط التكلفة لكل إجابة صحيحة في المعيار بالسنت (الأقل أفضل).…
1.510يعرض متوسط التكلفة لكل إجابة صحيحة في المعيار بالسنت (الأقل أفضل).…
إجمالي التكلفة
$0.349إجمالي التكلفة (السعر الحالي)…
$0.087إجمالي التكلفة (السعر الحالي)…
سعر الإدخال
$1.500 / 1Mسعر الإدخال…
$2.041 / 1Mسعر الإدخال…
سعر الإخراج
$9.000 / 1Mسعر الإخراج…
$2.041 / 1Mسعر الإخراج…
إجمالي رموز الإدخال
36,938إجمالي رموز الإدخال…
40,597إجمالي رموز الإدخال…
رموز الإخراج
2,033رموز الإخراج…
1,657رموز الإخراج…
رموز الاستدلال
30,519رموز الاستدلال…
0رموز الاستدلال…
زمن الاستجابة (المتوسط)
3.27sزمن الاستجابة (المتوسط)…
1.19sزمن الاستجابة (المتوسط)…
زمن الاستجابة (الحد الأقصى)
9.05sزمن الاستجابة (الحد الأقصى)…
6.48sزمن الاستجابة (الحد الأقصى)…
زمن الاستجابة (الإجمالي)
68.65sزمن الاستجابة (الإجمالي)…
21.43sزمن الاستجابة (الإجمالي)…
Generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)2.52sزمن الاستجابة (الحد الأقصى)5.40sزمن الاستجابة (الإجمالي)10.08sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
2.52sزمن الاستجابة (المتوسط)…
494إجمالي رموز الإدخال…
209رموز الإخراج…
2,536رموز الاستدلال…
Grok 4.20 Betaنموذج مؤرشف: لن يتم تحديث هذا النموذج أو اختباره على اختبارات جديدة بعد الآن.
4.0متوسط الدرجة عبر جميع اختبارات القياس.…
8.4تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
16.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 4زمن الاستجابة (المتوسط)597msزمن الاستجابة (الحد الأقصى)866msزمن الاستجابة (الإجمالي)2.39sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)6.71sزمن الاستجابة (الحد الأقصى)9.05sزمن الاستجابة (الإجمالي)20.13sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
6.71sزمن الاستجابة (المتوسط)…
8,118إجمالي رموز الإدخال…
458رموز الإخراج…
13,420رموز الاستدلال…
Grok 4.20 Betaنموذج مؤرشف: لن يتم تحديث هذا النموذج أو اختباره على اختبارات جديدة بعد الآن.
5.5متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)1.14sزمن الاستجابة (الحد الأقصى)1.14sزمن الاستجابة (الإجمالي)1.14sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)6.44sزمن الاستجابة (الحد الأقصى)6.44sزمن الاستجابة (الإجمالي)6.44sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
6.44sزمن الاستجابة (المتوسط)…
12,873إجمالي رموز الإدخال…
351رموز الإخراج…
3,050رموز الاستدلال…
Grok 4.20 Betaنموذج مؤرشف: لن يتم تحديث هذا النموذج أو اختباره على اختبارات جديدة بعد الآن.
3.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.استدعاء أداة غير صالح: 1زمن الاستجابة (المتوسط)6.48sزمن الاستجابة (الحد الأقصى)6.48sزمن الاستجابة (الإجمالي)6.48sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)1.81sزمن الاستجابة (الحد الأقصى)2.32sزمن الاستجابة (الإجمالي)3.63sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
1.81sزمن الاستجابة (المتوسط)…
7,548إجمالي رموز الإدخال…
279رموز الإخراج…
1,164رموز الاستدلال…
Grok 4.20 Betaنموذج مؤرشف: لن يتم تحديث هذا النموذج أو اختباره على اختبارات جديدة بعد الآن.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)601msزمن الاستجابة (الحد الأقصى)634msزمن الاستجابة (الإجمالي)1.20sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)3.39sزمن الاستجابة (الحد الأقصى)4.44sزمن الاستجابة (الإجمالي)10.16sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
3.39sزمن الاستجابة (المتوسط)…
633إجمالي رموز الإدخال…
12رموز الإخراج…
4,538رموز الاستدلال…
Grok 4.20 Betaنموذج مؤرشف: لن يتم تحديث هذا النموذج أو اختباره على اختبارات جديدة بعد الآن.
3.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 3زمن الاستجابة (المتوسط)611msزمن الاستجابة (الحد الأقصى)616msزمن الاستجابة (الإجمالي)1.83sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)2.27sزمن الاستجابة (الحد الأقصى)2.27sزمن الاستجابة (الإجمالي)2.27sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
2.27sزمن الاستجابة (المتوسط)…
486إجمالي رموز الإدخال…
119رموز الإخراج…
916رموز الاستدلال…
Grok 4.20 Betaنموذج مؤرشف: لن يتم تحديث هذا النموذج أو اختباره على اختبارات جديدة بعد الآن.
5.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)541msزمن الاستجابة (الحد الأقصى)541msزمن الاستجابة (الإجمالي)541msيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)1.86sزمن الاستجابة (الحد الأقصى)2.10sزمن الاستجابة (الإجمالي)3.73sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
1.86sزمن الاستجابة (المتوسط)…
615إجمالي رموز الإدخال…
71رموز الإخراج…
1,652رموز الاستدلال…
Grok 4.20 Betaنموذج مؤرشف: لن يتم تحديث هذا النموذج أو اختباره على اختبارات جديدة بعد الآن.
6.3متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
50.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)649msزمن الاستجابة (الحد الأقصى)952msزمن الاستجابة (الإجمالي)1.30sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)2.35sزمن الاستجابة (الحد الأقصى)3.25sزمن الاستجابة (الإجمالي)7.06sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
2.35sزمن الاستجابة (المتوسط)…
558إجمالي رموز الإدخال…
288رموز الإخراج…
2,150رموز الاستدلال…
Grok 4.20 Betaنموذج مؤرشف: لن يتم تحديث هذا النموذج أو اختباره على اختبارات جديدة بعد الآن.
7.7متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)586msزمن الاستجابة (الحد الأقصى)813msزمن الاستجابة (الإجمالي)1.76sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)3.27sزمن الاستجابة (الحد الأقصى)3.27sزمن الاستجابة (الإجمالي)3.27sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
3.27sزمن الاستجابة (المتوسط)…
5,457إجمالي رموز الإدخال…
234رموز الإخراج…
403رموز الاستدلال…
Grok 4.20 Betaنموذج مؤرشف: لن يتم تحديث هذا النموذج أو اختباره على اختبارات جديدة بعد الآن.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)4.79sزمن الاستجابة (الحد الأقصى)4.79sزمن الاستجابة (الإجمالي)4.79sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)1.88sزمن الاستجابة (الحد الأقصى)1.88sزمن الاستجابة (الإجمالي)1.88sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
1.88sزمن الاستجابة (المتوسط)…
156إجمالي رموز الإدخال…
12رموز الإخراج…
690رموز الاستدلال…
Grok 4.20 Betaنموذج مؤرشف: لن يتم تحديث هذا النموذج أو اختباره على اختبارات جديدة بعد الآن.