التنقل
AI BENCHY
Advertise here

AI BENCHY Compare

OpenAI: GPT-5.5 vs Grok 4.20 Beta

الملخص

مقارنة benchmark بين GPT-5.5 و Grok 4.20 Beta: يتقدم GPT-5.5 في متوسط النتيجة بـ 9.3 مقابل 6.8. لدى Grok 4.20 Beta تكلفة benchmark أقل عند $0.750 مقابل $0.907. Grok 4.20 Beta أسرع عند 9.75s مقابل 9.76s، مع معدلات نجاح 85.7% مقابل 69.8%.

النموذج الموصى به: GPT-5.5 - It has the strongest score in this comparison (9.3) and the best overall balance of cost and response time across all 2 models.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-06-18

المقياس GPT-5.5 GPT-5.5 low الإصدار: 2026-04-24 Grok 4.20 Beta Grok 4.20 Beta medium الإصدار: 2026-03-12
النتيجة 9.3 6.8
الترتيب #4 #69
الموثوقية 10.0 غير متاح
الاتساق 10.0 8.2
اختبارات صحيحة
معدل النجاح لكل محاولة 85.7% 69.8%
اختبارات غير مستقرة 0 1
إجمالي مرات التشغيل 63 52
التكلفة لكل نتيجة 5.035 4.505
إجمالي التكلفة $0.907 $0.750
سعر الإدخال $5.000 / 1M $5.805 / 1M
سعر الإخراج $30.000 / 1M $5.805 / 1M
إجمالي رموز الإدخال 34,209 35,955
رموز الإخراج 2,046 1,647
رموز الاستدلال 22,460 91,565
زمن الاستجابة (المتوسط) 9.76s 9.75s
زمن الاستجابة (الحد الأقصى) 56.19s 31.36s
زمن الاستجابة (الإجمالي) 204.92s 175.48s

عرض إنشاء

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#4 GPT-5.5

low
التكلفة
$0.068
الوقت
37.0s
الرموز
2,339 tok

#69 Grok 4.20 Beta

medium
التكلفة
$0.034
الوقت
91.0s
الرموز
13,523 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
GPT-5.5 10.0 10.0 100.0% 0 4.41s 606 238 1,020
Grok 4.20 Beta 8.7 7.9 91.7% 1 3.16s 2,010 268 7,583
البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
GPT-5.5 10.0 10.0 100.0% 0 15.04s 7,302 423 6,402
Grok 4.20 Beta 3.3 3.3 33.3% 0 31.36s 360 81 3,987
مجمّع النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
GPT-5.5 10.0 10.0 100.0% 0 9.56s 11,019 303 717
Grok 4.20 Beta 10.0 10.0 100.0% 0 20.93s 12,909 227 12,212
تحليل البيانات واستخراجها النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
GPT-5.5 10.0 10.0 100.0% 0 3.28s 7,140 228 157
Grok 4.20 Beta 10.0 10.0 100.0% 0 4.01s 7,761 180 5,281
خاص بالمجال النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
GPT-5.5 5.3 10.0 33.3% 0 28.05s 723 69 11,609
Grok 4.20 Beta 5.3 10.0 33.3% 0 21.33s 1,764 251 40,255
الذكاء العام النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
GPT-5.5 10.0 10.0 100.0% 0 5.17s 477 133 245
Grok 4.20 Beta 10.0 10.0 100.0% 0 5.78s 825 72 3,440
اتباع التعليمات النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
GPT-5.5 9.9 10.0 100.0% 0 3.74s 660 93 415
Grok 4.20 Beta 9.8 10.0 100.0% 0 4.89s 1,362 57 7,123
حل الألغاز النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
GPT-5.5 10.0 10.0 100.0% 0 4.74s 642 279 954
Grok 4.20 Beta 10.0 10.0 100.0% 0 3.52s 1,689 328 6,300
استدعاء الأدوات النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
GPT-5.5 10.0 10.0 100.0% 0 4.96s 5,445 250 101
Grok 4.20 Beta 3.0 10.0 0.0% 0 12.39s 7,275 183 5,384
معلومات عامة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
GPT-5.5 3.0 10.0 0.0% 0 10.06s 195 30 840
Grok 4.20 Beta 0.0 0.0 0.0% 0 0ms 0 0 0

مقارنة سريعة

تبديل زوج المقارنة