AI BENCHY Compare
OpenAI: GPT-5.5 vs xAI: Grok 4.3
تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-05-01
| المقياس | GPT-5.5 GPT-5.5 low | Grok 4.3 Grok 4.3 medium |
|---|---|---|
| النتيجة | 9.0 | 8.2 |
| الترتيب | #5 | #20 |
| الموثوقية | 10.0 | 10.0 |
| الاتساق | 9.6 | 8.6 |
| اختبارات صحيحة | ||
| معدل النجاح لكل محاولة | 87.0% | 81.5% |
| اختبارات غير مستقرة | 1 | 3 |
| إجمالي مرات التشغيل | 54 | 54 |
| التكلفة لكل نتيجة | 4.534 | 3.974 |
| إجمالي التكلفة | $0.681 | $0.517 |
| ??? ??????? | $5.000 / 1M | $1.250 / 1M |
| ??? ??????? | $30.000 / 1M | $2.500 / 1M |
| رموز الإخراج | 1,959 | 1,223 |
| رموز الاستدلال | 16,134 | 187,047 |
| زمن الاستجابة (المتوسط) | 8.39s | 48.63s |
| زمن الاستجابة (الحد الأقصى) | 56.19s | 216.69s |
| زمن الاستجابة (الإجمالي) | 151.01s | 875.27s |
الدرجة مقابل التكلفة الإجمالية
زمن الاستجابة (المتوسط)
النتيجة vs زمن الاستجابة (المتوسط)
إجمالي رموز الإخراج
النتيجة vs إجمالي رموز الإخراج
تفصيل الفئات
مقارنة سريعة
تبديل زوج المقارنة
HY3 Previewlowمتاح مجانًاvsGrok 4.3mediumGemini 3 Flash PreviewnonevsGrok 4.3mediumGemini 3.1 Flash Lite PreviewlowvsGrok 4.3mediumClaude Opus 4.7nonevsGPT-5.5lowClaude Opus 4.7mediumvsGPT-5.5lowGPT-5.5lowvsQwen3.6 Max PreviewmediumGPT-5.5lowvsQwen3.6 35B A3BmediumGPT-5.2 ChatnonevsGrok 4.3mediumGemini 3.1 Flash Lite PreviewnonevsGrok 4.3mediumGPT-5.3 ChatnonevsGrok 4.3mediumGPT-5.5lowvsHY3 Previewhighمتاح مجانًاHY3 Previewhighمتاح مجانًاvsGrok 4.3medium