يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)17.37sزمن الاستجابة (الحد الأقصى)100.93sزمن الاستجابة (الإجمالي)260.52sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)21.06sزمن الاستجابة (الحد الأقصى)100.41sزمن الاستجابة (الإجمالي)315.95sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
الاتساق
9.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
8.9تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
التكلفة لكل نتيجة
4.418يعرض متوسط التكلفة لكل إجابة صحيحة في المعيار بالسنت (الأقل أفضل).…
6.533يعرض متوسط التكلفة لكل إجابة صحيحة في المعيار بالسنت (الأقل أفضل).…
إجمالي التكلفة
$0.531إجمالي التكلفة…
$0.784إجمالي التكلفة…
معدل النجاح لكل محاولة
88.9%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
86.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
اختبارات غير مستقرة
2الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
2الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
common.totalRuns
45 (15 x 3)common.totalRuns…
45 (15 x 3)common.totalRuns…
رموز الإخراج
1,577رموز الإخراج…
1,611رموز الإخراج…
رموز الاستدلال
33,017رموز الاستدلال…
46,321رموز الاستدلال…
زمن الاستجابة (المتوسط)
17.37sزمن الاستجابة (المتوسط)…
21.06sزمن الاستجابة (المتوسط)…
زمن الاستجابة (الحد الأقصى)
100.93sزمن الاستجابة (الحد الأقصى)…
100.41sزمن الاستجابة (الحد الأقصى)…
زمن الاستجابة (الإجمالي)
260.52sزمن الاستجابة (الإجمالي)…
315.95sزمن الاستجابة (الإجمالي)…
أفضل النماذج حسب الدرجة
الدرجة مقابل التكلفة الإجمالية
زمن الاستجابة (المتوسط)
متوسط الدرجة vs زمن الاستجابة (المتوسط)
تفصيل الفئات
حيل مضادة للذكاء الاصطناعي
النتيجة
الاتساق
معدل النجاح لكل محاولة
اختبارات غير مستقرة
اختبارات صحيحة
زمن الاستجابة (المتوسط)
رموز الإخراج
رموز الاستدلال
OpenAI: GPT-5.3-Codex
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)4.69sزمن الاستجابة (الحد الأقصى)6.68sزمن الاستجابة (الإجمالي)14.06sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
4.69sزمن الاستجابة (المتوسط)…
216رموز الإخراج…
1,421رموز الاستدلال…
OpenAI: GPT-5.4
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)5.02sزمن الاستجابة (الحد الأقصى)6.42sزمن الاستجابة (الإجمالي)15.06sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
5.02sزمن الاستجابة (المتوسط)…
216رموز الإخراج…
1,466رموز الاستدلال…
مجمّع
النتيجة
الاتساق
معدل النجاح لكل محاولة
اختبارات غير مستقرة
اختبارات صحيحة
زمن الاستجابة (المتوسط)
رموز الإخراج
رموز الاستدلال
OpenAI: GPT-5.3-Codex
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)19.56sزمن الاستجابة (الحد الأقصى)19.56sزمن الاستجابة (الإجمالي)19.56sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
19.56sزمن الاستجابة (المتوسط)…
364رموز الإخراج…
2,731رموز الاستدلال…
OpenAI: GPT-5.4
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)20.57sزمن الاستجابة (الحد الأقصى)20.57sزمن الاستجابة (الإجمالي)20.57sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
20.57sزمن الاستجابة (المتوسط)…
301رموز الإخراج…
3,543رموز الاستدلال…
تحليل البيانات واستخراجها
النتيجة
الاتساق
معدل النجاح لكل محاولة
اختبارات غير مستقرة
اختبارات صحيحة
زمن الاستجابة (المتوسط)
رموز الإخراج
رموز الاستدلال
OpenAI: GPT-5.3-Codex
9.9متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)3.07sزمن الاستجابة (الحد الأقصى)3.59sزمن الاستجابة (الإجمالي)6.15sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
3.07sزمن الاستجابة (المتوسط)…
234رموز الإخراج…
728رموز الاستدلال…
OpenAI: GPT-5.4
9.9متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)5.32sزمن الاستجابة (الحد الأقصى)5.40sزمن الاستجابة (الإجمالي)10.64sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
5.32sزمن الاستجابة (المتوسط)…
234رموز الإخراج…
804رموز الاستدلال…
خاص بالمجال
النتيجة
الاتساق
معدل النجاح لكل محاولة
اختبارات غير مستقرة
اختبارات صحيحة
زمن الاستجابة (المتوسط)
رموز الإخراج
رموز الاستدلال
OpenAI: GPT-5.3-Codex
4.0متوسط الدرجة عبر جميع اختبارات القياس.…
7.2تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
55.6%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2زمن الاستجابة (المتوسط)64.31sزمن الاستجابة (الحد الأقصى)100.93sزمن الاستجابة (الإجمالي)192.94sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
64.31sزمن الاستجابة (المتوسط)…
64رموز الإخراج…
25,308رموز الاستدلال…
OpenAI: GPT-5.4
4.0متوسط الدرجة عبر جميع اختبارات القياس.…
7.2تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
44.4%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2زمن الاستجابة (المتوسط)74.27sزمن الاستجابة (الحد الأقصى)100.41sزمن الاستجابة (الإجمالي)222.80sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
74.27sزمن الاستجابة (المتوسط)…
61رموز الإخراج…
34,748رموز الاستدلال…
اتباع التعليمات
النتيجة
الاتساق
معدل النجاح لكل محاولة
اختبارات غير مستقرة
اختبارات صحيحة
زمن الاستجابة (المتوسط)
رموز الإخراج
رموز الاستدلال
OpenAI: GPT-5.3-Codex
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)3.04sزمن الاستجابة (الحد الأقصى)3.44sزمن الاستجابة (الإجمالي)6.07sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
3.04sزمن الاستجابة (المتوسط)…
93رموز الإخراج…
693رموز الاستدلال…
OpenAI: GPT-5.4
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)3.11sزمن الاستجابة (الحد الأقصى)3.68sزمن الاستجابة (الإجمالي)6.22sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
3.11sزمن الاستجابة (المتوسط)…
93رموز الإخراج…
897رموز الاستدلال…
Puzzle Solving
النتيجة
الاتساق
معدل النجاح لكل محاولة
اختبارات غير مستقرة
اختبارات صحيحة
زمن الاستجابة (المتوسط)
رموز الإخراج
رموز الاستدلال
OpenAI: GPT-5.3-Codex
9.3متوسط الدرجة عبر جميع اختبارات القياس.…
7.9تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
88.9%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)5.12sزمن الاستجابة (الحد الأقصى)8.73sزمن الاستجابة (الإجمالي)15.37sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
5.12sزمن الاستجابة (المتوسط)…
352رموز الإخراج…
1,644رموز الاستدلال…
OpenAI: GPT-5.4
7.0متوسط الدرجة عبر جميع اختبارات القياس.…
7.2تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
88.9%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)9.13sزمن الاستجابة (الحد الأقصى)18.14sزمن الاستجابة (الإجمالي)27.39sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
9.13sزمن الاستجابة (المتوسط)…
442رموز الإخراج…
3,832رموز الاستدلال…
استدعاء الأدوات
النتيجة
الاتساق
معدل النجاح لكل محاولة
اختبارات غير مستقرة
اختبارات صحيحة
زمن الاستجابة (المتوسط)
رموز الإخراج
رموز الاستدلال
OpenAI: GPT-5.3-Codex
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)6.37sزمن الاستجابة (الحد الأقصى)6.37sزمن الاستجابة (الإجمالي)6.37sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
6.37sزمن الاستجابة (المتوسط)…
254رموز الإخراج…
492رموز الاستدلال…
OpenAI: GPT-5.4
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)13.28sزمن الاستجابة (الحد الأقصى)13.28sزمن الاستجابة (الإجمالي)13.28sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…