9.6تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
7.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
التكلفة لكل نتيجة
0.000يعرض متوسط التكلفة لكل إجابة صحيحة في المعيار بالسنت (الأقل أفضل).…
0.856يعرض متوسط التكلفة لكل إجابة صحيحة في المعيار بالسنت (الأقل أفضل).…
إجمالي التكلفة
$0.000إجمالي التكلفة…
$0.060إجمالي التكلفة…
اختبارات صحيحة
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 9لم يتبع التعليمات: 2زمن الاستجابة (المتوسط)3.15sزمن الاستجابة (الحد الأقصى)8.91sزمن الاستجابة (الإجمالي)50.46sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 5لم يتبع التعليمات: 3انتهت المهلة: 1زمن الاستجابة (المتوسط)47.94sزمن الاستجابة (الحد الأقصى)204.02sزمن الاستجابة (الإجمالي)431.47sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
معدل النجاح لكل محاولة
33.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
60.4%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
اختبارات غير مستقرة
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
6الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
إجمالي مرات التشغيل
48إجمالي مرات التشغيل…
48إجمالي مرات التشغيل…
رموز الإخراج
1,837رموز الإخراج…
4,386رموز الإخراج…
رموز الاستدلال
0رموز الاستدلال…
142,080رموز الاستدلال…
زمن الاستجابة (المتوسط)
3.15sزمن الاستجابة (المتوسط)…
47.94sزمن الاستجابة (المتوسط)…
زمن الاستجابة (الحد الأقصى)
8.91sزمن الاستجابة (الحد الأقصى)…
204.02sزمن الاستجابة (الحد الأقصى)…
زمن الاستجابة (الإجمالي)
50.46sزمن الاستجابة (الإجمالي)…
431.47sزمن الاستجابة (الإجمالي)…
أفضل النماذج حسب الدرجة
الدرجة مقابل التكلفة الإجمالية
زمن الاستجابة (المتوسط)
متوسط الدرجة vs زمن الاستجابة (المتوسط)
تفصيل الفئات
حيل مضادة للذكاء الاصطناعي
النتيجة
الاتساق
معدل النجاح لكل محاولة
اختبارات غير مستقرة
اختبارات صحيحة
زمن الاستجابة (المتوسط)
رموز الإخراج
رموز الاستدلال
Trinity Large Preview
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 3زمن الاستجابة (المتوسط)3.59sزمن الاستجابة (الحد الأقصى)8.17sزمن الاستجابة (الإجمالي)10.78sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
3.59sزمن الاستجابة (المتوسط)…
587رموز الإخراج…
0رموز الاستدلال…
OpenAI: GPT-5 Nano
7.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)37.73sزمن الاستجابة (الحد الأقصى)37.73sزمن الاستجابة (الإجمالي)37.73sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
37.73sزمن الاستجابة (المتوسط)…
1,107رموز الإخراج…
19,968رموز الاستدلال…
مجمّع
النتيجة
الاتساق
معدل النجاح لكل محاولة
اختبارات غير مستقرة
اختبارات صحيحة
زمن الاستجابة (المتوسط)
رموز الإخراج
رموز الاستدلال
Trinity Large Preview
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)8.91sزمن الاستجابة (الحد الأقصى)8.91sزمن الاستجابة (الإجمالي)8.91sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
8.91sزمن الاستجابة (المتوسط)…
294رموز الإخراج…
0رموز الاستدلال…
OpenAI: GPT-5 Nano
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)65.96sزمن الاستجابة (الحد الأقصى)65.96sزمن الاستجابة (الإجمالي)65.96sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
65.96sزمن الاستجابة (المتوسط)…
578رموز الإخراج…
17,984رموز الاستدلال…
تحليل البيانات واستخراجها
النتيجة
الاتساق
معدل النجاح لكل محاولة
اختبارات غير مستقرة
اختبارات صحيحة
زمن الاستجابة (المتوسط)
رموز الإخراج
رموز الاستدلال
Trinity Large Preview
9.9متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)3.26sزمن الاستجابة (الحد الأقصى)4.66sزمن الاستجابة (الإجمالي)6.52sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
3.26sزمن الاستجابة (المتوسط)…
186رموز الإخراج…
0رموز الاستدلال…
OpenAI: GPT-5 Nano
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
1.7تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
50.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
2الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2زمن الاستجابة (المتوسط)21.42sزمن الاستجابة (الحد الأقصى)21.42sزمن الاستجابة (الإجمالي)21.42sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
21.42sزمن الاستجابة (المتوسط)…
453رموز الإخراج…
10,560رموز الاستدلال…
خاص بالمجال
النتيجة
الاتساق
معدل النجاح لكل محاولة
اختبارات غير مستقرة
اختبارات صحيحة
زمن الاستجابة (المتوسط)
رموز الإخراج
رموز الاستدلال
Trinity Large Preview
4.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
33.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2زمن الاستجابة (المتوسط)877msزمن الاستجابة (الحد الأقصى)894msزمن الاستجابة (الإجمالي)2.63sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
877msزمن الاستجابة (المتوسط)…
25رموز الإخراج…
0رموز الاستدلال…
OpenAI: GPT-5 Nano
4.0متوسط الدرجة عبر جميع اختبارات القياس.…
4.4تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
55.6%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
2الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.انتهت المهلة: 1إجابة خاطئة: 1زمن الاستجابة (المتوسط)204.02sزمن الاستجابة (الحد الأقصى)204.02sزمن الاستجابة (الإجمالي)204.02sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
204.02sزمن الاستجابة (المتوسط)…
237رموز الإخراج…
64,448رموز الاستدلال…
الذكاء العام
النتيجة
الاتساق
معدل النجاح لكل محاولة
اختبارات غير مستقرة
اختبارات صحيحة
زمن الاستجابة (المتوسط)
رموز الإخراج
رموز الاستدلال
Trinity Large Preview
3.0متوسط الدرجة عبر جميع اختبارات القياس.…
9.9تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)2.86sزمن الاستجابة (الحد الأقصى)2.86sزمن الاستجابة (الإجمالي)2.86sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
2.86sزمن الاستجابة (المتوسط)…
124رموز الإخراج…
0رموز الاستدلال…
OpenAI: GPT-5 Nano
3.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)17.51sزمن الاستجابة (الحد الأقصى)17.51sزمن الاستجابة (الإجمالي)17.51sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
17.51sزمن الاستجابة (المتوسط)…
202رموز الإخراج…
4,608رموز الاستدلال…
اتباع التعليمات
النتيجة
الاتساق
معدل النجاح لكل محاولة
اختبارات غير مستقرة
اختبارات صحيحة
زمن الاستجابة (المتوسط)
رموز الإخراج
رموز الاستدلال
Trinity Large Preview
3.5متوسط الدرجة عبر جميع اختبارات القياس.…
6.7تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
16.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1إجابة خاطئة: 1زمن الاستجابة (المتوسط)1.09sزمن الاستجابة (الحد الأقصى)1.23sزمن الاستجابة (الإجمالي)2.19sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
1.09sزمن الاستجابة (المتوسط)…
63رموز الإخراج…
0رموز الاستدلال…
OpenAI: GPT-5 Nano
9.0متوسط الدرجة عبر جميع اختبارات القياس.…
6.8تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
83.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)11.90sزمن الاستجابة (الحد الأقصى)11.90sزمن الاستجابة (الإجمالي)11.90sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
11.90sزمن الاستجابة (المتوسط)…
382رموز الإخراج…
4,096رموز الاستدلال…
Puzzle Solving
النتيجة
الاتساق
معدل النجاح لكل محاولة
اختبارات غير مستقرة
اختبارات صحيحة
زمن الاستجابة (المتوسط)
رموز الإخراج
رموز الاستدلال
Trinity Large Preview
4.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
33.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2زمن الاستجابة (المتوسط)3.30sزمن الاستجابة (الحد الأقصى)4.81sزمن الاستجابة (الإجمالي)9.91sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
3.30sزمن الاستجابة (المتوسط)…
291رموز الإخراج…
0رموز الاستدلال…
OpenAI: GPT-5 Nano
4.0متوسط الدرجة عبر جميع اختبارات القياس.…
7.2تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
44.4%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1إجابة خاطئة: 1زمن الاستجابة (المتوسط)19.81sزمن الاستجابة (الحد الأقصى)21.31sزمن الاستجابة (الإجمالي)39.63sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
19.81sزمن الاستجابة (المتوسط)…
869رموز الإخراج…
13,440رموز الاستدلال…
استدعاء الأدوات
النتيجة
الاتساق
معدل النجاح لكل محاولة
اختبارات غير مستقرة
اختبارات صحيحة
زمن الاستجابة (المتوسط)
رموز الإخراج
رموز الاستدلال
Trinity Large Preview
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)6.67sزمن الاستجابة (الحد الأقصى)6.67sزمن الاستجابة (الإجمالي)6.67sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
6.67sزمن الاستجابة (المتوسط)…
267رموز الإخراج…
0رموز الاستدلال…
OpenAI: GPT-5 Nano
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)33.30sزمن الاستجابة (الحد الأقصى)33.30sزمن الاستجابة (الإجمالي)33.30sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…