متوسط النتيجة متقارب جدًا عند 7.2 مقابل 7.2. لدى Qwen3.8 27B (medium) تكلفة benchmark أقل عند ~$0.073 مقابل $0.323. Gemini 3.8 Flash (low) أسرع عند 7.54s مقابل 40.09s، مع معدلات نجاح 81.2% مقابل 66.7%.
تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في:
2026-10-01
النماذج المقارنة
الترتيب
#142
إجمالي رموز الإخراج
42,741
زمن الاستجابة (المتوسط)
7.54s
إجمالي التكلفة
$0.323
تم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
الترتيب
#141
إجمالي رموز الإخراج
170,696
زمن الاستجابة (المتوسط)
40.09s
إجمالي التكلفة
~$0.073يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.7349 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.072660.
النموذج الموصى بهQwen3.8 27B (medium)
It has the best score here (7.2), while costing about 4.4x less than Gemini 3.8 Flash (low).
Qwen3.8 27BQwen3.8 27Bmediumتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.الإصدار: 2026-08-14متاح مجانًا
النتيجة
7.2متوسط الدرجة عبر جميع اختبارات القياس.…
7.2متوسط الدرجة عبر جميع اختبارات القياس.…
الترتيب
#142
#141
الموثوقية
9.9درجة النجاح من المحاولة الأولى: 10.0 تعني عدم وجود إخفاقات قابلة لإعادة المحاولة من واجهة API الهدف أو حدود المعدل قبل النداءات الناجحة؛ الإخفاقات المسجلة تخفض الدرجة.…
9.7درجة النجاح من المحاولة الأولى: 10.0 تعني عدم وجود إخفاقات قابلة لإعادة المحاولة من واجهة API الهدف أو حدود المعدل قبل النداءات الناجحة؛ الإخفاقات المسجلة تخفض الدرجة.…
الاتساق
8.2تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
9.4تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
محاولات
69/69
69/69
اختبارات صحيحة
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 6لا توجد إجابة: 1زمن الاستجابة (المتوسط)7.54sزمن الاستجابة (الحد الأقصى)67.18sزمن الاستجابة (الإجمالي)173.36sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
81.2%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
اختبارات غير مستقرة
5الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
2الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
إجمالي مرات التشغيل
69إجمالي مرات التشغيل…
69إجمالي مرات التشغيل…
التكلفة لكل نتيجة
2.014
~0.520يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.7349 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.072660.
إجمالي التكلفة
$0.323
~$0.073يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.7349 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.072660.
سعر الإدخال
$0.750 / 1Mسعر الإدخال…
غير متاحسعر الإدخال…
سعر الإخراج
$3.750 / 1Mسعر الإخراج…
غير متاحسعر الإخراج…
إجمالي رموز الإدخال
215,836إجمالي رموز الإدخال…
277,164إجمالي رموز الإدخال…
رموز الإخراج
9,452رموز الإخراج…
1,913رموز الإخراج…
رموز الاستدلال
33,289رموز الاستدلال…
168,783رموز الاستدلال…
زمن الاستجابة (المتوسط)
7.54sزمن الاستجابة (المتوسط)…
40.09sزمن الاستجابة (المتوسط)…
زمن الاستجابة (الحد الأقصى)
67.18sزمن الاستجابة (الحد الأقصى)…
214.63sزمن الاستجابة (الحد الأقصى)…
زمن الاستجابة (الإجمالي)
173.36sزمن الاستجابة (الإجمالي)…
881.89sزمن الاستجابة (الإجمالي)…
المعلمات
~500B الإجمالي (~20B النشطة)
27.3B
الإتاحة
مغلق المصدر
الأوزان متاحة
عرض إنشاء النماذج
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#142 Gemini 3.8 Flash
low
التكلفة
$0.030
الوقت
45.8s
الرموز
8,023 tok
#141 Qwen3.8 27B
mediumتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
التكلفة
~$0.002يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.0121 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.001193.
3.1تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)67.18sزمن الاستجابة (الحد الأقصى)67.18sزمن الاستجابة (الإجمالي)67.18sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
67.18sزمن الاستجابة (المتوسط)…
104,063إجمالي رموز الإدخال…
1,417رموز الإخراج…
0رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
4.7متوسط الدرجة عبر جميع اختبارات القياس.…
1.6تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)187.85sزمن الاستجابة (الحد الأقصى)187.85sزمن الاستجابة (الإجمالي)187.85sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)1.96sزمن الاستجابة (الحد الأقصى)2.77sزمن الاستجابة (الإجمالي)7.83sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
1.96sزمن الاستجابة (المتوسط)…
492إجمالي رموز الإدخال…
171رموز الإخراج…
1,054رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)2.93sزمن الاستجابة (الحد الأقصى)5.18sزمن الاستجابة (الإجمالي)11.70sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
7.2تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
44.4%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2زمن الاستجابة (المتوسط)4.31sزمن الاستجابة (الحد الأقصى)5.62sزمن الاستجابة (الإجمالي)12.92sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
4.31sزمن الاستجابة (المتوسط)…
8,118إجمالي رموز الإدخال…
449رموز الإخراج…
5,706رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)40.50sزمن الاستجابة (الحد الأقصى)72.14sزمن الاستجابة (الإجمالي)121.51sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
5.8تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
33.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابة: 1إجابة خاطئة: 1زمن الاستجابة (المتوسط)19.61sزمن الاستجابة (الحد الأقصى)35.14sزمن الاستجابة (الإجمالي)39.21sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
19.61sزمن الاستجابة (المتوسط)…
87,701إجمالي رموز الإدخال…
6,571رموز الإخراج…
14,001رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
8.7متوسط الدرجة عبر جميع اختبارات القياس.…
6.9تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
83.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.استدعاء أداة غير صالح: 1زمن الاستجابة (المتوسط)124.48sزمن الاستجابة (الحد الأقصى)214.63sزمن الاستجابة (الإجمالي)248.96sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)2.34sزمن الاستجابة (الحد الأقصى)3.48sزمن الاستجابة (الإجمالي)4.69sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
2.34sزمن الاستجابة (المتوسط)…
7,548إجمالي رموز الإدخال…
279رموز الإخراج…
1,000رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
6.5متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
50.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)8.76sزمن الاستجابة (الحد الأقصى)10.36sزمن الاستجابة (الإجمالي)17.53sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
4.4تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
2الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2زمن الاستجابة (المتوسط)6.50sزمن الاستجابة (الحد الأقصى)9.32sزمن الاستجابة (الإجمالي)19.51sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
6.50sزمن الاستجابة (المتوسط)…
642إجمالي رموز الإدخال…
12رموز الإخراج…
7,051رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
5.3متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
33.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2زمن الاستجابة (المتوسط)76.98sزمن الاستجابة (الحد الأقصى)144.07sزمن الاستجابة (الإجمالي)230.93sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)1.89sزمن الاستجابة (الحد الأقصى)1.89sزمن الاستجابة (الإجمالي)1.89sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
1.89sزمن الاستجابة (المتوسط)…
486إجمالي رموز الإدخال…
72رموز الإخراج…
316رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
5.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)9.20sزمن الاستجابة (الحد الأقصى)9.20sزمن الاستجابة (الإجمالي)9.20sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)2.79sزمن الاستجابة (الحد الأقصى)3.11sزمن الاستجابة (الإجمالي)5.57sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
2.79sزمن الاستجابة (المتوسط)…
615إجمالي رموز الإدخال…
72رموز الإخراج…
1,873رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)2.54sزمن الاستجابة (الحد الأقصى)2.67sزمن الاستجابة (الإجمالي)5.07sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)2.25sزمن الاستجابة (الحد الأقصى)3.00sزمن الاستجابة (الإجمالي)6.75sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
2.25sزمن الاستجابة (المتوسط)…
558إجمالي رموز الإدخال…
165رموز الإخراج…
1,458رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
8.3متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)12.62sزمن الاستجابة (الحد الأقصى)29.62sزمن الاستجابة (الإجمالي)37.85sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)5.51sزمن الاستجابة (الحد الأقصى)5.51sزمن الاستجابة (الإجمالي)5.51sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
5.51sزمن الاستجابة (المتوسط)…
5,457إجمالي رموز الإدخال…
233رموز الإخراج…
224رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
3.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.خطأ API: 1زمن الاستجابة (المتوسط)0msزمن الاستجابة (الحد الأقصى)0msزمن الاستجابة (الإجمالي)0msيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)2.29sزمن الاستجابة (الحد الأقصى)2.29sزمن الاستجابة (الإجمالي)2.29sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
2.29sزمن الاستجابة (المتوسط)…
156إجمالي رموز الإدخال…
11رموز الإخراج…
606رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
3.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابة: 1زمن الاستجابة (المتوسط)11.29sزمن الاستجابة (الحد الأقصى)11.29sزمن الاستجابة (الإجمالي)11.29sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…