متوسط النتيجة متقارب جدًا عند 5.4 مقابل 5.4. لدى North Mini Code (medium) تكلفة benchmark أقل عند $0.000 مقابل ~$0.010. Qwen3.8 27B أسرع عند 5.05s مقابل 140.39s، مع معدلات نجاح 42.0% مقابل 39.1%.
تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في:
2026-10-01
النماذج المقارنة
الترتيب
#273
إجمالي رموز الإخراج
1,818,271
زمن الاستجابة (المتوسط)
140.39s
إجمالي التكلفة
$0.000
تم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
الترتيب
#272
إجمالي رموز الإخراج
13,791
زمن الاستجابة (المتوسط)
5.05s
إجمالي التكلفة
~$0.010يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.0968 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.009566.
النموذج الموصى بهQwen3.8 27B
It has the best score here (5.4), while responding about 27.8x faster than North Mini Code (medium).
Qwen3.8 27BQwen3.8 27Bnoneتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.الإصدار: 2026-08-14متاح مجانًا
النتيجة
5.4متوسط الدرجة عبر جميع اختبارات القياس.…
5.4متوسط الدرجة عبر جميع اختبارات القياس.…
الترتيب
#273
#272
الموثوقية
8.9درجة النجاح من المحاولة الأولى: 10.0 تعني عدم وجود إخفاقات قابلة لإعادة المحاولة من واجهة API الهدف أو حدود المعدل قبل النداءات الناجحة؛ الإخفاقات المسجلة تخفض الدرجة.…
10.0درجة النجاح من المحاولة الأولى: 10.0 تعني عدم وجود إخفاقات قابلة لإعادة المحاولة من واجهة API الهدف أو حدود المعدل قبل النداءات الناجحة؛ الإخفاقات المسجلة تخفض الدرجة.…
الاتساق
8.6تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 12لم يتبع التعليمات: 1استدعاء أداة غير صالح: 1زمن الاستجابة (المتوسط)5.05sزمن الاستجابة (الحد الأقصى)47.42sزمن الاستجابة (الإجمالي)116.11sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
معدل النجاح لكل محاولة
42.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
39.1%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
اختبارات غير مستقرة
4الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
إجمالي مرات التشغيل
61إجمالي مرات التشغيل…
69إجمالي مرات التشغيل…
التكلفة لكل نتيجة
0.000
~0.107يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.0968 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.009566.
إجمالي التكلفة
$0.000
~$0.010يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.0968 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.009566.
سعر الإدخال
$0.000 / 1Mسعر الإدخال…
غير متاحسعر الإدخال…
سعر الإخراج
$0.000 / 1Mسعر الإخراج…
غير متاحسعر الإخراج…
إجمالي رموز الإدخال
166,347إجمالي رموز الإدخال…
281,460إجمالي رموز الإدخال…
رموز الإخراج
423,884رموز الإخراج…
13,791رموز الإخراج…
رموز الاستدلال
1,394,387رموز الاستدلال…
0رموز الاستدلال…
زمن الاستجابة (المتوسط)
140.39sزمن الاستجابة (المتوسط)…
5.05sزمن الاستجابة (المتوسط)…
زمن الاستجابة (الحد الأقصى)
786.72sزمن الاستجابة (الحد الأقصى)…
47.42sزمن الاستجابة (الحد الأقصى)…
زمن الاستجابة (الإجمالي)
3229.07sزمن الاستجابة (الإجمالي)…
116.11sزمن الاستجابة (الإجمالي)…
المعلمات
30B الإجمالي (3B النشطة)
27.3B
الإتاحة
مفتوح المصدر
الأوزان متاحة
عرض إنشاء النماذج
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#273 North Mini Code
medium
التكلفة
$0.000
الوقت
51.8s
الرموز
12,460 tok
#272 Qwen3.8 27B
noneتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
التكلفة
~$0.001يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.0066 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.000657.
9.6تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)105.20sزمن الاستجابة (الحد الأقصى)105.20sزمن الاستجابة (الإجمالي)105.20sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
105.20sزمن الاستجابة (المتوسط)…
84,605إجمالي رموز الإدخال…
0رموز الإخراج…
53,480رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
5.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)47.42sزمن الاستجابة (الحد الأقصى)47.42sزمن الاستجابة (الإجمالي)47.42sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
75.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.تنسيق إضافي: 1زمن الاستجابة (المتوسط)64.79sزمن الاستجابة (الحد الأقصى)230.24sزمن الاستجابة (الإجمالي)259.15sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
64.79sزمن الاستجابة (المتوسط)…
324إجمالي رموز الإدخال…
64,441رموز الإخراج…
68,535رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
6.5متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
50.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2زمن الاستجابة (المتوسط)828msزمن الاستجابة (الحد الأقصى)1.95sزمن الاستجابة (الإجمالي)3.31sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
4.9تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
33.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
2الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 3زمن الاستجابة (المتوسط)320.43sزمن الاستجابة (الحد الأقصى)357.05sزمن الاستجابة (الإجمالي)961.28sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
320.43sزمن الاستجابة (المتوسط)…
7,119إجمالي رموز الإدخال…
219,891رموز الإخراج…
561,569رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
5.5متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
33.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2زمن الاستجابة (المتوسط)1.19sزمن الاستجابة (الحد الأقصى)1.97sزمن الاستجابة (الإجمالي)3.56sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
5.8تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
16.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.تنسيق إضافي: 1استدعاء أداة غير صالح: 1زمن الاستجابة (المتوسط)554.89sزمن الاستجابة (الحد الأقصى)786.72sزمن الاستجابة (الإجمالي)1109.78sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
554.89sزمن الاستجابة (المتوسط)…
63,682إجمالي رموز الإدخال…
0رموز الإخراج…
472,040رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
3.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.استدعاء أداة غير صالح: 1إجابة خاطئة: 1زمن الاستجابة (المتوسط)24.10sزمن الاستجابة (الحد الأقصى)44.76sزمن الاستجابة (الإجمالي)48.21sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)24.06sزمن الاستجابة (الحد الأقصى)26.90sزمن الاستجابة (الإجمالي)48.13sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
24.06sزمن الاستجابة (المتوسط)…
6,819إجمالي رموز الإدخال…
240رموز الإخراج…
2,659رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
6.5متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
50.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)1.14sزمن الاستجابة (الحد الأقصى)1.18sزمن الاستجابة (الإجمالي)2.27sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
7.2تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
11.1%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2انتهت المهلة: 1زمن الاستجابة (المتوسط)107.19sزمن الاستجابة (الحد الأقصى)195.94sزمن الاستجابة (الإجمالي)321.57sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
107.19sزمن الاستجابة (المتوسط)…
550إجمالي رموز الإدخال…
7,595رموز الإخراج…
102,957رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
7.7متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)552msزمن الاستجابة (الحد الأقصى)675msزمن الاستجابة (الإجمالي)1.66sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)25.08sزمن الاستجابة (الحد الأقصى)25.08sزمن الاستجابة (الإجمالي)25.08sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
25.08sزمن الاستجابة (المتوسط)…
444إجمالي رموز الإدخال…
1,546رموز الإخراج…
1,635رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
4.2متوسط الدرجة عبر جميع اختبارات القياس.…
9.9تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)1.31sزمن الاستجابة (الحد الأقصى)1.31sزمن الاستجابة (الإجمالي)1.31sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)15.43sزمن الاستجابة (الحد الأقصى)28.25sزمن الاستجابة (الإجمالي)30.85sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
15.43sزمن الاستجابة (المتوسط)…
379إجمالي رموز الإدخال…
909رموز الإخراج…
1,339رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
6.3متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
50.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)582msزمن الاستجابة (الحد الأقصى)633msزمن الاستجابة (الإجمالي)1.16sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 3زمن الاستجابة (المتوسط)19.70sزمن الاستجابة (الحد الأقصى)36.03sزمن الاستجابة (الإجمالي)59.10sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
19.70sزمن الاستجابة (المتوسط)…
543إجمالي رموز الإدخال…
2,215رموز الإخراج…
2,485رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
6.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
33.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1إجابة خاطئة: 1زمن الاستجابة (المتوسط)1.25sزمن الاستجابة (الحد الأقصى)1.84sزمن الاستجابة (الإجمالي)3.76sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)3.93sزمن الاستجابة (الحد الأقصى)3.93sزمن الاستجابة (الإجمالي)3.93sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
3.93sزمن الاستجابة (المتوسط)…
1,776إجمالي رموز الإدخال…
41رموز الإخراج…
563رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)2.75sزمن الاستجابة (الحد الأقصى)2.75sزمن الاستجابة (الإجمالي)2.75sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.خطأ API: 1زمن الاستجابة (المتوسط)305.02sزمن الاستجابة (الحد الأقصى)305.02sزمن الاستجابة (الإجمالي)305.02sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
305.02sزمن الاستجابة (المتوسط)…
106إجمالي رموز الإدخال…
127,006رموز الإخراج…
127,125رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
3.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)703msزمن الاستجابة (الحد الأقصى)703msزمن الاستجابة (الإجمالي)703msيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…