يتقدم Qwen3.8 27B (low) في متوسط النتيجة بـ 7.6 مقابل 7.5. لدى Qwen3.8 27B (low) تكلفة benchmark أقل عند ~$0.089 مقابل $1.448. Qwen3.8 27B (low) أسرع عند 46.60s مقابل 124.87s، مع معدلات نجاح 65.2% مقابل 68.1%.
تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في:
2026-10-01
النماذج المقارنة
الترتيب
#121
إجمالي رموز الإخراج
432,850
زمن الاستجابة (المتوسط)
124.87s
إجمالي التكلفة
$1.448
تم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
الترتيب
#117
إجمالي رموز الإخراج
209,143
زمن الاستجابة (المتوسط)
46.60s
إجمالي التكلفة
~$0.089يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.8932 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.088310.
النموذج الموصى بهQwen3.8 27B (low)
It has the best score here (7.6), while costing about 16.4x less than Seed-2.0-Code (high).
Qwen3.8 27BQwen3.8 27Blowتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.الإصدار: 2026-08-14متاح مجانًا
النتيجة
7.5متوسط الدرجة عبر جميع اختبارات القياس.…
7.6متوسط الدرجة عبر جميع اختبارات القياس.…
الترتيب
#121
#117
الموثوقية
9.0درجة النجاح من المحاولة الأولى: 10.0 تعني عدم وجود إخفاقات قابلة لإعادة المحاولة من واجهة API الهدف أو حدود المعدل قبل النداءات الناجحة؛ الإخفاقات المسجلة تخفض الدرجة.…
10.0درجة النجاح من المحاولة الأولى: 10.0 تعني عدم وجود إخفاقات قابلة لإعادة المحاولة من واجهة API الهدف أو حدود المعدل قبل النداءات الناجحة؛ الإخفاقات المسجلة تخفض الدرجة.…
الاتساق
7.9تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
9.7تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
محاولات
69/69
69/69
اختبارات صحيحة
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 6خطأ API: 3لم يتبع التعليمات: 1لا توجد إجابة: 1زمن الاستجابة (المتوسط)124.87sزمن الاستجابة (الحد الأقصى)675.30sزمن الاستجابة (الإجمالي)2871.96sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 5لا توجد إجابة: 2لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)46.60sزمن الاستجابة (الحد الأقصى)376.04sزمن الاستجابة (الإجمالي)1071.83sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
معدل النجاح لكل محاولة
65.2%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
68.1%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
اختبارات غير مستقرة
5الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
إجمالي مرات التشغيل
69إجمالي مرات التشغيل…
69إجمالي مرات التشغيل…
التكلفة لكل نتيجة
12.061
~0.589يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.8932 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.088310.
إجمالي التكلفة
$1.448
~$0.089يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.8932 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.088310.
سعر الإدخال
$0.500 / 1Mسعر الإدخال…
غير متاحسعر الإدخال…
سعر الإخراج
$3.000 / 1Mسعر الإخراج…
غير متاحسعر الإخراج…
إجمالي رموز الإدخال
297,321إجمالي رموز الإدخال…
315,290إجمالي رموز الإدخال…
رموز الإخراج
8,997رموز الإخراج…
1,607رموز الإخراج…
رموز الاستدلال
423,853رموز الاستدلال…
207,536رموز الاستدلال…
زمن الاستجابة (المتوسط)
124.87sزمن الاستجابة (المتوسط)…
46.60sزمن الاستجابة (المتوسط)…
زمن الاستجابة (الحد الأقصى)
675.30sزمن الاستجابة (الحد الأقصى)…
376.04sزمن الاستجابة (الحد الأقصى)…
زمن الاستجابة (الإجمالي)
2871.96sزمن الاستجابة (الإجمالي)…
1071.83sزمن الاستجابة (الإجمالي)…
المعلمات
~200B الإجمالي (~20B النشطة)
27.3B
الإتاحة
مغلق المصدر
الأوزان متاحة
عرض إنشاء النماذج
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#121 Seed-2.0-Code
high
التكلفة
$0.037
الوقت
183.6s
الرموز
12,388 tok
#117 Qwen3.8 27B
lowتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
التكلفة
~$0.003يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.0258 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.002549.
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)139.94sزمن الاستجابة (الحد الأقصى)139.94sزمن الاستجابة (الإجمالي)139.94sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
139.94sزمن الاستجابة (المتوسط)…
215,351إجمالي رموز الإدخال…
1,811رموز الإخراج…
20,464رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
6.1متوسط الدرجة عبر جميع اختبارات القياس.…
3.1تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)211.32sزمن الاستجابة (الحد الأقصى)211.32sزمن الاستجابة (الإجمالي)211.32sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
75.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)35.07sزمن الاستجابة (الحد الأقصى)82.43sزمن الاستجابة (الإجمالي)140.28sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
35.07sزمن الاستجابة (المتوسط)…
906إجمالي رموز الإدخال…
1,204رموز الإخراج…
17,533رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)3.02sزمن الاستجابة (الحد الأقصى)5.68sزمن الاستجابة (الإجمالي)12.07sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
6.5تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
55.6%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1إجابة خاطئة: 1زمن الاستجابة (المتوسط)266.74sزمن الاستجابة (الحد الأقصى)443.32sزمن الاستجابة (الإجمالي)800.23sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
266.74sزمن الاستجابة (المتوسط)…
6,750إجمالي رموز الإدخال…
432رموز الإخراج…
124,956رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
7.7متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابة: 1زمن الاستجابة (المتوسط)140.92sزمن الاستجابة (الحد الأقصى)376.04sزمن الاستجابة (الإجمالي)422.75sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
5.8تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
83.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.خطأ API: 1زمن الاستجابة (المتوسط)144.87sزمن الاستجابة (الحد الأقصى)236.85sزمن الاستجابة (الإجمالي)289.75sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
144.87sزمن الاستجابة (المتوسط)…
57,003إجمالي رموز الإدخال…
4,295رموز الإخراج…
26,889رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)90.63sزمن الاستجابة (الحد الأقصى)143.71sزمن الاستجابة (الإجمالي)181.27sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)24.28sزمن الاستجابة (الحد الأقصى)34.05sزمن الاستجابة (الإجمالي)48.55sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
24.28sزمن الاستجابة (المتوسط)…
8,034إجمالي رموز الإدخال…
246رموز الإخراج…
4,782رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)8.03sزمن الاستجابة (الحد الأقصى)9.09sزمن الاستجابة (الإجمالي)16.06sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
4.4تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
33.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
2الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2لا توجد إجابة: 1زمن الاستجابة (المتوسط)419.73sزمن الاستجابة (الحد الأقصى)675.30sزمن الاستجابة (الإجمالي)1259.19sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
419.73sزمن الاستجابة (المتوسط)…
828إجمالي رموز الإدخال…
10رموز الإخراج…
212,349رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
5.3متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
33.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2زمن الاستجابة (المتوسط)60.78sزمن الاستجابة (الحد الأقصى)120.94sزمن الاستجابة (الإجمالي)182.34sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
7.8تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)36.45sزمن الاستجابة (الحد الأقصى)36.45sزمن الاستجابة (الإجمالي)36.45sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
36.45sزمن الاستجابة (المتوسط)…
382إجمالي رموز الإدخال…
131رموز الإخراج…
2,577رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
5.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)5.37sزمن الاستجابة (الحد الأقصى)5.37sزمن الاستجابة (الإجمالي)5.37sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)11.26sزمن الاستجابة (الحد الأقصى)19.26sزمن الاستجابة (الإجمالي)22.53sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
11.26sزمن الاستجابة (المتوسط)…
816إجمالي رموز الإدخال…
72رموز الإخراج…
2,661رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)2.43sزمن الاستجابة (الحد الأقصى)2.87sزمن الاستجابة (الإجمالي)4.86sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
9.3تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.خطأ API: 1زمن الاستجابة (المتوسط)15.91sزمن الاستجابة (الحد الأقصى)17.11sزمن الاستجابة (الإجمالي)47.73sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
15.91sزمن الاستجابة (المتوسط)…
786إجمالي رموز الإدخال…
585رموز الإخراج…
4,473رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
7.7متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)4.91sزمن الاستجابة (الحد الأقصى)8.81sزمن الاستجابة (الإجمالي)14.74sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
1.6تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.خطأ API: 1زمن الاستجابة (المتوسط)35.09sزمن الاستجابة (الحد الأقصى)35.09sزمن الاستجابة (الإجمالي)35.09sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
35.09sزمن الاستجابة (المتوسط)…
6,198إجمالي رموز الإدخال…
196رموز الإخراج…
644رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
3.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)8.42sزمن الاستجابة (الحد الأقصى)8.42sزمن الاستجابة (الإجمالي)8.42sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)52.23sزمن الاستجابة (الحد الأقصى)52.23sزمن الاستجابة (الإجمالي)52.23sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
52.23sزمن الاستجابة (المتوسط)…
267إجمالي رموز الإدخال…
15رموز الإخراج…
6,525رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
3.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابة: 1زمن الاستجابة (المتوسط)12.64sزمن الاستجابة (الحد الأقصى)12.64sزمن الاستجابة (الإجمالي)12.64sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…