يتقدم Qwen3.8 27B (medium) في متوسط النتيجة بـ 7.8 مقابل 7.7. لدى Qwen3.8 27B (medium) تكلفة benchmark أقل عند ~$0.058 مقابل $0.767. Qwen3.8 27B (medium) أسرع عند 33.05s مقابل 72.24s، مع معدلات نجاح 77.3% مقابل 66.7%.
تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في:
2026-09-28
النماذج المقارنة
الترتيب
#106
إجمالي رموز الإخراج
241,309
زمن الاستجابة (المتوسط)
72.24s
إجمالي التكلفة
$0.767
تم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
الترتيب
#101
إجمالي رموز الإخراج
136,162
زمن الاستجابة (المتوسط)
33.05s
إجمالي التكلفة
~$0.058يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
النموذج الموصى بهQwen3.8 27B (medium)
It has the best score here (7.8), while costing about 13.4x less than Seed-2.0-Code (low).
Qwen3.8 27BQwen3.8 27Bmediumتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.الإصدار: 2026-08-14
النتيجة
7.7متوسط الدرجة عبر جميع اختبارات القياس.…
7.8متوسط الدرجة عبر جميع اختبارات القياس.…
الترتيب
#106
#101
الموثوقية
8.5درجة النجاح من المحاولة الأولى: 10.0 تعني عدم وجود إخفاقات قابلة لإعادة المحاولة من واجهة API الهدف أو حدود المعدل قبل النداءات الناجحة؛ الإخفاقات المسجلة تخفض الدرجة.…
9.6درجة النجاح من المحاولة الأولى: 10.0 تعني عدم وجود إخفاقات قابلة لإعادة المحاولة من واجهة API الهدف أو حدود المعدل قبل النداءات الناجحة؛ الإخفاقات المسجلة تخفض الدرجة.…
الاتساق
7.8تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
9.7تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
محاولات
66/66
66/66
اختبارات صحيحة
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 6خطأ API: 2لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)72.24sزمن الاستجابة (الحد الأقصى)485.92sزمن الاستجابة (الإجمالي)1589.31sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
77.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
اختبارات غير مستقرة
6الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
إجمالي مرات التشغيل
66إجمالي مرات التشغيل…
66إجمالي مرات التشغيل…
التكلفة لكل نتيجة
5.899
~0.409يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
إجمالي التكلفة
$0.767
~$0.058يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
سعر الإدخال
$0.500 / 1Mسعر الإدخال…
غير متاحسعر الإدخال…
سعر الإخراج
$3.000 / 1Mسعر الإخراج…
غير متاحسعر الإخراج…
إجمالي رموز الإدخال
85,657إجمالي رموز الإدخال…
98,266إجمالي رموز الإدخال…
رموز الإخراج
8,142رموز الإخراج…
1,861رموز الإخراج…
رموز الاستدلال
233,167رموز الاستدلال…
134,301رموز الاستدلال…
زمن الاستجابة (المتوسط)
72.24sزمن الاستجابة (المتوسط)…
33.05sزمن الاستجابة (المتوسط)…
زمن الاستجابة (الحد الأقصى)
485.92sزمن الاستجابة (الحد الأقصى)…
214.63sزمن الاستجابة (الحد الأقصى)…
زمن الاستجابة (الإجمالي)
1589.31sزمن الاستجابة (الإجمالي)…
694.04sزمن الاستجابة (الإجمالي)…
المعلمات
~200B الإجمالي (~20B النشطة)
27.3B
الإتاحة
مغلق المصدر
الأوزان متاحة
عرض إنشاء النماذج
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#106 Seed-2.0-Code
low
Provider returned error
التكلفة
$0.000
الوقت
0.3s
الرموز
0 tok
#101 Qwen3.8 27B
mediumتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
التكلفة
~$0.002يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.0121 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.001193.
7.9تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
91.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)39.56sزمن الاستجابة (الحد الأقصى)120.09sزمن الاستجابة (الإجمالي)158.26sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
39.56sزمن الاستجابة (المتوسط)…
930إجمالي رموز الإدخال…
2,650رموز الإخراج…
15,987رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)2.93sزمن الاستجابة (الحد الأقصى)5.18sزمن الاستجابة (الإجمالي)11.70sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
7.1تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
55.6%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.خطأ API: 1إجابة خاطئة: 1زمن الاستجابة (المتوسط)109.70sزمن الاستجابة (الحد الأقصى)141.71sزمن الاستجابة (الإجمالي)329.11sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
109.70sزمن الاستجابة (المتوسط)…
7,948إجمالي رموز الإدخال…
455رموز الإخراج…
55,759رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)40.50sزمن الاستجابة (الحد الأقصى)72.14sزمن الاستجابة (الإجمالي)121.51sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
5.8تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
83.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.خطأ API: 1زمن الاستجابة (المتوسط)99.12sزمن الاستجابة (الحد الأقصى)173.03sزمن الاستجابة (الإجمالي)198.23sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
99.12sزمن الاستجابة (المتوسط)…
55,969إجمالي رموز الإدخال…
3,774رموز الإخراج…
21,408رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
8.7متوسط الدرجة عبر جميع اختبارات القياس.…
6.9تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
83.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.استدعاء أداة غير صالح: 1زمن الاستجابة (المتوسط)124.48sزمن الاستجابة (الحد الأقصى)214.63sزمن الاستجابة (الإجمالي)248.96sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)24.88sزمن الاستجابة (الحد الأقصى)30.28sزمن الاستجابة (الإجمالي)49.75sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
24.88sزمن الاستجابة (المتوسط)…
8,046إجمالي رموز الإدخال…
246رموز الإخراج…
1,639رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
6.5متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
50.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)8.76sزمن الاستجابة (الحد الأقصى)10.36sزمن الاستجابة (الإجمالي)17.53sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
4.4تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
44.5%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
2الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 3زمن الاستجابة (المتوسط)238.45sزمن الاستجابة (الحد الأقصى)485.92sزمن الاستجابة (الإجمالي)715.34sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
238.45sزمن الاستجابة (المتوسط)…
975إجمالي رموز الإدخال…
16رموز الإخراج…
132,626رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
5.3متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
33.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2زمن الاستجابة (المتوسط)76.98sزمن الاستجابة (الحد الأقصى)144.07sزمن الاستجابة (الإجمالي)230.93sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
3.4تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)11.14sزمن الاستجابة (الحد الأقصى)11.14sزمن الاستجابة (الإجمالي)11.14sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
11.14sزمن الاستجابة (المتوسط)…
579إجمالي رموز الإدخال…
179رموز الإخراج…
1,117رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
5.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)9.20sزمن الاستجابة (الحد الأقصى)9.20sزمن الاستجابة (الإجمالي)9.20sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)12.20sزمن الاستجابة (الحد الأقصى)21.22sزمن الاستجابة (الإجمالي)24.41sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
12.20sزمن الاستجابة (المتوسط)…
828إجمالي رموز الإدخال…
72رموز الإخراج…
1,034رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)2.54sزمن الاستجابة (الحد الأقصى)2.67sزمن الاستجابة (الإجمالي)5.07sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)12.50sزمن الاستجابة (الحد الأقصى)20.68sزمن الاستجابة (الإجمالي)37.50sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
12.50sزمن الاستجابة (المتوسط)…
885إجمالي رموز الإدخال…
445رموز الإخراج…
2,470رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
8.3متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)12.62sزمن الاستجابة (الحد الأقصى)29.62sزمن الاستجابة (الإجمالي)37.85sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)55.56sزمن الاستجابة (الحد الأقصى)55.56sزمن الاستجابة (الإجمالي)55.56sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
55.56sزمن الاستجابة (المتوسط)…
9,315إجمالي رموز الإدخال…
296رموز الإخراج…
637رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
3.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.خطأ API: 1زمن الاستجابة (المتوسط)0msزمن الاستجابة (الحد الأقصى)0msزمن الاستجابة (الإجمالي)0msيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)10.02sزمن الاستجابة (الحد الأقصى)10.02sزمن الاستجابة (الإجمالي)10.02sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.02sزمن الاستجابة (المتوسط)…
182إجمالي رموز الإدخال…
9رموز الإخراج…
490رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
3.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابة: 1زمن الاستجابة (المتوسط)11.29sزمن الاستجابة (الحد الأقصى)11.29sزمن الاستجابة (الإجمالي)11.29sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…