يتقدم Muse Spark 1.1 (high) في متوسط النتيجة بـ 8.0 مقابل 7.9. لدى Qwen3.8 27B (low) تكلفة benchmark أقل عند ~$0.071 مقابل $1.709. Muse Spark 1.1 (high) أسرع عند 30.84s مقابل 39.11s، مع معدلات نجاح 68.2% مقابل 68.2%.
تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في:
2026-08-29
الترتيب
#53
إجمالي رموز الإخراج
363,989
زمن الاستجابة (المتوسط)
30.84s
إجمالي التكلفة
$1.709
تم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
الترتيب
#62
إجمالي رموز الإخراج
169,329
زمن الاستجابة (المتوسط)
39.11s
إجمالي التكلفة
~$0.071يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
النموذج الموصى بهQwen3.8 27B (low)
Its score stays close to the best score here (7.9 vs 8.0), while costing about 24.1x less than Muse Spark 1.1 (high).
Qwen3.8 27BQwen3.8 27Blowتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.الإصدار: 2026-08-14
النتيجة
8.0متوسط الدرجة عبر جميع اختبارات القياس.…
7.9متوسط الدرجة عبر جميع اختبارات القياس.…
الترتيب
#53
#62
الموثوقية
10.0درجة النجاح من المحاولة الأولى: 10.0 تعني عدم وجود إخفاقات قابلة لإعادة المحاولة من واجهة API الهدف أو حدود المعدل قبل النداءات الناجحة؛ الإخفاقات المسجلة تخفض الدرجة.…
10.0درجة النجاح من المحاولة الأولى: 10.0 تعني عدم وجود إخفاقات قابلة لإعادة المحاولة من واجهة API الهدف أو حدود المعدل قبل النداءات الناجحة؛ الإخفاقات المسجلة تخفض الدرجة.…
الاتساق
7.9تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 4لا توجد إجابة: 2لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)39.11sزمن الاستجابة (الحد الأقصى)376.04sزمن الاستجابة (الإجمالي)860.51sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
معدل النجاح لكل محاولة
68.2%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
68.2%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
اختبارات غير مستقرة
6الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
إجمالي مرات التشغيل
64إجمالي مرات التشغيل…
66إجمالي مرات التشغيل…
التكلفة لكل نتيجة
14.236
~0.473يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
إجمالي التكلفة
$1.709
~$0.071يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
سعر الإدخال
$1.250 / 1Mسعر الإدخال…
غير متاحسعر الإدخال…
سعر الإخراج
$4.250 / 1Mسعر الإخراج…
غير متاحسعر الإخراج…
إجمالي رموز الإدخال
129,003إجمالي رموز الإدخال…
99,705إجمالي رموز الإدخال…
رموز الإخراج
8,340رموز الإخراج…
1,545رموز الإخراج…
رموز الاستدلال
355,649رموز الاستدلال…
167,784رموز الاستدلال…
زمن الاستجابة (المتوسط)
30.84sزمن الاستجابة (المتوسط)…
39.11sزمن الاستجابة (المتوسط)…
زمن الاستجابة (الحد الأقصى)
196.03sزمن الاستجابة (الحد الأقصى)…
376.04sزمن الاستجابة (الحد الأقصى)…
زمن الاستجابة (الإجمالي)
647.67sزمن الاستجابة (الإجمالي)…
860.51sزمن الاستجابة (الإجمالي)…
المعلمات
~1T الإجمالي (~50B النشطة)
27.3B
الإتاحة
مغلق المصدر
الأوزان متاحة
عرض إنشاء النماذج
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#53 Muse Spark 1.1
high
التكلفة
$0.039
الوقت
50.1s
الرموز
9,423 tok
#62 Qwen3.8 27B
lowتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
التكلفة
~$0.003يشمل التقدير كهرباء وحدة معالجة الرسومات فقط. ولا يشمل بقية الحاسوب أو تكلفة شراء العتاد. NVIDIA GeForce RTX 3090: 0.0258 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.002549.
8.4تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1إجابة خاطئة: 1زمن الاستجابة (المتوسط)8.60sزمن الاستجابة (الحد الأقصى)15.63sزمن الاستجابة (الإجمالي)34.39sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
8.60sزمن الاستجابة (المتوسط)…
2,334إجمالي رموز الإدخال…
516رموز الإخراج…
13,023رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)3.02sزمن الاستجابة (الحد الأقصى)5.68sزمن الاستجابة (الإجمالي)12.07sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)22.92sزمن الاستجابة (الحد الأقصى)27.22sزمن الاستجابة (الإجمالي)68.75sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
22.92sزمن الاستجابة (المتوسط)…
8,562إجمالي رموز الإدخال…
349رموز الإخراج…
36,039رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
7.7متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابة: 1زمن الاستجابة (المتوسط)140.92sزمن الاستجابة (الحد الأقصى)376.04sزمن الاستجابة (الإجمالي)422.75sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
2.9تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
2الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.استدعاء أداة غير صالح: 2زمن الاستجابة (المتوسط)70.25sزمن الاستجابة (الحد الأقصى)78.10sزمن الاستجابة (الإجمالي)140.51sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
70.25sزمن الاستجابة (المتوسط)…
90,082إجمالي رموز الإدخال…
5,535رموز الإخراج…
68,439رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)90.63sزمن الاستجابة (الحد الأقصى)143.71sزمن الاستجابة (الإجمالي)181.27sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)8.40sزمن الاستجابة (الحد الأقصى)10.84sزمن الاستجابة (الإجمالي)16.81sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
8.40sزمن الاستجابة (المتوسط)…
7,827إجمالي رموز الإدخال…
240رموز الإخراج…
5,907رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)8.03sزمن الاستجابة (الحد الأقصى)9.09sزمن الاستجابة (الإجمالي)16.06sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
4.4تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
22.2%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
2الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.خطأ API: 1تنسيق إضافي: 1إجابة خاطئة: 1زمن الاستجابة (المتوسط)60.59sزمن الاستجابة (الحد الأقصى)67.02sزمن الاستجابة (الإجمالي)121.18sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
60.59sزمن الاستجابة (المتوسط)…
852إجمالي رموز الإدخال…
329رموز الإخراج…
67,684رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
5.3متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
33.3%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 2زمن الاستجابة (المتوسط)60.78sزمن الاستجابة (الحد الأقصى)120.94sزمن الاستجابة (الإجمالي)182.34sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)7.73sزمن الاستجابة (الحد الأقصى)7.73sزمن الاستجابة (الإجمالي)7.73sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
7.73sزمن الاستجابة (المتوسط)…
906إجمالي رموز الإدخال…
116رموز الإخراج…
3,390رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
5.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)5.37sزمن الاستجابة (الحد الأقصى)5.37sزمن الاستجابة (الإجمالي)5.37sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
6.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
1الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لم يتبع التعليمات: 1زمن الاستجابة (المتوسط)7.81sزمن الاستجابة (الحد الأقصى)9.13sزمن الاستجابة (الإجمالي)15.62sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
7.81sزمن الاستجابة (المتوسط)…
1,527إجمالي رموز الإدخال…
193رموز الإخراج…
7,158رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
10.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)2.43sزمن الاستجابة (الحد الأقصى)2.87sزمن الاستجابة (الإجمالي)4.86sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
9.9تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابة: 1زمن الاستجابة (المتوسط)69.96sزمن الاستجابة (الحد الأقصى)196.03sزمن الاستجابة (الإجمالي)209.89sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
69.96sزمن الاستجابة (المتوسط)…
1,938إجمالي رموز الإدخال…
225رموز الإخراج…
140,780رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
7.7متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
66.7%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)4.91sزمن الاستجابة (الحد الأقصى)8.81sزمن الاستجابة (الإجمالي)14.74sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
100.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابات فاشلة.زمن الاستجابة (المتوسط)9.88sزمن الاستجابة (الحد الأقصى)9.88sزمن الاستجابة (الإجمالي)9.88sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
9.88sزمن الاستجابة (المتوسط)…
14,363إجمالي رموز الإدخال…
795رموز الإخراج…
2,938رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
3.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)8.42sزمن الاستجابة (الحد الأقصى)8.42sزمن الاستجابة (الإجمالي)8.42sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.إجابة خاطئة: 1زمن الاستجابة (المتوسط)22.93sزمن الاستجابة (الحد الأقصى)22.93sزمن الاستجابة (الإجمالي)22.93sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…
22.93sزمن الاستجابة (المتوسط)…
612إجمالي رموز الإدخال…
42رموز الإخراج…
10,291رموز الاستدلال…
Qwen3.8 27Bتم إنشاء إجابات النموذج المرشح على عتاد محلي. استُخدم OpenRouter للتحكيم فقط.
3.0متوسط الدرجة عبر جميع اختبارات القياس.…
10.0تعكس درجة الاتساق ثبات النتائج بين التشغيلات (10 = ثابت جدا حتى لو كان خطأ بشكل ثابت).…
0.0%معدل النجاح لكل محاولة = المحاولات الناجحة / إجمالي المحاولات عبر جميع التشغيلات.…
0الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).…
يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.لا توجد إجابة: 1زمن الاستجابة (المتوسط)12.64sزمن الاستجابة (الحد الأقصى)12.64sزمن الاستجابة (الإجمالي)12.64sيعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.…