تحليل البيانات واستخراجها: إجابة خاطئة
تحليل البيانات واستخراجها
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في تحليل البيانات واستخراجها، حتى ترصد نقاط الضعف بسرعة أكبر. الترتيب حسب: عدد الإخفاقات ↑.
59/59
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #31 | Claude Opus 4.8 medium | Anthropic | 1 | 7.1 | $1.983 | 1/2 | 12.3s |
| #76 | Qwen3.8 27B medium | Qwen | 1 | 6.5 | ~$0.058 | 1/2 | 8.76s |
| #78 | Claude Opus 4.8 low | Anthropic | 1 | 6.3 | $2.089 | 1/2 | 2.27s |
| #115 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | $1.166 | 1/2 | 1.77s |
| #118 | Muse Glimmer 30B high | Meta | 1 | 7.3 | $0.430 | 1/2 | 14.9s |
| #121 | Muse Glimmer 30B medium | Meta | 1 | 7.3 | $0.227 | 1/2 | 7.20s |
| #124 | Step 3.7 Flash low | Stepfun | 1 | 7.3 | $0.390 | 1/2 | 2.29s |
| #131 | Mercury 2 medium | Inception | 1 | 7.3 | $0.094 | 1/2 | 1.11s |
| #135 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 1 | 7.3 | $0.478 | 1/2 | 4.70s |
| #147 | MiMo-V2.5-Pro medium | Xiaomi | 1 | 7.3 | $0.221 | 1/2 | 18.8s |
| #155 | LongCat 2.0 high | Meituan | 1 | 3.6 | $0.492 | 0/2 | 11.0s |
| #170 | Dots 3 Note Preview low | Dots Studio | 1 | 7.3 | $0.000 | 1/2 | 11.5s |
| #171 | Dots 3 Note Preview high | Dots Studio | 1 | 7.3 | $0.000 | 1/2 | 12.7s |
| #173 | MiMo-V2.5 medium | Xiaomi | 1 | 2.7 | $0.104 | 0/2 | 6.33s |
| #174 | Ling-3.0-flash high | Inclusionai | 1 | 7.3 | $0.021 | 1/2 | 7.15s |