تحليل البيانات واستخراجها: إجابة خاطئة
تحليل البيانات واستخراجها
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في تحليل البيانات واستخراجها، حتى ترصد نقاط الضعف بسرعة أكبر. الترتيب حسب: إجمالي التكلفة ↓.
59/59
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #78 | Claude Opus 4.8 low | Anthropic | 1 | 6.3 | $2.089 | 1/2 | 2.27s |
| #31 | Claude Opus 4.8 medium | Anthropic | 1 | 7.1 | $1.983 | 1/2 | 12.3s |
| #115 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | $1.166 | 1/2 | 1.77s |
| #189 | Trinity Large Thinking medium | Arcee AI | 1 | 6.3 | $0.756 | 1/2 | 16.4s |
| #194 | Trinity Large Thinking low | Arcee AI | 1 | 7.3 | $0.625 | 1/2 | 14.3s |
| #272 | Trinity Large Thinking high | Arcee AI | 1 | 6.3 | $0.592 | 1/2 | 14.0s |
| #300 | Grok Build 0.1 none | X AI | 1 | 3.8 | $0.547 | 0/2 | 9.33s |
| #155 | LongCat 2.0 high | Meituan | 1 | 3.6 | $0.492 | 0/2 | 11.0s |
| #135 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 1 | 7.3 | $0.478 | 1/2 | 4.70s |
| #118 | Muse Glimmer 30B high | Meta | 1 | 7.3 | $0.430 | 1/2 | 14.9s |
| #124 | Step 3.7 Flash low | Stepfun | 1 | 7.3 | $0.390 | 1/2 | 2.29s |
| #176 | Mimo V2 PRO medium | Xiaomi | 1 | 7.3 | $0.333 | 1/2 | 17.2s |
| #284 | MiniMax M2.5 medium | Minimax | 2 | 4.6 | $0.327 | 0/2 | 7.48s |
| #121 | Muse Glimmer 30B medium | Meta | 1 | 7.3 | $0.227 | 1/2 | 7.20s |
| #147 | MiMo-V2.5-Pro medium | Xiaomi | 1 | 7.3 | $0.221 | 1/2 | 18.8s |