مهام الوكلاء: إجابة خاطئة
مهام الوكلاء
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في مهام الوكلاء، حتى ترصد نقاط الضعف بسرعة أكبر.
108/108
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #211 | Dots 3 Note Preview low | Dots Studio | 1 | 6.1 | $0.000 | 0/1 | 161.2s |
| #215 | Gemini 3.5 Flash Lite low | 1 | 5.0 | $0.183 | 0/1 | 53.9s | |
| #216 | Gemini 3.1 Flash Lite Preview low | 1 | 5.0 | $0.736 | 0/1 | 71.3s | |
| #218 | Gemini 3.1 Flash Lite low | 1 | 5.0 | $0.717 | 0/1 | 80.0s | |
| #219 | Solar Pro 4 high | Upstage | 1 | 2.8 | $0.164 | 0/1 | 312.3s |
| #221 | Space Bunny Alpha medium | Stealth | 1 | 6.1 | $0.000 | 0/1 | 153.1s |
| #222 | DeepSeek V3.2 medium | DeepSeek | 1 | 3.0 | $0.145 | 0/1 | 106.3s |
| #224 | Grok 4.20 medium | X AI | 1 | 3.0 | $1.582 | 0/1 | 128.3s |
| #230 | Gemini 3.1 Flash Lite Preview none | 1 | 5.0 | $0.090 | 0/1 | 48.6s | |
| #233 | Trinity Large Thinking medium | Arcee AI | 1 | 6.1 | $0.820 | 0/1 | 52.5s |
| #238 | GLM 5.3 FlashX low | Z.ai | 1 | 4.7 | $0.157 | 0/1 | 78.0s |
| #241 | Seed-2.0-Lite none | Bytedance Seed | 1 | 5.0 | $0.114 | 0/1 | 76.0s |
| #242 | Gemini 3.1 Flash Lite minimal | 1 | 5.0 | $0.080 | 0/1 | 50.0s | |
| #243 | gpt-oss-120b medium | OpenAI | 1 | 5.0 | $0.030 | 0/1 | 203.9s |
| #244 | Gemini 3.1 Flash Lite none | 1 | 5.0 | $0.069 | 0/1 | 43.8s |