مهام الوكلاء: إجابة خاطئة
مهام الوكلاء
إجابة خاطئة
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في مهام الوكلاء، حتى ترصد نقاط الضعف بسرعة أكبر.
108/108
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد إجابة خاطئة | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #299 | Dots 3 Note Preview none | Dots Studio | 1 | 3.9 | $0.000 | 0/1 | 45.7s |
| #300 | GPT-4o-mini none | OpenAI | 1 | 5.0 | $0.024 | 0/1 | 40.0s |
| #304 | Qwen3 Coder Next none | Qwen | 1 | 3.9 | $0.065 | 0/1 | 208.4s |
| #305 | Laguna S 2.1 high | Poolside | 1 | 2.8 | $0.147 | 0/1 | 158.2s |
| #309 | Qwen3.5-9B none | Qwen | 1 | 3.9 | $0.041 | 0/1 | 433.0s |
| #313 | GLM 4.7 Flash none | Z.ai | 1 | 5.0 | $0.027 | 0/1 | 80.7s |
| #316 | North Mini Code none | Cohere | 1 | 3.0 | $0.000 | 0/1 | 18.9s |
| #318 | Granite 4.2 8B high | IBM Granite | 1 | 5.0 | $0.161 | 0/1 | 223.5s |
| #319 | Qwen3 Coder Next medium | Qwen | 1 | 5.0 | $0.069 | 0/1 | 151.4s |
| #320 | DeepSeek V3.2 none | DeepSeek | 1 | 3.0 | $0.121 | 0/1 | 122.5s |
| #321 | GPT-5.4 Nano none | OpenAI | 1 | 3.9 | $0.068 | 0/1 | 45.4s |
| #333 | Nemotron 3 Super none | NVIDIA | 1 | 2.8 | $0.016 | 0/1 | 30.5s |
| #341 | GLM 4.7 Flash medium | Z.ai | 1 | 3.9 | $0.193 | 0/1 | 399.2s |
| #342 | gpt-oss-120b none | OpenAI | 1 | 6.1 | $0.016 | 0/1 | 140.9s |
| #344 | Mercury 2.5 none | Inception | 1 | 5.0 | $0.026 | 0/1 | 63.4s |