مجمّع: استدعاء أداة غير صالح
مجمّع
استدعاء أداة غير صالح
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور استدعاء أداة غير صالح في مجمّع، حتى ترصد نقاط الضعف بسرعة أكبر. الترتيب حسب: إجمالي التكلفة ↑.
أسباب الفشل
الفئات
77/77
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد استدعاء أداة غير صالح | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #137 | North Mini Code medium | Cohere | 1 | 2.9 | $0.000 | 0/2 | 554.9s |
| #171 | North Mini Code none | Cohere | 2 | 3.2 | $0.000 | 0/2 | 96.2s |
| #188 | Cobuddy medium | Baidu | 1 | 1.5 | $0.000 | 0/1 | 47.4s |
| #178 | Ling-2.6-flash none | Inclusionai | 2 | 3.0 | $0.002 | 0/2 | 35.7s |
| #201 | Granite 4.1 8B none | IBM Granite | 2 | 3.0 | $0.007 | 0/2 | 9.28s |
| #160 | Laguna XS 2.1 none | Poolside | 1 | 3.0 | $0.008 | 0/2 | 10.4s |
| #192 | Laguna M.1 none | Poolside | 1 | 1.5 | $0.009 | 0/1 | 4.32s |
| #156 | Gemma 4 26B A4B none | 1 | 3.0 | $0.015 | 0/2 | 37.2s | |
| #176 | GLM 4.7 Flash none | Z.ai | 2 | 3.0 | $0.016 | 0/2 | 50.2s |
| #118 | Gemini 2.5 Flash none | 1 | 3.0 | $0.017 | 0/2 | 61.2s | |
| #121 | gpt-oss-120b medium | OpenAI | 1 | 6.5 | $0.019 | 1/2 | 24.0s |
| #169 | Qwen3.5-9B none | Qwen | 2 | 3.0 | $0.021 | 0/2 | 194.0s |
| #45 | DeepSeek V4 Flash high | DeepSeek | 1 | 6.4 | $0.042 | 1/2 | 104.1s |
| #150 | DeepSeek V4 Flash none | DeepSeek | 2 | 4.6 | $0.044 | 0/2 | 179.6s |
| #173 | DeepSeek V3.2 none | DeepSeek | 2 | 4.8 | $0.054 | 0/2 | 113.5s |