مجمّع: استدعاء أداة غير صالح
مجمّع
استدعاء أداة غير صالح
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور استدعاء أداة غير صالح في مجمّع، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
الفئات
77/77
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد استدعاء أداة غير صالح | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #58 | Qwen3.5-27B medium | Qwen | 1 | 7.3 | $1.627 | 1/2 | 595.2s |
| #64 | Gemini 3.1 Flash Lite Preview medium | 1 | 7.2 | $0.115 | 1/2 | 16.6s | |
| #65 | Gemini 3.1 Flash Lite medium | 1 | 7.2 | $0.117 | 1/2 | 18.5s | |
| #67 | Step 3.7 Flash low | Stepfun | 1 | 7.3 | $0.454 | 1/2 | 66.2s |
| #68 | Kimi K2.6 medium | Moonshot AI | 1 | 6.9 | $1.036 | 1/2 | 458.6s |
| #69 | KAT-Coder-Pro V2.5 high | Kwaipilot | 1 | 7.3 | $0.482 | 1/2 | 106.7s |
| #72 | Qwen3.5-122B-A10B medium | Qwen | 1 | 6.4 | $1.046 | 1/2 | 313.5s |
| #75 | Grok 4.20 medium | X AI | 1 | 8.7 | $0.777 | 1/2 | 42.2s |
| #76 | DeepSeek V3.2 medium | DeepSeek | 1 | 7.3 | $0.078 | 1/2 | 79.9s |
| #77 | Kimi K2.5 medium | Moonshot AI | 1 | 6.7 | $0.600 | 1/2 | 89.2s |
| #78 | Mercury 2 medium | Inception | 1 | 6.7 | $0.093 | 1/2 | 7.84s |
| #82 | DeepSeek V4 Pro none | DeepSeek | 1 | 7.9 | $0.096 | 1/2 | 71.6s |
| #84 | MiMo-V2.5-Pro medium | Xiaomi | 1 | 6.9 | $0.187 | 1/2 | 125.4s |
| #85 | Qwen3.6 Flash medium | Qwen | 1 | 6.5 | $0.738 | 1/2 | 299.2s |
| #86 | Step 3.7 Flash high | Stepfun | 1 | 8.7 | $1.207 | 1/2 | 41.2s |