مجمّع: استدعاء أداة غير صالح
مجمّع
استدعاء أداة غير صالح
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور استدعاء أداة غير صالح في مجمّع، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
الفئات
77/77
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد استدعاء أداة غير صالح | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #90 | Qwen3.6 35B A3B medium | Qwen | 1 | 3.0 | $0.746 | 0/2 | 817.6s |
| #92 | KAT-Coder-Pro V2.5 none | Kwaipilot | 1 | 4.1 | $0.476 | 0/2 | 183.1s |
| #93 | GLM 5V Turbo medium | Z.ai | 1 | 3.4 | $0.457 | 0/1 | 15.1s |
| #95 | Gemma 4 26B A4B medium | 1 | 6.3 | $0.089 | 1/2 | 492.9s | |
| #96 | GLM 5.2 none | Z.ai | 1 | 6.9 | $0.151 | 1/2 | 50.2s |
| #101 | MiMo-V2.5 medium | Xiaomi | 1 | 8.7 | $0.082 | 1/2 | 78.0s |
| #102 | Laguna XS 2.1 medium | Poolside | 1 | 6.3 | $0.068 | 1/2 | 218.1s |
| #104 | Gemini 3.1 Flash Lite Preview low | 1 | 3.0 | $0.646 | 0/2 | 160.6s | |
| #105 | Gemini 3.1 Flash Lite low | 1 | 3.2 | $0.621 | 0/2 | 161.2s | |
| #108 | Ring-2.6-1T medium | Inclusionai | 1 | 7.3 | $0.103 | 1/2 | 257.3s |
| #110 | Gemma 4 31B medium | 1 | 2.9 | $0.163 | 0/2 | 433.1s | |
| #114 | Qwen3.5-Flash medium | Qwen | 1 | 6.4 | $0.139 | 1/2 | 266.6s |
| #117 | GPT-5.6 Luna low | OpenAI | 1 | 2.8 | $0.249 | 0/2 | 13.7s |
| #118 | Gemini 2.5 Flash none | 1 | 3.0 | $0.017 | 0/2 | 61.2s | |
| #119 | Qwen3.5-35B-A3B medium | Qwen | 1 | 3.8 | $0.837 | 0/2 | 512.8s |