إخفاقات استدعاء أداة غير صالح
اكتشف أي نماذج الذكاء الاصطناعي تواجه استدعاء أداة غير صالح أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: اختبارات صحيحة ↓.
131/131
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد استدعاء أداة غير صالح | النتيجة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #242 | Laguna XS 2.1 none | Poolside | 1 | 5.3 | $0.008 | 5/22 | 1.55s |
| #250 | Nemotron 3.5 Lightning medium | NVIDIA | 1 | 5.1 | $0.156 | 5/22 | 70.1s |
| #259 | MiniMax M2.7 medium | Minimax | 1 | 5.0 | $0.208 | 5/22 | 43.2s |
| #270 | Nemotron 3.5 Lightning low | NVIDIA | 1 | 4.8 | $0.140 | 5/22 | 59.8s |
| #272 | Trinity Large Thinking high | Arcee AI | 2 | 4.8 | $0.592 | 5/22 | 75.9s |
| #275 | GLM 4.7 Flash none | Z.ai | 2 | 4.8 | $0.016 | 5/22 | 8.81s |
| #284 | MiniMax M2.5 medium | Minimax | 1 | 4.6 | $0.327 | 5/22 | 69.1s |
| #287 | Laguna M.1 none | Poolside | 1 | 4.4 | $0.009 | 4/19 | 2.89s |
| #233 | DeepSeek V4 Flash 0423 none | DeepSeek | 2 | 5.4 | $0.037 | 4/22 | 36.2s |
| #234 | Laguna S 2.1 medium | Poolside | 2 | 5.4 | $0.053 | 4/22 | 58.4s |
| #239 | DeepSeek V4 Flash 0731 none | DeepSeek | 2 | 5.4 | $0.011 | 4/22 | 20.7s |
| #240 | Laguna S 2.1 high | Poolside | 2 | 5.4 | $0.114 | 4/22 | 111.6s |
| #244 | Ling-2.6-1T none | Inclusionai | 1 | 5.3 | $0.016 | 4/22 | 8.59s |
| #256 | Qwen3.5-9B none | Qwen | 2 | 5.1 | $0.021 | 4/22 | 19.2s |
| #258 | North Mini Code none | Cohere | 2 | 5.1 | $0.000 | 4/22 | 29.9s |