Échecs Appel d'outil invalide
Voyez quels modèles d'IA rencontrent le plus souvent Appel d'outil invalide, pour repérer les risques de fiabilité avant de choisir. Trier par: Score ↓.
131/131
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de Appel d'outil invalide | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #134 | Kimi K2.5 medium | Moonshot AI | 1 | 7.0 | $0.479 | 10/22 | 98.2s |
| #137 | Qwen3.7 Flash medium | Qwen | 1 | 6.9 | $0.065 | 10/22 | 47.4s |
| #140 | Qwen3.6 Flash medium | Qwen | 1 | 6.8 | $0.741 | 12/22 | 45.0s |
| #141 | Step 3.7 Flash high | Stepfun | 1 | 6.8 | $1.229 | 11/22 | 70.1s |
| #145 | DeepSeek V4 Pro none | DeepSeek | 1 | 6.8 | $0.226 | 9/22 | 11.7s |
| #146 | GLM 5.3 low | Z.ai | 1 | 6.8 | $0.257 | 12/22 | 13.6s |
| #147 | MiMo-V2.5-Pro medium | Xiaomi | 1 | 6.8 | $0.221 | 11/22 | 48.7s |
| #149 | Gemma 4 26B A4B medium | 1 | 6.8 | $0.092 | 15/22 | 104.9s | |
| #150 | GLM 5.2 none | Z.ai | 1 | 6.7 | $0.153 | 13/22 | 9.65s |
| #151 | KAT-Coder-Pro V2.5 none | Kwaipilot | 1 | 6.7 | $0.487 | 11/22 | 26.0s |
| #153 | Gemini 3.5 Flash minimal | 2 | 6.7 | $0.300 | 13/22 | 2.65s | |
| #154 | GLM 5V Turbo medium | Z.ai | 2 | 6.7 | $0.457 | 11/21 | 23.1s |
| #159 | Gemini 3.1 Flash Lite Preview low | 1 | 6.6 | $0.646 | 14/22 | 16.7s | |
| #160 | Inkling Small medium | Thinkingmachines | 2 | 6.6 | $0.113 | 10/22 | 6.30s |
| #161 | Gemini 3.1 Flash Lite low | 1 | 6.6 | $0.621 | 13/22 | 16.2s |