Échecs Appel d'outil invalide
Voyez quels modèles d'IA rencontrent le plus souvent Appel d'outil invalide, pour repérer les risques de fiabilité avant de choisir. Trier par: Coût total ↓.
83/83
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de Appel d'outil invalide | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #51 | Nemotron 3 Ultra medium | NVIDIA | 1 | 7.5 | $0.774 | 13/22 | 32.2s |
| #56 | GPT-5.4 Mini medium | OpenAI | 1 | 7.5 | $0.756 | 12/22 | 25.9s |
| #90 | Qwen3.6 35B A3B medium | Qwen | 1 | 6.7 | $0.746 | 13/22 | 58.1s |
| #85 | Qwen3.6 Flash medium | Qwen | 1 | 6.9 | $0.738 | 12/22 | 44.7s |
| #24 | Muse Spark 1.1 low | Meta | 1 | 8.3 | $0.647 | 13/22 | 11.5s |
| #104 | Gemini 3.1 Flash Lite Preview low | 1 | 6.5 | $0.646 | 13/22 | 16.7s | |
| #105 | Gemini 3.1 Flash Lite low | 1 | 6.5 | $0.621 | 12/22 | 16.3s | |
| #77 | Kimi K2.5 medium | Moonshot AI | 1 | 7.0 | $0.600 | 10/22 | 99.0s |
| #55 | GPT-5.6 Terra low | OpenAI | 1 | 7.5 | $0.519 | 13/22 | 5.31s |
| #29 | Step 3.7 Flash medium | Stepfun | 1 | 8.0 | $0.515 | 14/22 | 26.4s |
| #69 | KAT-Coder-Pro V2.5 high | Kwaipilot | 1 | 7.2 | $0.482 | 11/22 | 20.8s |
| #92 | KAT-Coder-Pro V2.5 none | Kwaipilot | 1 | 6.7 | $0.476 | 11/22 | 25.6s |
| #93 | GLM 5V Turbo medium | Z.ai | 2 | 6.7 | $0.457 | 11/21 | 23.1s |
| #67 | Step 3.7 Flash low | Stepfun | 1 | 7.3 | $0.454 | 12/22 | 20.7s |
| #57 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 1 | 7.5 | $0.437 | 14/22 | 89.2s |