Combiné : Appel d'outil invalide
Combiné
Appel d'outil invalide
Voyez quels modèles d'IA ont le plus de chances de rencontrer Appel d'outil invalide sur Combiné, pour repérer plus vite les points faibles.
Raisons d'échec
Catégories
125/125
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de Appel d'outil invalide | Score de catégorie | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #84 | DeepSeek V4 Flash 0423 high | DeepSeek | 1 | 6.4 | $0.039 | 1/2 | 104.1s |
| #88 | Nemotron 3 Ultra medium | NVIDIA | 1 | 6.3 | $0.567 | 1/2 | 218.2s |
| #89 | Claude Opus 5 none | Anthropic | 1 | 8.3 | $1.550 | 1/2 | 30.5s |
| #91 | GPT-5.6 Terra low | OpenAI | 1 | 8.7 | $0.420 | 1/2 | 9.68s |
| #94 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 1 | 6.9 | $0.459 | 1/2 | 175.8s |
| #95 | Qwen3.5-27B medium | Qwen | 1 | 7.3 | $0.982 | 1/2 | 595.2s |
| #97 | GPT-5.4 Mini medium | OpenAI | 1 | 6.9 | $0.786 | 1/2 | 59.6s |
| #100 | Gemini 3.1 Flash Lite Preview medium | 1 | 7.2 | $0.117 | 1/2 | 16.6s | |
| #105 | Qwen3.8 2.4T A95B high | Qwen | 1 | 6.9 | $2.357 | 1/2 | 266.1s |
| #111 | GLM 5.3 Flash high | Z.ai | 1 | 6.4 | $0.029 | 1/2 | 91.1s |
| #112 | Gemini 3.1 Flash Lite medium | 1 | 7.2 | $0.120 | 1/2 | 18.5s | |
| #114 | DeepSeek V4 Flash 0731 medium | DeepSeek | 1 | 7.3 | $0.066 | 1/2 | 150.6s |
| #116 | Kimi K2.6 medium | Moonshot AI | 1 | 6.9 | $1.247 | 1/2 | 458.6s |
| #117 | KAT-Coder-Pro V2.5 high | Kwaipilot | 1 | 7.3 | $0.506 | 1/2 | 106.7s |
| #122 | Qwen3.5-122B-A10B medium | Qwen | 1 | 6.4 | $1.207 | 1/2 | 313.5s |