Tâches agentiques : Appel d'outil invalide
Tâches agentiques
Appel d'outil invalide
Voyez quels modèles d'IA ont le plus de chances de rencontrer Appel d'outil invalide sur Tâches agentiques, pour repérer plus vite les points faibles. Trier par: Tests corrects ↑.
Raisons d'échec
Catégories
44/44
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de Appel d'outil invalide | Score de catégorie | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #46 | Claude Opus 5 medium | Anthropic | 1 | 7.4 | $2.896 | 0/1 | 87.6s |
| #52 | Gemini 3.7 Flash low | 1 | 6.4 | $0.293 | 0/1 | 62.6s | |
| #61 | Qwen3.8 Max (0902) low | Qwen | 1 | 6.1 | $1.131 | 0/1 | 136.0s |
| #67 | Gemini 3.5 Flash high | 1 | 4.1 | $2.672 | 0/1 | 84.7s | |
| #85 | Claude Sonnet 5.5 high | Anthropic | 1 | 7.4 | $1.197 | 0/1 | 53.6s |
| #87 | Claude Opus 4.7 medium | Anthropic | 1 | 5.2 | $3.636 | 0/1 | 150.6s |
| #89 | Gemini 3.5 Flash medium | 1 | 3.8 | $1.308 | 0/1 | 83.6s | |
| #97 | GLM 5.3 FlashX max | Z.ai | 1 | 6.1 | $0.623 | 0/1 | 104.8s |
| #106 | GPT-6 Luna medium | OpenAI | 1 | 7.4 | $0.048 | 0/1 | 71.7s |
| #110 | GPT-6 Luna high | OpenAI | 1 | 5.2 | $0.074 | 0/1 | 82.8s |
| #121 | GPT-5.4 Mini medium | OpenAI | 1 | 7.4 | $0.965 | 0/1 | 84.3s |
| #122 | GPT-5.6 Luna medium | OpenAI | 1 | 7.4 | $0.101 | 0/1 | 58.1s |
| #130 | Inkling medium | Thinkingmachines | 1 | 4.7 | $0.540 | 0/1 | 45.9s |
| #138 | Gemini 3.5 Flash Lite medium | 1 | 4.7 | $0.440 | 0/1 | 86.9s | |
| #146 | Step 3.7 Flash low | Stepfun | 1 | 7.4 | $0.449 | 0/1 | 83.6s |