Tâches agentiques : Appel d'outil invalide
Tâches agentiques
Appel d'outil invalide
Voyez quels modèles d'IA ont le plus de chances de rencontrer Appel d'outil invalide sur Tâches agentiques, pour repérer plus vite les points faibles. Trier par: Coût total ↓.
Raisons d'échec
Catégories
44/44
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de Appel d'outil invalide | Score de catégorie | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #175 | Grok 4.7 xhigh | X AI | 1 | 3.0 | $4.054 | 0/1 | 304.8s |
| #87 | Claude Opus 4.7 medium | Anthropic | 1 | 5.2 | $3.636 | 0/1 | 150.6s |
| #179 | Grok 4.7 high | X AI | 1 | 3.0 | $3.582 | 0/1 | 322.2s |
| #46 | Claude Opus 5 medium | Anthropic | 1 | 7.4 | $2.896 | 0/1 | 87.6s |
| #67 | Gemini 3.5 Flash high | 1 | 4.1 | $2.672 | 0/1 | 84.7s | |
| #164 | Ember-1 high | Fireworks | 1 | 6.1 | $2.405 | 0/1 | 88.3s |
| #225 | Gemini 3.5 Flash none | 1 | 3.5 | $1.778 | 0/1 | 89.3s | |
| #157 | Ember-1 low | Fireworks | 1 | 4.7 | $1.488 | 0/1 | 121.3s |
| #176 | Grok Build 0.1 medium | X AI | 1 | 3.4 | $1.419 | 0/1 | 69.0s |
| #89 | Gemini 3.5 Flash medium | 1 | 3.8 | $1.308 | 0/1 | 83.6s | |
| #85 | Claude Sonnet 5.5 high | Anthropic | 1 | 7.4 | $1.197 | 0/1 | 53.6s |
| #158 | Qwen3.5-122B-A10B medium | Qwen | 1 | 6.1 | $1.152 | 0/1 | 95.3s |
| #61 | Qwen3.8 Max (0902) low | Qwen | 1 | 6.1 | $1.131 | 0/1 | 136.0s |
| #199 | Grok 4.3 medium | X AI | 1 | 3.9 | $0.989 | 0/1 | 51.6s |
| #121 | GPT-5.4 Mini medium | OpenAI | 1 | 7.4 | $0.965 | 0/1 | 84.3s |