Tâches agentiques : Appel d'outil invalide
Tâches agentiques
Appel d'outil invalide
Voyez quels modèles d'IA ont le plus de chances de rencontrer Appel d'outil invalide sur Tâches agentiques, pour repérer plus vite les points faibles. Trier par: Temps de réponse (moy.) ↓.
Raisons d'échec
Catégories
44/44
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de Appel d'outil invalide | Score de catégorie | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #179 | Grok 4.7 high | X AI | 1 | 3.0 | $3.582 | 0/1 | 322.2s |
| #175 | Grok 4.7 xhigh | X AI | 1 | 3.0 | $4.054 | 0/1 | 304.8s |
| #298 | MiniMax M2.7 medium | Minimax | 1 | 4.7 | $0.202 | 0/1 | 198.8s |
| #226 | Space Bunny Alpha xhigh | Stealth | 1 | 5.2 | $0.000 | 0/1 | 159.1s |
| #346 | Qwen3.5-9B medium | Qwen | 1 | 5.2 | $0.106 | 0/1 | 152.9s |
| #87 | Claude Opus 4.7 medium | Anthropic | 1 | 5.2 | $3.636 | 0/1 | 150.6s |
| #61 | Qwen3.8 Max (0902) low | Qwen | 1 | 6.1 | $1.131 | 0/1 | 136.0s |
| #217 | Qwen3.5 Plus 2026-04-20 none | Qwen | 1 | 7.4 | $0.226 | 0/1 | 133.3s |
| #308 | MiMo-V2.5 none | Xiaomi | 1 | 3.9 | $0.063 | 0/1 | 124.2s |
| #157 | Ember-1 low | Fireworks | 1 | 4.7 | $1.488 | 0/1 | 121.3s |
| #161 | Muse Glimmer 30B low | Meta | 1 | 6.1 | $0.266 | 0/1 | 105.0s |
| #97 | GLM 5.3 FlashX max | Z.ai | 1 | 6.1 | $0.623 | 0/1 | 104.8s |
| #158 | Qwen3.5-122B-A10B medium | Qwen | 1 | 6.1 | $1.152 | 0/1 | 95.3s |
| #225 | Gemini 3.5 Flash none | 1 | 3.5 | $1.778 | 0/1 | 89.3s | |
| #164 | Ember-1 high | Fireworks | 1 | 6.1 | $2.405 | 0/1 | 88.3s |