Tâches agentiques : Appel d'outil invalide
Tâches agentiques
Appel d'outil invalide
Voyez quels modèles d'IA ont le plus de chances de rencontrer Appel d'outil invalide sur Tâches agentiques, pour repérer plus vite les points faibles.
Raisons d'échec
Catégories
44/44
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de Appel d'outil invalide | Score de catégorie | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #239 | MiMo-V2.6-Pro none | Xiaomi | 1 | 5.0 | $0.193 | 0/1 | 66.1s |
| #250 | DeepSeek V4.1 Flash none | DeepSeek | 1 | 7.4 | $0.123 | 0/1 | 55.8s |
| #261 | Solar Pro 4 none | Upstage | 1 | 5.0 | $0.033 | 0/1 | 69.2s |
| #267 | GPT-6 Luna none | OpenAI | 1 | 5.0 | $0.026 | 0/1 | 51.1s |
| #283 | Laguna XS 2.1 none | Poolside | 1 | 5.0 | $0.019 | 0/1 | 70.8s |
| #284 | Qwen3.6 35B A3B none | Qwen | 1 | 5.2 | $0.105 | 0/1 | 65.6s |
| #293 | Mercury 2.5 low | Inception | 1 | 5.0 | $0.020 | 0/1 | 47.1s |
| #295 | MiMo-V2.5-Pro none | Xiaomi | 1 | 3.9 | $0.157 | 0/1 | 49.6s |
| #298 | MiniMax M2.7 medium | Minimax | 1 | 4.7 | $0.202 | 0/1 | 198.8s |
| #308 | MiMo-V2.5 none | Xiaomi | 1 | 3.9 | $0.063 | 0/1 | 124.2s |
| #310 | Hy4 preview none | Tencent | 1 | 5.0 | $0.161 | 0/1 | 65.5s |
| #314 | Mercury 2.5 Preview none | Inception | 1 | 3.9 | $0.023 | 0/1 | 85.0s |
| #336 | Granite 4.2 8B none | IBM Granite | 1 | 5.0 | $0.047 | 0/1 | 49.2s |
| #346 | Qwen3.5-9B medium | Qwen | 1 | 5.2 | $0.106 | 0/1 | 152.9s |