Combiné : Appel d'outil invalide
Combiné
Appel d'outil invalide
Voyez quels modèles d'IA ont le plus de chances de rencontrer Appel d'outil invalide sur Combiné, pour repérer plus vite les points faibles.
Raisons d'échec
Catégories
125/125
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de Appel d'outil invalide | Score de catégorie | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #123 | Muse Glimmer 30B low | Meta | 1 | 3.8 | $0.152 | 0/2 | 132.0s |
| #124 | Step 3.7 Flash low | Stepfun | 1 | 7.3 | $0.390 | 1/2 | 66.2s |
| #128 | DeepSeek V3.2 medium | DeepSeek | 1 | 7.3 | $0.078 | 1/2 | 79.9s |
| #131 | Mercury 2 medium | Inception | 1 | 6.7 | $0.094 | 1/2 | 7.84s |
| #132 | Grok 4.20 medium | X AI | 1 | 8.7 | $0.805 | 1/2 | 42.2s |
| #134 | Kimi K2.5 medium | Moonshot AI | 1 | 6.7 | $0.479 | 1/2 | 89.2s |
| #137 | Qwen3.7 Flash medium | Qwen | 1 | 6.4 | $0.065 | 1/2 | 314.2s |
| #140 | Qwen3.6 Flash medium | Qwen | 1 | 6.5 | $0.741 | 1/2 | 299.2s |
| #141 | Step 3.7 Flash high | Stepfun | 1 | 8.7 | $1.229 | 1/2 | 41.2s |
| #145 | DeepSeek V4 Pro none | DeepSeek | 1 | 7.9 | $0.226 | 1/2 | 71.6s |
| #146 | GLM 5.3 low | Z.ai | 1 | 3.8 | $0.257 | 0/2 | 53.0s |
| #147 | MiMo-V2.5-Pro medium | Xiaomi | 1 | 6.9 | $0.221 | 1/2 | 125.4s |
| #149 | Gemma 4 26B A4B medium | 1 | 6.3 | $0.092 | 1/2 | 492.9s | |
| #150 | GLM 5.2 none | Z.ai | 1 | 6.9 | $0.153 | 1/2 | 50.2s |
| #151 | KAT-Coder-Pro V2.5 none | Kwaipilot | 1 | 4.1 | $0.487 | 0/2 | 183.1s |