Échecs par catégorie AI BENCHY
Appel d'outils : Erreur API
Appel d'outils
Erreur API
Voyez quels modèles d'IA ont le plus de chances de rencontrer Erreur API sur Appel d'outils, pour repérer plus vite les points faibles.
Raisons d'échec
16/16
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Nombre de Erreur API | Score de catégorie | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #80 | GLM 5.1 medium | Z.ai | 1 | 3.0 | $0.288 | 0/1 | 0ms |
| #82 | Kimi K2.7 Code medium | Moonshot AI | 1 | 3.0 | $0.581 | 0/1 | 0ms |
| #83 | Gemini 3.5 Flash none | 1 | 3.0 | $1.079 | 0/1 | 0ms | |
| #93 | Qwen3.6 35B A3B medium | Qwen | 1 | 3.0 | $0.146 | 0/1 | 0ms |
| #104 | Hy3 preview low | Tencent | 1 | 2.8 | $0.015 | 0/1 | 17.8s |
| #107 | Gemma 4 31B medium | 1 | 3.0 | $0.032 | 0/1 | 0ms | |
| #120 | Gemma 4 31B none | 1 | 3.0 | $0.002 | 0/1 | 0ms | |
| #155 | Qwen3.6 35B A3B none | Qwen | 1 | 3.0 | $0.031 | 0/1 | 0ms |
| #163 | Grok 4.20 Multi Agent Beta medium | X AI | 1 | 3.0 | $5.599 | 0/1 | 0ms |
| #172 | Ring-2.6-1T none | Inclusionai | 1 | 3.0 | $0.026 | 0/1 | 0ms |
| #188 | Grok Build 0.1 none | X AI | 1 | 3.0 | $0.547 | 0/1 | 0ms |
| #192 | gpt-oss-120b none | OpenAI | 1 | 3.0 | $0.009 | 0/1 | 0ms |
| #194 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 1 | 3.0 | $0.000 | 0/1 | 0ms |
| #195 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 1 | 3.0 | $0.000 | 0/1 | 0ms |
| #196 | Step 3.5 Flash none | Stepfun | 1 | 3.0 | $0.020 | 0/1 | 0ms |