Catégorie AI BENCHY
Classement Appel d'outils
Voyez quels modèles d'IA réussissent le mieux sur Appel d'outils, lesquels restent fiables et où les écarts sont les plus marqués. Trier par: Métrique ↑.
197/197
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Score Appel d'outils | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #104 | Hy3 preview low | Tencent | 2.8 | 6.4 | $0.015 | 0/1 | 17.8s |
| #140 | Grok 4.1 Fast medium | X AI | 2.8 | 5.6 | $0.069 | 0/1 | 27.7s |
| #169 | GLM 4.7 Flash none | Z.ai | 2.8 | 4.9 | $0.004 | 0/1 | 7.05s |
| #189 | Grok 4.1 Fast none | X AI | 2.8 | 4.0 | $0.008 | 0/1 | 5.51s |
| #69 | Grok 4.20 medium | X AI | 3.0 | 7.3 | $0.609 | 0/1 | 13.7s |
| #80 | GLM 5.1 medium | Z.ai | 3.0 | 7.1 | $0.288 | 0/1 | 0ms |
| #82 | Kimi K2.7 Code medium | Moonshot AI | 3.0 | 7.0 | $0.581 | 0/1 | 0ms |
| #83 | Gemini 3.5 Flash none | 3.0 | 7.0 | $1.079 | 0/1 | 0ms | |
| #86 | Grok 4.20 Beta medium | X AI | 3.0 | 6.8 | $0.750 | 0/1 | 12.4s |
| #93 | Qwen3.6 35B A3B medium | Qwen | 3.0 | 6.7 | $0.146 | 0/1 | 0ms |
| #107 | Gemma 4 31B medium | 3.0 | 6.3 | $0.032 | 0/1 | 0ms | |
| #120 | Gemma 4 31B none | 3.0 | 6.1 | $0.002 | 0/1 | 0ms | |
| #151 | GPT-5.4 Mini none | OpenAI | 3.0 | 5.3 | $0.038 | 0/1 | 2.32s |
| #155 | Qwen3.6 35B A3B none | Qwen | 3.0 | 5.2 | $0.031 | 0/1 | 0ms |
| #163 | Grok 4.20 Multi Agent Beta medium | X AI | 3.0 | 5.0 | $5.599 | 0/1 | 0ms |