Catégorie AI BENCHY
Classement Appel d'outils
Voyez quels modèles d'IA réussissent le mieux sur Appel d'outils, lesquels restent fiables et où les écarts sont les plus marqués.
197/197
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Score Appel d'outils | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #182 | Hunter Alpha none | OpenRouter | 10.0 | 4.5 | $0.000 | 1/1 | 6.02s |
| #183 | Grok 4.20 none | X AI | 10.0 | 4.4 | $0.057 | 1/1 | 4.63s |
| #185 | GLM 4.7 Flash medium | Z.ai | 10.0 | 4.3 | $0.054 | 1/1 | 15.9s |
| #186 | Hy3 preview none | Tencent | 10.0 | 4.3 | $0.003 | 1/1 | 33.8s |
| #187 | MiMo-V2-Flash none | Xiaomi | 10.0 | 4.3 | $0.025 | 1/1 | 2.28s |
| #191 | Granite 4.1 8B none | IBM Granite | 10.0 | 4.0 | $0.003 | 1/1 | 2.17s |
| #193 | Qwen3.5-9B medium | Qwen | 10.0 | 3.8 | $0.036 | 1/1 | 4.31s |
| #1 | Gemini 3.5 Flash high | 9.8 | 9.8 | $1.115 | 1/1 | 4.96s | |
| #55 | DeepSeek V4 Pro high | DeepSeek | 9.8 | 7.6 | $0.157 | 1/1 | 15.9s |
| #96 | gpt-oss-120b medium | OpenAI | 9.8 | 6.7 | $0.011 | 1/1 | 6.91s |
| #123 | GPT-5.6 Terra none | OpenAI | 9.6 | 6.0 | $0.130 | 1/1 | 3.10s |
| #145 | Qwen3.6 27B none | Qwen | 9.5 | 5.5 | $0.025 | 1/1 | 6.74s |
| #158 | North Mini Code none | Cohere | 9.5 | 5.1 | $0.000 | 1/1 | 3.64s |
| #72 | GLM 5V Turbo medium | Z.ai | 7.0 | 7.3 | $0.457 | 0/1 | 12.5s |
| #25 | GPT-5.2 medium | OpenAI | 4.7 | 8.4 | $0.548 | 0/1 | 10.3s |