Classement Combiné
Voyez quels modèles d'IA réussissent le mieux sur Combiné, lesquels restent fiables et où les écarts sont les plus marqués. Trier par: Temps de réponse (moy.) ↑.
Raisons d'échec
Avec la raison d'échec Appel d'outil invalide96 Avec la raison d'échec Mauvaise réponse71 Avec la raison d'échec Aucune réponse33 Avec la raison d'échec Erreur API26 Avec la raison d'échec Délai dépassé5 Avec la raison d'échec Mise en forme supplémentaire1 Avec la raison d'échec N'a pas suivi les instructions1
220/220
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Score Combiné | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #209 | Hy3 preview none | Tencent | 1.5 | 4.0 | $0.003 | 0/1 | 35.8s |
| #45 | Claude Opus 4.8 low | Anthropic | 9.9 | 7.8 | $2.077 | 2/2 | 36.9s |
| #162 | Gemma 4 26B A4B none | 3.0 | 5.5 | $0.015 | 0/2 | 37.2s | |
| #63 | Qwen3.7 Max none | Qwen | 6.5 | 7.4 | $0.197 | 1/2 | 37.2s |
| #67 | Claude Sonnet 4.6 none | Anthropic | 9.8 | 7.3 | $0.661 | 2/2 | 37.5s |
| #194 | Grok 4.1 Fast medium | X AI | 5.0 | 4.7 | $0.069 | 1/1 | 37.6s |
| #109 | Qwen3.5-27B none | Qwen | 6.4 | 6.5 | $0.090 | 1/2 | 39.4s |
| #169 | Qwen3.6 35B A3B none | Qwen | 3.8 | 5.3 | $0.061 | 0/2 | 39.5s |
| #10 | Gemini 3.1 Pro Preview medium | 9.8 | 9.2 | $1.361 | 2/2 | 40.4s | |
| #36 | Inkling medium | Thinkingmachines | 7.3 | 8.0 | $0.391 | 1/2 | 41.2s |
| #90 | Step 3.7 Flash high | Stepfun | 8.7 | 6.9 | $1.207 | 1/2 | 41.2s |
| #1 | Gemini 3.6 Flash medium | 10.0 | 9.9 | $0.831 | 2/2 | 42.1s | |
| #79 | Grok 4.20 medium | X AI | 8.7 | 7.1 | $0.777 | 1/2 | 42.2s |
| #19 | Muse Spark 1.1 medium | Meta | 8.3 | 8.6 | $1.357 | 1/2 | 42.6s |
| #18 | Claude Opus 4.7 medium | Anthropic | 10.0 | 8.7 | $1.477 | 2/2 | 43.4s |