Classement Combiné
Voyez quels modèles d'IA réussissent le mieux sur Combiné, lesquels restent fiables et où les écarts sont les plus marqués.
Raisons d'échec
Avec la raison d'échec Appel d'outil invalide147 Avec la raison d'échec Mauvaise réponse95 Avec la raison d'échec Aucune réponse43 Avec la raison d'échec Erreur API37 Avec la raison d'échec Délai dépassé9 Avec la raison d'échec Mise en forme supplémentaire1 Avec la raison d'échec N'a pas suivi les instructions1
311/311
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Score Combiné | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #193 | Nemotron 3 Ultra none | NVIDIA | 3.0 | 6.1 | $0.084 | 0/2 | 21.1s |
| #195 | Gemini 2.5 Flash none | 3.0 | 6.0 | $0.017 | 0/2 | 61.2s | |
| #209 | GPT-5.4 none | OpenAI | 3.0 | 5.8 | $0.397 | 0/2 | 9.26s |
| #210 | Solar Pro 4 none | Upstage | 3.0 | 5.8 | $0.006 | 0/2 | 35.1s |
| #214 | Inkling Small low | Thinkingmachines | 3.0 | 5.7 | $0.055 | 0/2 | 4.08s |
| #215 | Ling-3.0-flash none | Inclusionai | 3.0 | 5.7 | $0.004 | 0/2 | 8.58s |
| #217 | Kimi K2.6 none | Moonshot AI | 3.0 | 5.7 | $0.233 | 0/2 | 77.8s |
| #223 | Gemma 4 26B A4B none | 3.0 | 5.6 | $0.015 | 0/2 | 37.2s | |
| #231 | Qwen3.8 27B none | Qwen | 3.0 | 5.5 | ~$0.006 | 0/2 | 24.1s |
| #237 | MiMo-V2.5-Pro none | Xiaomi | 3.0 | 5.4 | $0.068 | 0/2 | 28.3s |
| #242 | Laguna XS 2.1 none | Poolside | 3.0 | 5.3 | $0.008 | 0/2 | 10.4s |
| #243 | Seed-2.0-Code none | Bytedance Seed | 3.0 | 5.3 | $0.151 | 0/2 | 78.4s |
| #247 | Dots 3 Note Preview none | Dots Studio | 3.0 | 5.2 | $0.000 | 0/2 | 14.8s |
| #249 | Granite 4.2 8B medium | IBM Granite | 3.0 | 5.2 | $0.009 | 0/2 | 291.1s |
| #251 | Mistral Small 4 none | Mistral | 3.0 | 5.1 | $0.022 | 0/2 | 7.44s |