Leaderboard AI Benchy
Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-09-02
Modèles évalués: 305
Modèles recommandés
GPT-5.6 Sol
high
Intelligent
Taux de réussite par tentative
89.4%
Tests corrects
18 / 22
Score
9.4/10
GPT-5.6 Luna
medium
Rapide
Temps de réponse (moy.)
7.43s
Total des jetons de sortie
44,525
Score
7.4/10
DeepSeek V4 Flash 0731
high
Abordable
Prix d'entrée
$0.065 / 1M
Prix de sortie
$0.180 / 1M
Score
8.0/10
305/305
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Score Score moyen sur l’ensemble des tests de benchmark. | Entreprise | Coût total | Temps de réponse (moy.) Temps de réponse (moy.) | Tests corrects Affiche combien de tests sont entièrement réussis (toutes les exécutions réussissent). |
|---|---|---|---|---|---|---|
| #305#305 | LFM2-24B-A2BnoneModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests. | 2.2… | Liquid | $0.001 … | 782ms… | Un test est entièrement réussi uniquement si toutes ses exécutions réussissent. Mauvaise réponse: 9 Erreur API: 4 N'a pas suivi les instructions: 1 Temps de réponse (moy.)782ms Temps de réponse (max)3.15s Temps de réponse (total)10.94s … |
|
||||||
| #303#303 | Nemotron 3 Nano Omni 30b A3b ReasoningnoneModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests. | 3.2… | NVIDIA | $0.000 … | 728ms… | Un test est entièrement réussi uniquement si toutes ses exécutions réussissent. Mauvaise réponse: 9 Erreur API: 6 N'a pas suivi les instructions: 2 Temps de réponse (moy.)728ms Temps de réponse (max)2.21s Temps de réponse (total)9.47s … |
|
||||||
| #279#279 | Laguna S 2.1none | 4.5… | Poolside | $0.022 ↓ … | 11.67s… | Un test est entièrement réussi uniquement si toutes ses exécutions réussissent. Mauvaise réponse: 18 N'a pas suivi les instructions: 1 Aucune réponse: 1 Temps de réponse (moy.)11.67s Temps de réponse (max)200.52s Temps de réponse (total)256.71s … |
|
||||||
| #291#291 | Ling 3.0 Tinynone | 4.0… | Inclusionai | $0.000 … | 14.02s… | Un test est entièrement réussi uniquement si toutes ses exécutions réussissent. Mauvaise réponse: 13 N'a pas suivi les instructions: 4 Erreur API: 1 Mise en forme supplémentaire: 1 Appel d'outil invalide: 1 Temps de réponse (moy.)14.02s Temps de réponse (max)240.61s Temps de réponse (total)294.46s … |
Mauvaise réponse: 13 N'a pas suivi les instructions: 4 Erreur API: 1 Mise en forme supplémentaire: 1 Appel d'outil invalide: 1
|
||||||
| #292#292 | Granite 4.1 8Bnone | 4.0… | IBM Granite | $0.007 … | 1.44s… | Un test est entièrement réussi uniquement si toutes ses exécutions réussissent. Mauvaise réponse: 13 N'a pas suivi les instructions: 4 Appel d'outil invalide: 2 Mise en forme supplémentaire: 1 Temps de réponse (moy.)1.44s Temps de réponse (max)16.67s Temps de réponse (total)31.75s … |
Mauvaise réponse: 13 N'a pas suivi les instructions: 4 Appel d'outil invalide: 2 Mise en forme supplémentaire: 1
|
||||||
Tendances globales du benchmark
Voyez comment les modèles actuels équilibrent score, coût, vitesse, longueur des sorties et performance par catégorie.
Évolution du meilleur score des entreprises leaders
Frontière de Pareto : intelligence vs vitesse de réponse
Frontière de Pareto : score vs jetons de sortie
Difficulté des catégories selon les modèles
Comparaison rapide
Gemini 3.6 FlashhighvsGemini 3.7 FlashhighGemini 3.7 FlashhighvsGemini 3.6 FlashmediumGemini 3.6 FlashmediumvsGPT-5.6 SollowGPT-5.6 SollowvsGemini 3 Flash PreviewmediumGemini 3 Flash PreviewmediumvsGemini 3.5 FlashhighGemini 3.5 FlashhighvsGemini 3.7 FlashmediumGemini 3.7 FlashmediumvsGPT-5.6 SolmediumGPT-5.6 SolmediumvsGPT-5.6 SolhighGPT-5.6 SolhighvsGPT-5.5lowGPT-5.5lowvsGrok 4.6highGrok 4.6highvsGemini 3.1 Pro PreviewmediumGemini 3.1 Pro PreviewmediumvsGemini 3.7 Flashlow