Navigation
AI BENCHY
Your ad here

AI BENCHY Compare

Modèles comparés

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-05-01

Métrique Grok 4.20 Grok 4.20 medium Sortie: 2026-03-31 Grok 4.20 Beta Grok 4.20 Beta medium Sortie: 2026-03-12 Grok 4.3 Grok 4.3 medium Sortie: 2026-05-01
Score 7.0 8.2 8.2
Rang #63 #22 #20
Fiabilité N/D N/D 10.0
Cohérence 7.8 9.1 8.6
Tests corrects
Taux de réussite par tentative 66.7% 79.6% 81.5%
Tests instables 5 2 3
Exécutions totales 54 52 54
Coût par résultat 8.252 4.864 3.974
Coût total $0.743 $0.633 $0.517
Prix d'entrée $2.000 / 1M $0.000 / 1M $1.250 / 1M
Prix de sortie $6.000 / 1M $0.000 / 1M $2.500 / 1M
Jetons de sortie 1,744 1,568 1,223
Jetons de raisonnement 109,882 91,909 187,047
Temps de réponse (moy.) 10.33s 9.81s 48.63s
Temps de réponse (max) 29.87s 31.36s 216.69s
Temps de réponse (total) 185.87s 176.62s 875.27s

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Astuces anti-IA Score Cohérence Taux de réussite par tentative Tests instables Tests corrects Temps de réponse (moy.) Jetons de sortie Jetons de raisonnement
Grok 4.20 8.2 7.9 83.3% 1 3.36s 280 8,476
Grok 4.20 Beta 8.7 7.9 91.7% 1 3.16s 268 7,583
Grok 4.3 10.0 10.0 100.0% 0 8.83s 88 8,207
Programmation Score Cohérence Taux de réussite par tentative Tests instables Tests corrects Temps de réponse (moy.) Jetons de sortie Jetons de raisonnement
Grok 4.20 4.3 1.1 66.7% 1 24.33s 250 12,804
Grok 4.20 Beta 10.0 10.0 100.0% 0 31.36s 81 3,987
Grok 4.3 10.0 10.0 100.0% 0 45.72s 284 9,659
Combiné Score Cohérence Taux de réussite par tentative Tests instables Tests corrects Temps de réponse (moy.) Jetons de sortie Jetons de raisonnement
Grok 4.20 10.0 10.0 100.0% 0 17.40s 232 9,556
Grok 4.20 Beta 10.0 10.0 100.0% 0 20.93s 227 12,212
Grok 4.3 10.0 10.0 100.0% 0 63.99s 234 15,301
Analyse et extraction des données Score Cohérence Taux de réussite par tentative Tests instables Tests corrects Temps de réponse (moy.) Jetons de sortie Jetons de raisonnement
Grok 4.20 10.0 10.0 100.0% 0 4.17s 180 5,333
Grok 4.20 Beta 10.0 10.0 100.0% 0 4.01s 180 5,281
Grok 4.3 10.0 10.0 100.0% 0 18.97s 180 9,546
Spécifique au domaine Score Cohérence Taux de réussite par tentative Tests instables Tests corrects Temps de réponse (moy.) Jetons de sortie Jetons de raisonnement
Grok 4.20 5.3 10.0 33.3% 0 27.03s 375 49,339
Grok 4.20 Beta 5.3 10.0 33.3% 0 21.33s 251 40,255
Grok 4.3 5.3 7.2 44.4% 1 181.74s 14 111,300
Intelligence générale Score Cohérence Taux de réussite par tentative Tests instables Tests corrects Temps de réponse (moy.) Jetons de sortie Jetons de raisonnement
Grok 4.20 5.8 2.8 66.7% 1 7.09s 47 4,252
Grok 4.20 Beta 10.0 10.0 100.0% 0 5.78s 72 3,440
Grok 4.3 5.4 2.5 66.7% 1 24.70s 70 5,020
Suivi des instructions Score Cohérence Taux de réussite par tentative Tests instables Tests corrects Temps de réponse (moy.) Jetons de sortie Jetons de raisonnement
Grok 4.20 7.3 6.0 83.3% 1 4.42s 40 5,474
Grok 4.20 Beta 9.8 10.0 100.0% 0 4.97s 57 7,107
Grok 4.3 9.8 10.0 100.0% 0 18.58s 57 8,713
Résolution d'énigmes Score Cohérence Taux de réussite par tentative Tests instables Tests corrects Temps de réponse (moy.) Jetons de sortie Jetons de raisonnement
Grok 4.20 6.4 7.7 55.6% 1 3.89s 143 8,028
Grok 4.20 Beta 8.2 7.2 88.9% 1 3.85s 249 6,660
Grok 4.3 5.9 7.2 55.6% 1 22.53s 128 14,686
Appel d'outils Score Cohérence Taux de réussite par tentative Tests instables Tests corrects Temps de réponse (moy.) Jetons de sortie Jetons de raisonnement
Grok 4.20 3.0 10.0 0.0% 0 13.68s 197 6,620
Grok 4.20 Beta 3.0 10.0 0.0% 0 12.39s 183 5,384
Grok 4.3 10.0 10.0 100.0% 0 17.66s 168 4,615

Comparaison rapide

Changer la paire de comparaison