Comparaison benchmark Nemotron 3 Ultra 550b A55b vs Grok 4.20 Beta : Grok 4.20 Beta mène au score moyen avec 8.5 vs 7.5. Nemotron 3 Ultra 550b A55b a le coût de benchmark le plus bas avec $0.177 vs $0.750. Grok 4.20 Beta est plus rapide avec 9.75s vs 15.05s, avec des taux de réussite de 69.8% vs 81.5%.
Modèle recommandé: Nemotron 3 Ultra 550b A55b - Il offre le meilleur compromis global: score compétitif (7.5), coût inférieur à Grok 4.20 Beta et temps de réponse équilibré.
Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-06-10
Grok 4.20 BetaGrok 4.20 BetamediumModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.Sortie: 2026-03-12
Score
7.5Score moyen sur l’ensemble des tests de benchmark.…
8.5Score moyen sur l’ensemble des tests de benchmark.…
Rang
#42
#14
Fiabilité
9.7Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
N/DScore de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
Cohérence
8.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
9.5Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Tests corrects
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 7Erreur API: 1Temps de réponse (moy.)15.05sTemps de réponse (max)43.93sTemps de réponse (total)316.09sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3N'a pas suivi les instructions: 1Temps de réponse (moy.)9.75sTemps de réponse (max)31.36sTemps de réponse (total)175.48sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Taux de réussite par tentative
69.8%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
81.5%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
3Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Exécutions totales
63Exécutions totales…
52Exécutions totales…
Coût par résultat
0.000Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
4.505Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
Coût total
$0.177Coût total (prix actuel)…
$0.750Coût total (prix actuel)…
Prix d'entrée
$0.500 / 1MPrix d'entrée…
$5.805 / 1MPrix d'entrée…
Prix de sortie
$2.500 / 1MPrix de sortie…
$5.805 / 1MPrix de sortie…
Total des jetons d'entrée
46,813Total des jetons d'entrée…
35,955Total des jetons d'entrée…
Jetons de sortie
18,002Jetons de sortie…
1,647Jetons de sortie…
Jetons de raisonnement
53,091Jetons de raisonnement…
91,565Jetons de raisonnement…
Temps de réponse (moy.)
15.05sTemps de réponse (moy.)…
9.75sTemps de réponse (moy.)…
Temps de réponse (max)
43.93sTemps de réponse (max)…
31.36sTemps de réponse (max)…
Temps de réponse (total)
316.09sTemps de réponse (total)…
175.48sTemps de réponse (total)…
Generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#42 Nemotron 3 Ultra 550b A55b
medium
No showcase result has been generated for this model yet.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)8.62sTemps de réponse (max)16.86sTemps de réponse (total)34.49sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
8.62sTemps de réponse (moy.)…
780Total des jetons d'entrée…
835Jetons de sortie…
1,485Jetons de raisonnement…
Grok 4.20 BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
8.7Score moyen sur l’ensemble des tests de benchmark.…
7.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
91.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)3.16sTemps de réponse (max)3.44sTemps de réponse (total)12.65sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
8.4Score moyen sur l’ensemble des tests de benchmark.…
7.4Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
88.9%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)26.53sTemps de réponse (max)31.91sTemps de réponse (total)79.58sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
26.53sTemps de réponse (moy.)…
7,686Total des jetons d'entrée…
2,854Jetons de sortie…
17,725Jetons de raisonnement…
Grok 4.20 BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)31.36sTemps de réponse (max)31.36sTemps de réponse (total)31.36sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
9.8Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)43.93sTemps de réponse (max)43.93sTemps de réponse (total)43.93sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
43.93sTemps de réponse (moy.)…
17,574Total des jetons d'entrée…
1,040Jetons de sortie…
3,590Jetons de raisonnement…
Grok 4.20 BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)20.93sTemps de réponse (max)20.93sTemps de réponse (total)20.93sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)5.68sTemps de réponse (max)7.94sTemps de réponse (total)11.36sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.68sTemps de réponse (moy.)…
7,989Total des jetons d'entrée…
473Jetons de sortie…
1,285Jetons de raisonnement…
Grok 4.20 BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)4.01sTemps de réponse (max)4.27sTemps de réponse (total)8.02sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.5Score moyen sur l’ensemble des tests de benchmark.…
4.4Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3Temps de réponse (moy.)24.90sTemps de réponse (max)34.96sTemps de réponse (total)74.71sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
24.90sTemps de réponse (moy.)…
858Total des jetons d'entrée…
11,169Jetons de sortie…
16,249Jetons de raisonnement…
Grok 4.20 BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
5.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)21.33sTemps de réponse (max)24.21sTemps de réponse (total)64.00sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.7Score moyen sur l’ensemble des tests de benchmark.…
9.5Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Erreur API: 1Temps de réponse (moy.)2.52sTemps de réponse (max)2.52sTemps de réponse (total)2.52sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.52sTemps de réponse (moy.)…
360Total des jetons d'entrée…
70Jetons de sortie…
235Jetons de raisonnement…
Grok 4.20 BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)5.78sTemps de réponse (max)5.78sTemps de réponse (total)5.78sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
9.8Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)6.35sTemps de réponse (max)9.38sTemps de réponse (total)12.69sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.35sTemps de réponse (moy.)…
765Total des jetons d'entrée…
182Jetons de sortie…
1,243Jetons de raisonnement…
Grok 4.20 BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
9.8Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)4.89sTemps de réponse (max)5.89sTemps de réponse (total)9.78sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.5Score moyen sur l’ensemble des tests de benchmark.…
9.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)3.54sTemps de réponse (max)6.03sTemps de réponse (total)10.62sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.54sTemps de réponse (moy.)…
792Total des jetons d'entrée…
771Jetons de sortie…
2,055Jetons de raisonnement…
Grok 4.20 BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)3.52sTemps de réponse (max)4.53sTemps de réponse (total)10.57sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)7.72sTemps de réponse (max)7.72sTemps de réponse (total)7.72sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.72sTemps de réponse (moy.)…
9,781Total des jetons d'entrée…
304Jetons de sortie…
984Jetons de raisonnement…
Grok 4.20 BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)12.39sTemps de réponse (max)12.39sTemps de réponse (total)12.39sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)38.47sTemps de réponse (max)38.47sTemps de réponse (total)38.47sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
38.47sTemps de réponse (moy.)…
228Total des jetons d'entrée…
304Jetons de sortie…
8,240Jetons de raisonnement…
Grok 4.20 BetaModèle archivé : ce modèle n'est plus mis à jour ni testé sur de nouveaux tests.