Grok 4.5 (medium) mène au score moyen avec 8.5 vs 8.4. Le coût du matériel local n’a pas été mesuré. Les comparaisons de coût ne sont donc pas disponibles. Grok 4.5 (medium) est plus rapide avec 68.59s vs 167.89s, avec des taux de réussite de 77.3% vs 83.3%.
Benchmarks générés à partir des suites de tests AI BENCHY le:
2026-08-15
Rang
#42
Total des jetons de sortie
656,635
Temps de réponse (moy.)
167.89s
Coût total
N/D
Rang
#37
Total des jetons de sortie
299,460
Temps de réponse (moy.)
68.59s
Coût total
$2.042
Modèle recommandéGrok 4.5 (medium)
Il obtient le meilleur score ici (8.5) et répond environ 2.4x plus vite que Qwen3.8 27B (high).
Comparaison détaillée
Métrique
Qwen3.8 27BQwen3.8 27BhighLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14
Qwen3.8 27BQwen3.8 27BhighLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14
8.4Score moyen sur l’ensemble des tests de benchmark.…
8.5Score moyen sur l’ensemble des tests de benchmark.…
Rang
#42
#37
Fiabilité
9.6Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
10.0Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
Cohérence
9.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
8.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Tentatives
66/66
66/66
Tests corrects
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 2Aucune réponse: 2Mauvaise réponse: 2Temps de réponse (moy.)167.89sTemps de réponse (max)640.85sTemps de réponse (total)3693.54sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 5Temps de réponse (moy.)68.59sTemps de réponse (max)436.38sTemps de réponse (total)1508.91sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Taux de réussite par tentative
77.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
83.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
3Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Exécutions totales
66Exécutions totales…
66Exécutions totales…
Coût par résultat
N/DAffiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
12.007Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
Coût total
N/DCoût total (prix actuel)…
$2.042Coût total (prix actuel)…
Prix d'entrée
N/DPrix d'entrée…
$2.000 / 1MPrix d'entrée…
Prix de sortie
N/DPrix de sortie…
$6.000 / 1MPrix de sortie…
Total des jetons d'entrée
100,179Total des jetons d'entrée…
122,155Total des jetons d'entrée…
Jetons de sortie
904Jetons de sortie…
5,514Jetons de sortie…
Jetons de raisonnement
655,731Jetons de raisonnement…
293,946Jetons de raisonnement…
Temps de réponse (moy.)
167.89sTemps de réponse (moy.)…
68.59sTemps de réponse (moy.)…
Temps de réponse (max)
640.85sTemps de réponse (max)…
436.38sTemps de réponse (max)…
Temps de réponse (total)
3693.54sTemps de réponse (total)…
1508.91sTemps de réponse (total)…
Paramètres
27.3B
~1.7T au total (~170B actifs)
Disponibilité
Poids disponibles
Source fermée
Génération showcase de modèles
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#42 Qwen3.8 27B
highLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
Coût
N/D
Temps
270.1s
Tokens
18,963 tok
#37 SpaceXAI: Grok 4.5
medium
Coût
$0.044
Temps
59.4s
Tokens
7,512 tok
Score
-
Coût
-
Temps
-
Tokens
-
Meilleurs modèles par score
Score vs coût total
Temps de réponse (moy.)
Score vs Temps de réponse (moy.)
Total des jetons de sortie
Score vs Total des jetons de sortie
Répartition par catégorie
Astuces anti-IA
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)8.10sTemps de réponse (max)21.48sTemps de réponse (total)32.40sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)23.50sTemps de réponse (max)47.78sTemps de réponse (total)93.99sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
23.50sTemps de réponse (moy.)…
2,991Total des jetons d'entrée…
147Jetons de sortie…
4,018Jetons de raisonnement…
Programmation
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
8.1Score moyen sur l’ensemble des tests de benchmark.…
7.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
88.9%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)248.62sTemps de réponse (max)458.25sTemps de réponse (total)745.85sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.6Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
77.8%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)155.69sTemps de réponse (max)305.49sTemps de réponse (total)467.06sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
155.69sTemps de réponse (moy.)…
9,579Total des jetons d'entrée…
390Jetons de sortie…
104,634Jetons de raisonnement…
Combiné
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)185.57sTemps de réponse (max)333.21sTemps de réponse (total)371.15sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)29.01sTemps de réponse (max)42.36sTemps de réponse (total)58.01sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
29.01sTemps de réponse (moy.)…
83,730Total des jetons d'entrée…
4,154Jetons de sortie…
16,180Jetons de raisonnement…
Analyse et extraction des données
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)34.85sTemps de réponse (max)57.71sTemps de réponse (total)69.71sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)6.29sTemps de réponse (max)6.68sTemps de réponse (total)12.58sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.29sTemps de réponse (moy.)…
8,937Total des jetons d'entrée…
225Jetons de sortie…
3,657Jetons de raisonnement…
Spécifique au domaine
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Mauvaise réponse: 1Temps de réponse (moy.)526.74sTemps de réponse (max)640.85sTemps de réponse (total)1580.21sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.3Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
44.4%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)249.34sTemps de réponse (max)436.38sTemps de réponse (total)748.02sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
249.34sTemps de réponse (moy.)…
2,221Total des jetons d'entrée…
11Jetons de sortie…
140,815Jetons de raisonnement…
Intelligence générale
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)8.45sTemps de réponse (max)8.45sTemps de réponse (total)8.45sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.5Score moyen sur l’ensemble des tests de benchmark.…
3.4Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)12.84sTemps de réponse (max)12.84sTemps de réponse (total)12.84sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
12.84sTemps de réponse (moy.)…
1,077Total des jetons d'entrée…
71Jetons de sortie…
2,384Jetons de raisonnement…
Suivi des instructions
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
9.8Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)8.24sTemps de réponse (max)10.18sTemps de réponse (total)16.49sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
9.8Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)6.06sTemps de réponse (max)7.94sTemps de réponse (total)12.12sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.06sTemps de réponse (moy.)…
1,857Total des jetons d'entrée…
57Jetons de sortie…
2,728Jetons de raisonnement…
Résolution d'énigmes
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
7.6Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
77.8%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Temps de réponse (moy.)199.90sTemps de réponse (max)569.33sTemps de réponse (total)599.69sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)7.75sTemps de réponse (max)12.42sTemps de réponse (total)23.26sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.75sTemps de réponse (moy.)…
2,430Total des jetons d'entrée…
254Jetons de sortie…
3,641Jetons de raisonnement…
Appel d'outils
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)5.62sTemps de réponse (max)5.62sTemps de réponse (total)5.62sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)6.57sTemps de réponse (max)6.57sTemps de réponse (total)6.57sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.57sTemps de réponse (moy.)…
8,544Total des jetons d'entrée…
192Jetons de sortie…
968Jetons de raisonnement…
Culture générale
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)263.98sTemps de réponse (max)263.98sTemps de réponse (total)263.98sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)74.44sTemps de réponse (max)74.44sTemps de réponse (total)74.44sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…