Le score moyen est pratiquement à égalité avec 7.9 vs 7.9. Le coût du matériel local n’a pas été mesuré. Les comparaisons de coût ne sont donc pas disponibles. GPT-5.2 Chat est plus rapide avec 7.73s vs 39.11s, avec des taux de réussite de 69.7% vs 68.2%.
Benchmarks générés à partir des suites de tests AI BENCHY le:
2026-08-15
Rang
#59
Total des jetons de sortie
29,742
Temps de réponse (moy.)
7.73s
Coût total
$0.594
Rang
#61
Total des jetons de sortie
169,329
Temps de réponse (moy.)
39.11s
Coût total
N/D
Modèle recommandéGPT-5.2 Chat
Il obtient le meilleur score ici (7.9) et répond environ 5.1x plus vite que Qwen3.8 27B (low).
Qwen3.8 27BQwen3.8 27BlowLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14
Qwen3.8 27BQwen3.8 27BlowLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14
Score
7.9Score moyen sur l’ensemble des tests de benchmark.…
7.9Score moyen sur l’ensemble des tests de benchmark.…
Rang
#59
#61
Fiabilité
10.0Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
10.0Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
Cohérence
8.6Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Tentatives
66/66
66/66
Tests corrects
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 6Erreur API: 1N'a pas suivi les instructions: 1Aucune réponse: 1Temps de réponse (moy.)7.73sTemps de réponse (max)38.52sTemps de réponse (total)162.40sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 4Aucune réponse: 2N'a pas suivi les instructions: 1Temps de réponse (moy.)39.11sTemps de réponse (max)376.04sTemps de réponse (total)860.51sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Taux de réussite par tentative
69.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
68.2%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
4Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Exécutions totales
66Exécutions totales…
66Exécutions totales…
Coût par résultat
4.564Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
N/DAffiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
Coût total
$0.594Coût total (prix actuel)…
N/DCoût total (prix actuel)…
Prix d'entrée
$1.750 / 1MPrix d'entrée…
N/DPrix d'entrée…
Prix de sortie
$14.000 / 1MPrix de sortie…
N/DPrix de sortie…
Total des jetons d'entrée
101,104Total des jetons d'entrée…
99,705Total des jetons d'entrée…
Jetons de sortie
29,742Jetons de sortie…
1,545Jetons de sortie…
Jetons de raisonnement
0Jetons de raisonnement…
167,784Jetons de raisonnement…
Temps de réponse (moy.)
7.73sTemps de réponse (moy.)…
39.11sTemps de réponse (moy.)…
Temps de réponse (max)
38.52sTemps de réponse (max)…
376.04sTemps de réponse (max)…
Temps de réponse (total)
162.40sTemps de réponse (total)…
860.51sTemps de réponse (total)…
Paramètres
~400B au total (~17B actifs)
27.3B
Disponibilité
Source fermée
Poids disponibles
Génération showcase de modèles
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#59 GPT-5.2 Chat
none
Coût
$0.010
Temps
15.3s
Tokens
797 tok
#61 Qwen3.8 27B
lowLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
8.7Score moyen sur l’ensemble des tests de benchmark.…
7.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
91.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)3.40sTemps de réponse (max)4.78sTemps de réponse (total)13.59sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.40sTemps de réponse (moy.)…
606Total des jetons d'entrée…
1,807Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)3.02sTemps de réponse (max)5.68sTemps de réponse (total)12.07sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
8.8Score moyen sur l’ensemble des tests de benchmark.…
7.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
88.9%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)9.82sTemps de réponse (max)13.35sTemps de réponse (total)29.45sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
9.82sTemps de réponse (moy.)…
7,305Total des jetons d'entrée…
6,731Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
7.7Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Temps de réponse (moy.)140.92sTemps de réponse (max)376.04sTemps de réponse (total)422.75sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.3Score moyen sur l’ensemble des tests de benchmark.…
5.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
83.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Temps de réponse (moy.)13.91sTemps de réponse (max)18.70sTemps de réponse (total)27.82sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
13.91sTemps de réponse (moy.)…
78,055Total des jetons d'entrée…
7,923Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)90.63sTemps de réponse (max)143.71sTemps de réponse (total)181.27sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)3.05sTemps de réponse (max)3.33sTemps de réponse (total)6.10sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.05sTemps de réponse (moy.)…
7,140Total des jetons d'entrée…
980Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)8.03sTemps de réponse (max)9.09sTemps de réponse (total)16.06sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Erreur API: 1Temps de réponse (moy.)23.67sTemps de réponse (max)38.52sTemps de réponse (total)47.34sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
23.67sTemps de réponse (moy.)…
579Total des jetons d'entrée…
7,128Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)60.78sTemps de réponse (max)120.94sTemps de réponse (total)182.34sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.4Score moyen sur l’ensemble des tests de benchmark.…
3.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)3.20sTemps de réponse (max)3.20sTemps de réponse (total)3.20sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.20sTemps de réponse (moy.)…
477Total des jetons d'entrée…
335Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)5.37sTemps de réponse (max)5.37sTemps de réponse (total)5.37sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
9.8Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)5.51sTemps de réponse (max)6.55sTemps de réponse (total)11.02sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.51sTemps de réponse (moy.)…
660Total des jetons d'entrée…
1,441Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.43sTemps de réponse (max)2.87sTemps de réponse (total)4.86sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.7Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)4.10sTemps de réponse (max)5.04sTemps de réponse (total)12.31sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.10sTemps de réponse (moy.)…
642Total des jetons d'entrée…
1,603Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
7.7Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)4.91sTemps de réponse (max)8.81sTemps de réponse (total)14.74sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)4.68sTemps de réponse (max)4.68sTemps de réponse (total)4.68sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.68sTemps de réponse (moy.)…
5,445Total des jetons d'entrée…
555Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)8.42sTemps de réponse (max)8.42sTemps de réponse (total)8.42sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)6.89sTemps de réponse (max)6.89sTemps de réponse (total)6.89sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.89sTemps de réponse (moy.)…
195Total des jetons d'entrée…
1,239Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Temps de réponse (moy.)12.64sTemps de réponse (max)12.64sTemps de réponse (total)12.64sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…