GLM 5.2 (high) mène au score moyen avec 8.0 vs 7.8. Le coût du matériel local n’a pas été mesuré. Les comparaisons de coût ne sont donc pas disponibles. Qwen3.8 27B (medium) est plus rapide avec 33.05s vs 69.86s, avec des taux de réussite de 66.7% vs 69.7%.
Benchmarks générés à partir des suites de tests AI BENCHY le:
2026-08-15
Rang
#68
Total des jetons de sortie
136,162
Temps de réponse (moy.)
33.05s
Coût total
N/D
Rang
#55
Total des jetons de sortie
364,655
Temps de réponse (moy.)
69.86s
Coût total
$1.463
Modèle recommandéGLM 5.2 (high)
Il obtient le meilleur score de cette comparaison (8.0) et le meilleur équilibre global entre coût et temps de réponse sur les 2 modèles.
Comparaison détaillée
Métrique
Qwen3.8 27BQwen3.8 27BmediumLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14
Qwen3.8 27BQwen3.8 27BmediumLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14
7.8Score moyen sur l’ensemble des tests de benchmark.…
8.0Score moyen sur l’ensemble des tests de benchmark.…
Rang
#68
#55
Fiabilité
9.6Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
10.0Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
Cohérence
9.7Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
8.6Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
69.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
3Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Exécutions totales
66Exécutions totales…
66Exécutions totales…
Coût par résultat
N/DAffiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
6.849Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
Coût total
N/DCoût total (prix actuel)…
$1.463Coût total (prix actuel)…
Prix d'entrée
N/DPrix d'entrée…
$1.190 / 1MPrix d'entrée…
Prix de sortie
N/DPrix de sortie…
$3.740 / 1MPrix de sortie…
Total des jetons d'entrée
98,266Total des jetons d'entrée…
83,822Total des jetons d'entrée…
Jetons de sortie
1,861Jetons de sortie…
72,040Jetons de sortie…
Jetons de raisonnement
134,301Jetons de raisonnement…
292,615Jetons de raisonnement…
Temps de réponse (moy.)
33.05sTemps de réponse (moy.)…
69.86sTemps de réponse (moy.)…
Temps de réponse (max)
214.63sTemps de réponse (max)…
599.43sTemps de réponse (max)…
Temps de réponse (total)
694.04sTemps de réponse (total)…
1536.98sTemps de réponse (total)…
Paramètres
27.3B
744B au total (40B actifs)
Disponibilité
Poids disponibles
Open source
Génération showcase de modèles
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#68 Qwen3.8 27B
mediumLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
Coût
N/D
Temps
43.4s
Tokens
2,956 tok
#55 GLM 5.2
high
SVG invalide
Coût
$0.000
Temps
300.0s
Tokens
0 tok
Score
-
Coût
-
Temps
-
Tokens
-
Meilleurs modèles par score
Score vs coût total
Temps de réponse (moy.)
Score vs Temps de réponse (moy.)
Total des jetons de sortie
Score vs Total des jetons de sortie
Répartition par catégorie
Astuces anti-IA
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.93sTemps de réponse (max)5.18sTemps de réponse (total)11.70sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)5.80sTemps de réponse (max)7.00sTemps de réponse (total)23.18sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.80sTemps de réponse (moy.)…
639Total des jetons d'entrée…
406Jetons de sortie…
2,660Jetons de raisonnement…
Programmation
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)40.50sTemps de réponse (max)72.14sTemps de réponse (total)121.51sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.4Score moyen sur l’ensemble des tests de benchmark.…
8.6Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Délai dépassé: 2Temps de réponse (moy.)73.03sTemps de réponse (max)129.73sTemps de réponse (total)219.09sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
73.03sTemps de réponse (moy.)…
5,124Total des jetons d'entrée…
2,302Jetons de sortie…
22,546Jetons de raisonnement…
Combiné
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
8.7Score moyen sur l’ensemble des tests de benchmark.…
6.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
83.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Appel d'outil invalide: 1Temps de réponse (moy.)124.48sTemps de réponse (max)214.63sTemps de réponse (total)248.96sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)321.47sTemps de réponse (max)599.43sTemps de réponse (total)642.94sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
321.47sTemps de réponse (moy.)…
61,516Total des jetons d'entrée…
18,824Jetons de sortie…
63,861Jetons de raisonnement…
Analyse et extraction des données
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
6.5Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)8.76sTemps de réponse (max)10.36sTemps de réponse (total)17.53sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)5.81sTemps de réponse (max)9.80sTemps de réponse (total)11.62sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.81sTemps de réponse (moy.)…
7,143Total des jetons d'entrée…
435Jetons de sortie…
1,414Jetons de raisonnement…
Spécifique au domaine
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)76.98sTemps de réponse (max)144.07sTemps de réponse (total)230.93sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.1Score moyen sur l’ensemble des tests de benchmark.…
6.5Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
11.1%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 2Délai dépassé: 1Temps de réponse (moy.)126.85sTemps de réponse (max)180.69sTemps de réponse (total)380.54sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
126.85sTemps de réponse (moy.)…
560Total des jetons d'entrée…
49,045Jetons de sortie…
157,522Jetons de raisonnement…
Intelligence générale
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)9.20sTemps de réponse (max)9.20sTemps de réponse (total)9.20sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)12.90sTemps de réponse (max)12.90sTemps de réponse (total)12.90sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
12.90sTemps de réponse (moy.)…
498Total des jetons d'entrée…
63Jetons de sortie…
1,743Jetons de raisonnement…
Suivi des instructions
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.54sTemps de réponse (max)2.67sTemps de réponse (total)5.07sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)4.26sTemps de réponse (max)5.88sTemps de réponse (total)8.52sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.26sTemps de réponse (moy.)…
678Total des jetons d'entrée…
151Jetons de sortie…
1,210Jetons de raisonnement…
Résolution d'énigmes
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
8.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)12.62sTemps de réponse (max)29.62sTemps de réponse (total)37.85sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.0Score moyen sur l’ensemble des tests de benchmark.…
4.6Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Mauvaise réponse: 1Temps de réponse (moy.)33.71sTemps de réponse (max)76.21sTemps de réponse (total)101.13sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
33.71sTemps de réponse (moy.)…
665Total des jetons d'entrée…
568Jetons de sortie…
22,392Jetons de raisonnement…
Appel d'outils
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Erreur API: 1Temps de réponse (moy.)0msTemps de réponse (max)0msTemps de réponse (total)0msUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)9.25sTemps de réponse (max)9.25sTemps de réponse (total)9.25sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
9.25sTemps de réponse (moy.)…
6,861Total des jetons d'entrée…
246Jetons de sortie…
503Jetons de raisonnement…
Culture générale
Score
Cohérence
Taux de réussite par tentative
Tests instables
Tests corrects
Temps de réponse (moy.)
Jetons d'entrée
Jetons de sortie
Jetons de raisonnement
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Temps de réponse (moy.)11.29sTemps de réponse (max)11.29sTemps de réponse (total)11.29sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)127.82sTemps de réponse (max)127.82sTemps de réponse (total)127.82sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…