Qwen3.8 27B (low) mène au score moyen avec 7.9 vs 7.8. Le coût du matériel local n’a pas été mesuré. Les comparaisons de coût ne sont donc pas disponibles. GPT-5.6 Terra (medium) est plus rapide avec 6.85s vs 39.11s, avec des taux de réussite de 69.7% vs 68.2%.
Benchmarks générés à partir des suites de tests AI BENCHY le:
2026-08-15
Rang
#66
Total des jetons de sortie
30,349
Temps de réponse (moy.)
6.85s
Coût total
$0.262
Rang
#61
Total des jetons de sortie
169,329
Temps de réponse (moy.)
39.11s
Coût total
N/D
Modèle recommandéGPT-5.6 Terra (medium)
Son score reste proche du meilleur score ici (7.8 vs 7.9) et il répond environ 5.7x plus vite que Qwen3.8 27B (low).
Qwen3.8 27BQwen3.8 27BlowLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14
Qwen3.8 27BQwen3.8 27BlowLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14
Score
7.8Score moyen sur l’ensemble des tests de benchmark.…
7.9Score moyen sur l’ensemble des tests de benchmark.…
Rang
#66
#61
Fiabilité
10.0Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
10.0Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
Cohérence
9.3Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Tentatives
66/66
66/66
Tests corrects
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 8Temps de réponse (moy.)6.85sTemps de réponse (max)41.68sTemps de réponse (total)150.65sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 4Aucune réponse: 2N'a pas suivi les instructions: 1Temps de réponse (moy.)39.11sTemps de réponse (max)376.04sTemps de réponse (total)860.51sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Taux de réussite par tentative
69.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
68.2%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Exécutions totales
66Exécutions totales…
66Exécutions totales…
Coût par résultat
4.603Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
N/DAffiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
Coût total
$0.262Coût total (prix actuel)…
N/DCoût total (prix actuel)…
Prix d'entrée
$1.000 / 1MPrix d'entrée…
N/DPrix d'entrée…
Prix de sortie
$6.000 / 1MPrix de sortie…
N/DPrix de sortie…
Total des jetons d'entrée
79,184Total des jetons d'entrée…
99,705Total des jetons d'entrée…
Jetons de sortie
4,878Jetons de sortie…
1,545Jetons de sortie…
Jetons de raisonnement
25,471Jetons de raisonnement…
167,784Jetons de raisonnement…
Temps de réponse (moy.)
6.85sTemps de réponse (moy.)…
39.11sTemps de réponse (moy.)…
Temps de réponse (max)
41.68sTemps de réponse (max)…
376.04sTemps de réponse (max)…
Temps de réponse (total)
150.65sTemps de réponse (total)…
860.51sTemps de réponse (total)…
Paramètres
~1T au total (~60B actifs)
27.3B
Disponibilité
Source fermée
Poids disponibles
Génération showcase de modèles
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#66 GPT-5.6 Terra
medium
Coût
$0.035
Temps
16.3s
Tokens
2,418 tok
#61 Qwen3.8 27B
lowLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
8.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
75.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)2.22sTemps de réponse (max)3.03sTemps de réponse (total)8.87sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.22sTemps de réponse (moy.)…
606Total des jetons d'entrée…
172Jetons de sortie…
657Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)3.02sTemps de réponse (max)5.68sTemps de réponse (total)12.07sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.1Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
55.6%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)7.19sTemps de réponse (max)9.73sTemps de réponse (total)21.57sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.19sTemps de réponse (moy.)…
7,302Total des jetons d'entrée…
427Jetons de sortie…
4,527Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
7.7Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Temps de réponse (moy.)140.92sTemps de réponse (max)376.04sTemps de réponse (total)422.75sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)11.10sTemps de réponse (max)15.93sTemps de réponse (total)22.19sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
11.10sTemps de réponse (moy.)…
55,976Total des jetons d'entrée…
3,212Jetons de sortie…
2,122Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)90.63sTemps de réponse (max)143.71sTemps de réponse (total)181.27sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)872msTemps de réponse (max)920msTemps de réponse (total)1.74sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
872msTemps de réponse (moy.)…
7,140Total des jetons d'entrée…
222Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)8.03sTemps de réponse (max)9.09sTemps de réponse (total)16.06sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)21.52sTemps de réponse (max)41.68sTemps de réponse (total)64.57sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
21.52sTemps de réponse (moy.)…
732Total des jetons d'entrée…
70Jetons de sortie…
13,846Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)60.78sTemps de réponse (max)120.94sTemps de réponse (total)182.34sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.5Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)2.37sTemps de réponse (max)2.37sTemps de réponse (total)2.37sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.37sTemps de réponse (moy.)…
477Total des jetons d'entrée…
133Jetons de sortie…
144Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)5.37sTemps de réponse (max)5.37sTemps de réponse (total)5.37sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)1.43sTemps de réponse (max)1.84sTemps de réponse (total)2.87sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
1.43sTemps de réponse (moy.)…
660Total des jetons d'entrée…
89Jetons de sortie…
261Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.43sTemps de réponse (max)2.87sTemps de réponse (total)4.86sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
8.4Score moyen sur l’ensemble des tests de benchmark.…
7.4Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
88.9%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)3.78sTemps de réponse (max)6.96sTemps de réponse (total)11.33sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.78sTemps de réponse (moy.)…
642Total des jetons d'entrée…
272Jetons de sortie…
1,462Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
7.7Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)4.91sTemps de réponse (max)8.81sTemps de réponse (total)14.74sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)5.09sTemps de réponse (max)5.09sTemps de réponse (total)5.09sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.09sTemps de réponse (moy.)…
5,454Total des jetons d'entrée…
254Jetons de sortie…
246Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)8.42sTemps de réponse (max)8.42sTemps de réponse (total)8.42sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)10.05sTemps de réponse (max)10.05sTemps de réponse (total)10.05sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.05sTemps de réponse (moy.)…
195Total des jetons d'entrée…
27Jetons de sortie…
2,206Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Temps de réponse (moy.)12.64sTemps de réponse (max)12.64sTemps de réponse (total)12.64sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…