Qwen3.8 27B (medium) mène au score moyen avec 7.2 vs 7.1. Qwen3.8 27B (medium) a le coût de benchmark le plus bas avec ~$0.073 vs $2.766. Claude Opus 5 est plus rapide avec 10.78s vs 40.09s, avec des taux de réussite de 55.1% vs 66.7%.
Benchmarks générés à partir des suites de tests AI BENCHY le:
2026-10-01
Modèles comparés
Rang
#149
Total des jetons de sortie
31,386
Temps de réponse (moy.)
10.78s
Coût total
$2.766
Les réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
Rang
#141
Total des jetons de sortie
170,696
Temps de réponse (moy.)
40.09s
Coût total
~$0.073Estimation de l’électricité consommée par le GPU uniquement. Le reste de l’ordinateur et l’achat du matériel ne sont pas inclus. NVIDIA GeForce RTX 3090: 0.7349 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.072660.
Modèle recommandéQwen3.8 27B (medium)
Il obtient le meilleur score ici (7.2) tout en coûtant environ 38.1x moins que Claude Opus 5.
Qwen3.8 27BQwen3.8 27BmediumLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14Disponible gratuitement
Qwen3.8 27BQwen3.8 27BmediumLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14Disponible gratuitement
Score
7.1Score moyen sur l’ensemble des tests de benchmark.…
7.2Score moyen sur l’ensemble des tests de benchmark.…
Rang
#149
#141
Fiabilité
10.0Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
9.7Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
Cohérence
9.6Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
9.4Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
55.1%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Exécutions totales
69Exécutions totales…
69Exécutions totales…
Coût par résultat
23.044
~0.520Estimation de l’électricité consommée par le GPU uniquement. Le reste de l’ordinateur et l’achat du matériel ne sont pas inclus. NVIDIA GeForce RTX 3090: 0.7349 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.072660.
Coût total
$2.766
~$0.073Estimation de l’électricité consommée par le GPU uniquement. Le reste de l’ordinateur et l’achat du matériel ne sont pas inclus. NVIDIA GeForce RTX 3090: 0.7349 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.072660.
Prix d'entrée
$5.000 / 1MPrix d'entrée…
N/DPrix d'entrée…
Prix de sortie
$25.000 / 1MPrix de sortie…
N/DPrix de sortie…
Total des jetons d'entrée
396,120Total des jetons d'entrée…
277,164Total des jetons d'entrée…
Jetons de sortie
31,386Jetons de sortie…
1,913Jetons de sortie…
Jetons de raisonnement
0Jetons de raisonnement…
168,783Jetons de raisonnement…
Temps de réponse (moy.)
10.78sTemps de réponse (moy.)…
40.09sTemps de réponse (moy.)…
Temps de réponse (max)
79.61sTemps de réponse (max)…
214.63sTemps de réponse (max)…
Temps de réponse (total)
247.96sTemps de réponse (total)…
881.89sTemps de réponse (total)…
Paramètres
~5T au total (~500B actifs)
27.3B
Disponibilité
Source fermée
Poids disponibles
Génération showcase de modèles
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#149 Claude Opus 5
none
Coût
$0.271
Temps
149.3s
Tokens
10,962 tok
#141 Qwen3.8 27B
mediumLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
Coût
~$0.002Estimation de l’électricité consommée par le GPU uniquement. Le reste de l’ordinateur et l’achat du matériel ne sont pas inclus. NVIDIA GeForce RTX 3090: 0.0121 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.001193.
5.4Score moyen sur l’ensemble des tests de benchmark.…
9.6Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)79.61sTemps de réponse (max)79.61sTemps de réponse (total)79.61sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
79.61sTemps de réponse (moy.)…
210,573Total des jetons d'entrée…
6,520Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
4.7Score moyen sur l’ensemble des tests de benchmark.…
1.6Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)187.85sTemps de réponse (max)187.85sTemps de réponse (total)187.85sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.5Score moyen sur l’ensemble des tests de benchmark.…
8.3Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
41.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3Temps de réponse (moy.)4.33sTemps de réponse (max)9.08sTemps de réponse (total)17.30sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.33sTemps de réponse (moy.)…
834Total des jetons d'entrée…
1,398Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.93sTemps de réponse (max)5.18sTemps de réponse (total)11.70sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.9Score moyen sur l’ensemble des tests de benchmark.…
9.7Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mise en forme supplémentaire: 1Mauvaise réponse: 1Temps de réponse (moy.)5.54sTemps de réponse (max)8.42sTemps de réponse (total)16.63sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.54sTemps de réponse (moy.)…
10,590Total des jetons d'entrée…
2,886Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)40.50sTemps de réponse (max)72.14sTemps de réponse (total)121.51sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
8.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Appel d'outil invalide: 1Temps de réponse (moy.)30.54sTemps de réponse (max)47.72sTemps de réponse (total)61.09sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
30.54sTemps de réponse (moy.)…
148,140Total des jetons d'entrée…
13,011Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
8.7Score moyen sur l’ensemble des tests de benchmark.…
6.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
83.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Appel d'outil invalide: 1Temps de réponse (moy.)124.48sTemps de réponse (max)214.63sTemps de réponse (total)248.96sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)3.88sTemps de réponse (max)4.06sTemps de réponse (total)7.75sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.88sTemps de réponse (moy.)…
10,503Total des jetons d'entrée…
309Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
6.5Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)8.76sTemps de réponse (max)10.36sTemps de réponse (total)17.53sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)11.10sTemps de réponse (max)26.91sTemps de réponse (total)33.31sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
11.10sTemps de réponse (moy.)…
972Total des jetons d'entrée…
5,440Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)76.98sTemps de réponse (max)144.07sTemps de réponse (total)230.93sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)3.70sTemps de réponse (max)3.70sTemps de réponse (total)3.70sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.70sTemps de réponse (moy.)…
708Total des jetons d'entrée…
316Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)9.20sTemps de réponse (max)9.20sTemps de réponse (total)9.20sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.81sTemps de réponse (max)2.98sTemps de réponse (total)5.62sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.81sTemps de réponse (moy.)…
909Total des jetons d'entrée…
99Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.54sTemps de réponse (max)2.67sTemps de réponse (total)5.07sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.7Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mise en forme supplémentaire: 1Temps de réponse (moy.)3.66sTemps de réponse (max)4.75sTemps de réponse (total)10.98sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.66sTemps de réponse (moy.)…
894Total des jetons d'entrée…
874Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
8.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)12.62sTemps de réponse (max)29.62sTemps de réponse (total)37.85sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)7.89sTemps de réponse (max)7.89sTemps de réponse (total)7.89sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.89sTemps de réponse (moy.)…
11,739Total des jetons d'entrée…
355Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Erreur API: 1Temps de réponse (moy.)0msTemps de réponse (max)0msTemps de réponse (total)0msUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Temps de réponse (moy.)4.08sTemps de réponse (max)4.08sTemps de réponse (total)4.08sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.08sTemps de réponse (moy.)…
258Total des jetons d'entrée…
178Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Temps de réponse (moy.)11.29sTemps de réponse (max)11.29sTemps de réponse (total)11.29sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…