Qwen3.8 27B mène au score moyen avec 5.5 vs 5.4. Le coût du matériel local n’a pas été mesuré. Les comparaisons de coût ne sont donc pas disponibles. Qwen3.8 27B est plus rapide avec 3.12s vs 36.17s, avec des taux de réussite de 27.3% vs 40.9%.
Benchmarks générés à partir des suites de tests AI BENCHY le:
2026-08-15
Rang
#213
Total des jetons de sortie
100,726
Temps de réponse (moy.)
36.17s
Coût total
$0.062
Rang
#211
Total des jetons de sortie
11,445
Temps de réponse (moy.)
3.12s
Coût total
N/D
Modèle recommandéQwen3.8 27B
Il obtient le meilleur score ici (5.5) et répond environ 11.6x plus vite que DeepSeek V4 Flash 0423.
Qwen3.8 27BQwen3.8 27BnoneLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14
Qwen3.8 27BQwen3.8 27BnoneLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14
Score
5.4Score moyen sur l’ensemble des tests de benchmark.…
5.5Score moyen sur l’ensemble des tests de benchmark.…
Rang
#213
#211
Fiabilité
10.0Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
10.0Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
Cohérence
8.5Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 11N'a pas suivi les instructions: 1Appel d'outil invalide: 1Temps de réponse (moy.)3.12sTemps de réponse (max)44.76sTemps de réponse (total)68.69sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Taux de réussite par tentative
27.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
40.9%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
4Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Exécutions totales
66Exécutions totales…
66Exécutions totales…
Coût par résultat
1.146Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
N/DAffiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
Coût total
$0.062Coût total (prix actuel)…
N/DCoût total (prix actuel)…
Prix d'entrée
$0.140 / 1MPrix d'entrée…
N/DPrix d'entrée…
Prix de sortie
$0.280 / 1MPrix de sortie…
N/DPrix de sortie…
Total des jetons d'entrée
240,230Total des jetons d'entrée…
122,463Total des jetons d'entrée…
Jetons de sortie
100,726Jetons de sortie…
11,445Jetons de sortie…
Jetons de raisonnement
0Jetons de raisonnement…
0Jetons de raisonnement…
Temps de réponse (moy.)
36.17sTemps de réponse (moy.)…
3.12sTemps de réponse (moy.)…
Temps de réponse (max)
247.27sTemps de réponse (max)…
44.76sTemps de réponse (max)…
Temps de réponse (total)
795.83sTemps de réponse (total)…
68.69sTemps de réponse (total)…
Paramètres
284B au total (13B actifs)
27.3B
Disponibilité
Open source
Poids disponibles
Génération showcase de modèles
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#213 DeepSeek V4 Flash 0423
none
Coût
$0.004
Temps
157.6s
Tokens
11,297 tok
#211 Qwen3.8 27B
noneLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 4Temps de réponse (moy.)20.18sTemps de réponse (max)26.54sTemps de réponse (total)80.73sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
20.18sTemps de réponse (moy.)…
540Total des jetons d'entrée…
174Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
6.5Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)828msTemps de réponse (max)1.95sTemps de réponse (total)3.31sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.2Score moyen sur l’ensemble des tests de benchmark.…
7.4Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
11.1%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3Temps de réponse (moy.)17.13sTemps de réponse (max)24.90sTemps de réponse (total)51.40sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
17.13sTemps de réponse (moy.)…
7,279Total des jetons d'entrée…
9,717Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.5Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)1.19sTemps de réponse (max)1.97sTemps de réponse (total)3.56sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.6Score moyen sur l’ensemble des tests de benchmark.…
1.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Appel d'outil invalide: 2Temps de réponse (moy.)179.61sTemps de réponse (max)247.27sTemps de réponse (total)359.23sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
179.61sTemps de réponse (moy.)…
214,492Total des jetons d'entrée…
89,681Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Appel d'outil invalide: 1Mauvaise réponse: 1Temps de réponse (moy.)24.10sTemps de réponse (max)44.76sTemps de réponse (total)48.21sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)23.79sTemps de réponse (max)23.85sTemps de réponse (total)47.57sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
23.79sTemps de réponse (moy.)…
7,290Total des jetons d'entrée…
195Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
6.5Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)1.14sTemps de réponse (max)1.18sTemps de réponse (total)2.27sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3Temps de réponse (moy.)15.31sTemps de réponse (max)27.66sTemps de réponse (total)45.92sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
15.31sTemps de réponse (moy.)…
675Total des jetons d'entrée…
17Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
7.7Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)552msTemps de réponse (max)675msTemps de réponse (total)1.66sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.2Score moyen sur l’ensemble des tests de benchmark.…
9.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)23.74sTemps de réponse (max)23.74sTemps de réponse (total)23.74sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
23.74sTemps de réponse (moy.)…
471Total des jetons d'entrée…
67Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
4.2Score moyen sur l’ensemble des tests de benchmark.…
9.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)1.31sTemps de réponse (max)1.31sTemps de réponse (total)1.31sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.5Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mise en forme supplémentaire: 1Temps de réponse (moy.)17.54sTemps de réponse (max)18.51sTemps de réponse (total)35.08sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
17.54sTemps de réponse (moy.)…
627Total des jetons d'entrée…
321Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
6.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)582msTemps de réponse (max)633msTemps de réponse (total)1.16sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
6.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Mauvaise réponse: 1Temps de réponse (moy.)1.25sTemps de réponse (max)1.84sTemps de réponse (total)3.76sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)77.93sTemps de réponse (max)77.93sTemps de réponse (total)77.93sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
77.93sTemps de réponse (moy.)…
8,079Total des jetons d'entrée…
327Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.75sTemps de réponse (max)2.75sTemps de réponse (total)2.75sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)3.07sTemps de réponse (max)3.07sTemps de réponse (total)3.07sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.07sTemps de réponse (moy.)…
183Total des jetons d'entrée…
20Jetons de sortie…
0Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)703msTemps de réponse (max)703msTemps de réponse (total)703msUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…