Le score moyen est pratiquement à égalité avec 5.6 vs 5.5. Le coût du matériel local n’a pas été mesuré. Les comparaisons de coût ne sont donc pas disponibles. Qwen3.8 27B est plus rapide avec 3.12s vs 58.26s, avec des taux de réussite de 50.0% vs 40.9%.
Benchmarks générés à partir des suites de tests AI BENCHY le:
2026-08-15
Rang
#208
Total des jetons de sortie
654,597
Temps de réponse (moy.)
58.26s
Coût total
$0.168
Rang
#211
Total des jetons de sortie
11,445
Temps de réponse (moy.)
3.12s
Coût total
N/D
Modèle recommandéQwen3.8 27B
Il obtient le meilleur score ici (5.5) et répond environ 18.7x plus vite que Nemotron 3.5 Lightning (high).
Qwen3.8 27BQwen3.8 27BnoneLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14
Qwen3.8 27BQwen3.8 27BnoneLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14
Score
5.6Score moyen sur l’ensemble des tests de benchmark.…
5.5Score moyen sur l’ensemble des tests de benchmark.…
Rang
#208
#211
Fiabilité
9.9Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
10.0Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
Cohérence
5.6Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 11N'a pas suivi les instructions: 1Appel d'outil invalide: 1Temps de réponse (moy.)3.12sTemps de réponse (max)44.76sTemps de réponse (total)68.69sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Taux de réussite par tentative
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
40.9%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
12Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Exécutions totales
66Exécutions totales…
66Exécutions totales…
Coût par résultat
0.000Affiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
N/DAffiche le coût moyen par réponse correcte du benchmark, en centimes (plus bas est meilleur).…
Coût total
$0.168Coût total (prix actuel)…
N/DCoût total (prix actuel)…
Prix d'entrée
$0.100 / 1MPrix d'entrée…
N/DPrix d'entrée…
Prix de sortie
$0.250 / 1MPrix de sortie…
N/DPrix de sortie…
Total des jetons d'entrée
118,016Total des jetons d'entrée…
122,463Total des jetons d'entrée…
Jetons de sortie
148,344Jetons de sortie…
11,445Jetons de sortie…
Jetons de raisonnement
506,253Jetons de raisonnement…
0Jetons de raisonnement…
Temps de réponse (moy.)
58.26sTemps de réponse (moy.)…
3.12sTemps de réponse (moy.)…
Temps de réponse (max)
285.26sTemps de réponse (max)…
44.76sTemps de réponse (max)…
Temps de réponse (total)
1281.79sTemps de réponse (total)…
68.69sTemps de réponse (total)…
Paramètres
30B au total (3B actifs)
27.3B
Disponibilité
Poids disponibles
Poids disponibles
Génération showcase de modèles
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#208 Nemotron 3.5 Lightning
high
Coût
$0.000
Temps
92.8s
Tokens
11,343 tok
#211 Qwen3.8 27B
noneLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.5Score moyen sur l’ensemble des tests de benchmark.…
3.7Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
3Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3Temps de réponse (moy.)10.29sTemps de réponse (max)17.68sTemps de réponse (total)41.16sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.29sTemps de réponse (moy.)…
696Total des jetons d'entrée…
2,432Jetons de sortie…
15,948Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
6.5Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)828msTemps de réponse (max)1.95sTemps de réponse (total)3.31sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.4Score moyen sur l’ensemble des tests de benchmark.…
5.1Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Mise en forme supplémentaire: 1Temps de réponse (moy.)168.41sTemps de réponse (max)280.94sTemps de réponse (total)505.22sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
168.41sTemps de réponse (moy.)…
7,623Total des jetons d'entrée…
68,533Jetons de sortie…
242,319Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.5Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)1.19sTemps de réponse (max)1.97sTemps de réponse (total)3.56sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.4Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Appel d'outil invalide: 1Temps de réponse (moy.)160.45sTemps de réponse (max)285.26sTemps de réponse (total)320.90sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
160.45sTemps de réponse (moy.)…
90,257Total des jetons d'entrée…
17,550Jetons de sortie…
119,725Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Appel d'outil invalide: 1Mauvaise réponse: 1Temps de réponse (moy.)24.10sTemps de réponse (max)44.76sTemps de réponse (total)48.21sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.3Score moyen sur l’ensemble des tests de benchmark.…
5.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
83.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)13.99sTemps de réponse (max)18.67sTemps de réponse (total)27.97sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
13.99sTemps de réponse (moy.)…
7,944Total des jetons d'entrée…
3,210Jetons de sortie…
16,835Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
6.5Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)1.14sTemps de réponse (max)1.18sTemps de réponse (total)2.27sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.9Score moyen sur l’ensemble des tests de benchmark.…
4.4Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
22.2%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3Temps de réponse (moy.)88.61sTemps de réponse (max)226.92sTemps de réponse (total)265.83sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
88.61sTemps de réponse (moy.)…
798Total des jetons d'entrée…
45,616Jetons de sortie…
72,496Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
7.7Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)552msTemps de réponse (max)675msTemps de réponse (total)1.66sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.7Score moyen sur l’ensemble des tests de benchmark.…
9.5Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)7.58sTemps de réponse (max)7.58sTemps de réponse (total)7.58sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.58sTemps de réponse (moy.)…
516Total des jetons d'entrée…
4,331Jetons de sortie…
4,408Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
4.2Score moyen sur l’ensemble des tests de benchmark.…
9.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)1.31sTemps de réponse (max)1.31sTemps de réponse (total)1.31sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
8.5Score moyen sur l’ensemble des tests de benchmark.…
6.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
83.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)4.98sTemps de réponse (max)5.05sTemps de réponse (total)9.97sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.98sTemps de réponse (moy.)…
723Total des jetons d'entrée…
502Jetons de sortie…
3,779Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
6.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)582msTemps de réponse (max)633msTemps de réponse (total)1.16sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.6Score moyen sur l’ensemble des tests de benchmark.…
1.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
44.4%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
3Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 2Mauvaise réponse: 1Temps de réponse (moy.)6.09sTemps de réponse (max)10.09sTemps de réponse (total)18.26sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.09sTemps de réponse (moy.)…
726Total des jetons d'entrée…
1,236Jetons de sortie…
9,851Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
6.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Mauvaise réponse: 1Temps de réponse (moy.)1.25sTemps de réponse (max)1.84sTemps de réponse (total)3.76sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)6.92sTemps de réponse (max)6.92sTemps de réponse (total)6.92sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.92sTemps de réponse (moy.)…
8,526Total des jetons d'entrée…
3,745Jetons de sortie…
3,781Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.75sTemps de réponse (max)2.75sTemps de réponse (total)2.75sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)77.98sTemps de réponse (max)77.98sTemps de réponse (total)77.98sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
77.98sTemps de réponse (moy.)…
207Total des jetons d'entrée…
1,189Jetons de sortie…
17,111Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)703msTemps de réponse (max)703msTemps de réponse (total)703msUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…