Qwen3.8 27B (low) mène au score moyen avec 7.6 vs 7.5. Qwen3.8 27B (low) a le coût de benchmark le plus bas avec ~$0.089 vs $0.140. Qwen3.8 27B (low) est plus rapide avec 46.60s vs 91.67s, avec des taux de réussite de 59.4% vs 68.1%.
Benchmarks générés à partir des suites de tests AI BENCHY le:
2026-10-01
Modèles comparés
Rang
#120
Total des jetons de sortie
271,559
Temps de réponse (moy.)
91.67s
Coût total
$0.140
Les réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
Rang
#117
Total des jetons de sortie
209,143
Temps de réponse (moy.)
46.60s
Coût total
~$0.089Estimation de l’électricité consommée par le GPU uniquement. Le reste de l’ordinateur et l’achat du matériel ne sont pas inclus. NVIDIA GeForce RTX 3090: 0.8932 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.088310.
Modèle recommandéQwen3.8 27B (low)
Il obtient le meilleur score ici (7.6) tout en coûtant environ 1.6x moins que Seed-2.0-Mini (medium).
Qwen3.8 27BQwen3.8 27BlowLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14Disponible gratuitement
Qwen3.8 27BQwen3.8 27BlowLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14Disponible gratuitement
Score
7.5Score moyen sur l’ensemble des tests de benchmark.…
7.6Score moyen sur l’ensemble des tests de benchmark.…
Rang
#120
#117
Fiabilité
9.4Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
10.0Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
Cohérence
9.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
9.7Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 5Aucune réponse: 2N'a pas suivi les instructions: 1Temps de réponse (moy.)46.60sTemps de réponse (max)376.04sTemps de réponse (total)1071.83sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
Taux de réussite par tentative
59.4%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
68.1%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
3Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Exécutions totales
69Exécutions totales…
69Exécutions totales…
Coût par résultat
1.167
~0.589Estimation de l’électricité consommée par le GPU uniquement. Le reste de l’ordinateur et l’achat du matériel ne sont pas inclus. NVIDIA GeForce RTX 3090: 0.8932 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.088310.
Coût total
$0.140
~$0.089Estimation de l’électricité consommée par le GPU uniquement. Le reste de l’ordinateur et l’achat du matériel ne sont pas inclus. NVIDIA GeForce RTX 3090: 0.8932 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.088310.
Prix d'entrée
$0.100 / 1MPrix d'entrée…
N/DPrix d'entrée…
Prix de sortie
$0.400 / 1MPrix de sortie…
N/DPrix de sortie…
Total des jetons d'entrée
313,368Total des jetons d'entrée…
315,290Total des jetons d'entrée…
Jetons de sortie
12,289Jetons de sortie…
1,607Jetons de sortie…
Jetons de raisonnement
259,270Jetons de raisonnement…
207,536Jetons de raisonnement…
Temps de réponse (moy.)
91.67sTemps de réponse (moy.)…
46.60sTemps de réponse (moy.)…
Temps de réponse (max)
301.78sTemps de réponse (max)…
376.04sTemps de réponse (max)…
Temps de réponse (total)
1833.43sTemps de réponse (total)…
1071.83sTemps de réponse (total)…
Paramètres
~50B au total (~5B actifs)
27.3B
Disponibilité
Source fermée
Poids disponibles
Génération showcase de modèles
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#120 Seed-2.0-Mini
medium
Coût
$0.002
Temps
161.7s
Tokens
4,379 tok
#117 Qwen3.8 27B
lowLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
Coût
~$0.003Estimation de l’électricité consommée par le GPU uniquement. Le reste de l’ordinateur et l’achat du matériel ne sont pas inclus. NVIDIA GeForce RTX 3090: 0.0258 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.002549.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)64.52sTemps de réponse (max)64.52sTemps de réponse (total)64.52sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
64.52sTemps de réponse (moy.)…
187,664Total des jetons d'entrée…
1,508Jetons de sortie…
11,729Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
6.1Score moyen sur l’ensemble des tests de benchmark.…
3.1Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)211.32sTemps de réponse (max)211.32sTemps de réponse (total)211.32sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
6.6Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Délai dépassé: 1Mauvaise réponse: 1Temps de réponse (moy.)74.75sTemps de réponse (max)182.10sTemps de réponse (total)298.98sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
74.75sTemps de réponse (moy.)…
791Total des jetons d'entrée…
360Jetons de sortie…
9,520Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)3.02sTemps de réponse (max)5.68sTemps de réponse (total)12.07sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.5Score moyen sur l’ensemble des tests de benchmark.…
9.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Délai dépassé: 1Mauvaise réponse: 1Temps de réponse (moy.)220.48sTemps de réponse (max)243.66sTemps de réponse (total)440.97sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
220.48sTemps de réponse (moy.)…
3,823Total des jetons d'entrée…
464Jetons de sortie…
34,964Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
7.7Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Temps de réponse (moy.)140.92sTemps de réponse (max)376.04sTemps de réponse (total)422.75sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.3Score moyen sur l’ensemble des tests de benchmark.…
5.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
83.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Temps de réponse (moy.)282.30sTemps de réponse (max)301.78sTemps de réponse (total)564.61sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
282.30sTemps de réponse (moy.)…
100,096Total des jetons d'entrée…
8,627Jetons de sortie…
143,688Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)90.63sTemps de réponse (max)143.71sTemps de réponse (total)181.27sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)24.27sTemps de réponse (max)27.52sTemps de réponse (total)48.54sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
24.27sTemps de réponse (moy.)…
8,568Total des jetons d'entrée…
246Jetons de sortie…
2,743Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)8.03sTemps de réponse (max)9.09sTemps de réponse (total)16.06sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Délai dépassé: 2Mauvaise réponse: 1Temps de réponse (moy.)103.41sTemps de réponse (max)103.41sTemps de réponse (total)103.41sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
103.41sTemps de réponse (moy.)…
237Total des jetons d'entrée…
3Jetons de sortie…
37,685Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)60.78sTemps de réponse (max)120.94sTemps de réponse (total)182.34sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.1Score moyen sur l’ensemble des tests de benchmark.…
3.4Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)36.65sTemps de réponse (max)36.65sTemps de réponse (total)36.65sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
36.65sTemps de réponse (moy.)…
585Total des jetons d'entrée…
213Jetons de sortie…
4,210Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)5.37sTemps de réponse (max)5.37sTemps de réponse (total)5.37sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)17.47sTemps de réponse (max)19.46sTemps de réponse (total)34.93sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
17.47sTemps de réponse (moy.)…
840Total des jetons d'entrée…
69Jetons de sortie…
2,050Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.43sTemps de réponse (max)2.87sTemps de réponse (total)4.86sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
8.2Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
88.9%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)31.79sTemps de réponse (max)50.78sTemps de réponse (total)95.38sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
31.79sTemps de réponse (moy.)…
903Total des jetons d'entrée…
527Jetons de sortie…
5,667Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
7.7Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)4.91sTemps de réponse (max)8.81sTemps de réponse (total)14.74sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)88.68sTemps de réponse (max)88.68sTemps de réponse (total)88.68sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
88.68sTemps de réponse (moy.)…
9,585Total des jetons d'entrée…
222Jetons de sortie…
5,235Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)8.42sTemps de réponse (max)8.42sTemps de réponse (total)8.42sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)56.76sTemps de réponse (max)56.76sTemps de réponse (total)56.76sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
56.76sTemps de réponse (moy.)…
276Total des jetons d'entrée…
50Jetons de sortie…
1,779Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Temps de réponse (moy.)12.64sTemps de réponse (max)12.64sTemps de réponse (total)12.64sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…