Gemini 3.5 Flash Lite (medium) vs Qwen3.8 27B (medium)
Gemini 3.5 Flash Lite (medium) mène au score moyen avec 7.8 vs 7.8. Qwen3.8 27B (medium) a le coût de benchmark le plus bas avec ~$0.058 vs $0.272. Gemini 3.5 Flash Lite (medium) est plus rapide avec 5.12s vs 33.05s, avec des taux de réussite de 78.8% vs 66.7%.
Benchmarks générés à partir des suites de tests AI BENCHY le:
2026-09-28
Modèles comparés
Rang
#97
Total des jetons de sortie
96,235
Temps de réponse (moy.)
5.12s
Coût total
$0.272
Les réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
Rang
#101
Total des jetons de sortie
136,162
Temps de réponse (moy.)
33.05s
Coût total
~$0.058Estimation de l’électricité consommée par le GPU uniquement. Le reste de l’ordinateur et l’achat du matériel ne sont pas inclus. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Modèle recommandéQwen3.8 27B (medium)
Son score reste proche du meilleur score ici (7.8 vs 7.8) tout en coûtant environ 4.8x moins que Gemini 3.5 Flash Lite (medium).
Qwen3.8 27BQwen3.8 27BmediumLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14
Qwen3.8 27BQwen3.8 27BmediumLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.Sortie: 2026-08-14
Score
7.8Score moyen sur l’ensemble des tests de benchmark.…
7.8Score moyen sur l’ensemble des tests de benchmark.…
Rang
#97
#101
Fiabilité
10.0Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
9.6Score de réussite au premier essai : 10.0 signifie aucun échec réessayable de l'API cible ou de limite de débit avant les appels réussis ; les échecs suivis réduisent le score.…
Cohérence
7.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
9.7Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
Tentatives
66/66
66/66
Tests corrects
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 6N'a pas suivi les instructions: 1Appel d'outil invalide: 1Temps de réponse (moy.)5.12sTemps de réponse (max)26.41sTemps de réponse (total)112.73sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
78.8%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
Tests instables
6Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Exécutions totales
66Exécutions totales…
66Exécutions totales…
Coût par résultat
1.942
~0.409Estimation de l’électricité consommée par le GPU uniquement. Le reste de l’ordinateur et l’achat du matériel ne sont pas inclus. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Coût total
$0.272
~$0.058Estimation de l’électricité consommée par le GPU uniquement. Le reste de l’ordinateur et l’achat du matériel ne sont pas inclus. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Prix d'entrée
$0.300 / 1MPrix d'entrée…
N/DPrix d'entrée…
Prix de sortie
$2.500 / 1MPrix de sortie…
N/DPrix de sortie…
Total des jetons d'entrée
103,916Total des jetons d'entrée…
98,266Total des jetons d'entrée…
Jetons de sortie
8,892Jetons de sortie…
1,861Jetons de sortie…
Jetons de raisonnement
87,343Jetons de raisonnement…
134,301Jetons de raisonnement…
Temps de réponse (moy.)
5.12sTemps de réponse (moy.)…
33.05sTemps de réponse (moy.)…
Temps de réponse (max)
26.41sTemps de réponse (max)…
214.63sTemps de réponse (max)…
Temps de réponse (total)
112.73sTemps de réponse (total)…
694.04sTemps de réponse (total)…
Paramètres
~150B au total (~10B actifs)
27.3B
Disponibilité
Source fermée
Poids disponibles
Génération showcase de modèles
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#97 Gemini 3.5 Flash Lite
medium
Coût
$0.010
Temps
17.8s
Tokens
4,000 tok
#101 Qwen3.8 27B
mediumLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
Coût
~$0.002Estimation de l’électricité consommée par le GPU uniquement. Le reste de l’ordinateur et l’achat du matériel ne sont pas inclus. NVIDIA GeForce RTX 3090: 0.0121 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.001193.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.11sTemps de réponse (max)2.84sTemps de réponse (total)8.43sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.11sTemps de réponse (moy.)…
504Total des jetons d'entrée…
150Jetons de sortie…
5,265Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.93sTemps de réponse (max)5.18sTemps de réponse (total)11.70sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.9Score moyen sur l’ensemble des tests de benchmark.…
9.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)9.96sTemps de réponse (max)15.08sTemps de réponse (total)29.87sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
9.96sTemps de réponse (moy.)…
8,122Total des jetons d'entrée…
471Jetons de sortie…
28,930Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)40.50sTemps de réponse (max)72.14sTemps de réponse (total)121.51sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
7.3Score moyen sur l’ensemble des tests de benchmark.…
5.8Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
83.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Appel d'outil invalide: 1Temps de réponse (moy.)17.87sTemps de réponse (max)26.41sTemps de réponse (total)35.73sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
17.87sTemps de réponse (moy.)…
79,299Total des jetons d'entrée…
7,303Jetons de sortie…
29,209Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
8.7Score moyen sur l’ensemble des tests de benchmark.…
6.9Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
83.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Appel d'outil invalide: 1Temps de réponse (moy.)124.48sTemps de réponse (max)214.63sTemps de réponse (total)248.96sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.11sTemps de réponse (max)2.63sTemps de réponse (total)4.21sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.11sTemps de réponse (moy.)…
7,362Total des jetons d'entrée…
287Jetons de sortie…
2,226Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
6.5Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
50.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)8.76sTemps de réponse (max)10.36sTemps de réponse (total)17.53sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.1Score moyen sur l’ensemble des tests de benchmark.…
4.4Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
44.5%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
2Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 3Temps de réponse (moy.)5.34sTemps de réponse (max)7.83sTemps de réponse (total)16.02sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
5.34sTemps de réponse (moy.)…
656Total des jetons d'entrée…
17Jetons de sortie…
10,964Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 2Temps de réponse (moy.)76.98sTemps de réponse (max)144.07sTemps de réponse (total)230.93sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
4.7Score moyen sur l’ensemble des tests de benchmark.…
3.1Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)2.97sTemps de réponse (max)2.97sTemps de réponse (total)2.97sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.97sTemps de réponse (moy.)…
488Total des jetons d'entrée…
100Jetons de sortie…
1,558Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
5.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)9.20sTemps de réponse (max)9.20sTemps de réponse (total)9.20sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
9.8Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)1.72sTemps de réponse (max)1.78sTemps de réponse (total)3.43sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
1.72sTemps de réponse (moy.)…
625Total des jetons d'entrée…
69Jetons de sortie…
2,657Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.54sTemps de réponse (max)2.67sTemps de réponse (total)5.07sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
8.2Score moyen sur l’ensemble des tests de benchmark.…
7.2Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
88.9%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)1.82sTemps de réponse (max)2.25sTemps de réponse (total)5.47sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
1.82sTemps de réponse (moy.)…
570Total des jetons d'entrée…
199Jetons de sortie…
2,988Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
8.3Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
66.7%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.N'a pas suivi les instructions: 1Temps de réponse (moy.)12.62sTemps de réponse (max)29.62sTemps de réponse (total)37.85sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
10.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
100.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse échouée.Temps de réponse (moy.)2.84sTemps de réponse (max)2.84sTemps de réponse (total)2.84sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.84sTemps de réponse (moy.)…
6,132Total des jetons d'entrée…
287Jetons de sortie…
1,277Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Erreur API: 1Temps de réponse (moy.)0msTemps de réponse (max)0msTemps de réponse (total)0msUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
2.8Score moyen sur l’ensemble des tests de benchmark.…
1.6Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
33.3%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
1Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Mauvaise réponse: 1Temps de réponse (moy.)3.75sTemps de réponse (max)3.75sTemps de réponse (total)3.75sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…
3.75sTemps de réponse (moy.)…
158Total des jetons d'entrée…
9Jetons de sortie…
2,269Jetons de raisonnement…
Qwen3.8 27BLes réponses du modèle candidat ont été générées sur du matériel local. OpenRouter a servi uniquement à l’évaluation.
3.0Score moyen sur l’ensemble des tests de benchmark.…
10.0Le score de cohérence reflète la stabilité entre exécutions (10 = très cohérent, même si constamment faux).…
0.0%Taux de réussite par tentative = tentatives réussies / tentatives totales sur toutes les exécutions.…
0Les tests instables ont eu des résultats mixtes entre exécutions (au moins une réussite et un échec).…
Un test est entièrement réussi uniquement si toutes ses exécutions réussissent.Aucune réponse: 1Temps de réponse (moy.)11.29sTemps de réponse (max)11.29sTemps de réponse (total)11.29sUn test est entièrement réussi uniquement si toutes ses exécutions réussissent.…