De gemiddelde score is vrijwel gelijk met 7.9 vs 7.9. De kosten van de lokale hardware zijn niet gemeten. Daarom zijn kostenvergelijkingen niet beschikbaar. GPT-5.2 Chat is sneller met 7.73s vs 39.11s, met slagingspercentages van 69.7% vs 68.2%.
Benchmarks gegenereerd uit AI BENCHY-testsuites op:
2026-08-15
Rang
#59
Totaal aantal uitvoer-tokens
29,742
Responstijd (gem.)
7.73s
Totale kosten
$0.594
Rang
#61
Totaal aantal uitvoer-tokens
169,329
Responstijd (gem.)
39.11s
Totale kosten
n.v.t.
Aanbevolen modelGPT-5.2 Chat
Het heeft hier de beste score (7.9) en reageert ongeveer 5.1x sneller dan Qwen3.8 27B (low).
Qwen3.8 27BQwen3.8 27BlowDe antwoorden van het kandidaatmodel zijn op lokale hardware gemaakt. OpenRouter is alleen voor de beoordeling gebruikt.Releasedatum: 2026-08-14
Qwen3.8 27BQwen3.8 27BlowDe antwoorden van het kandidaatmodel zijn op lokale hardware gemaakt. OpenRouter is alleen voor de beoordeling gebruikt.Releasedatum: 2026-08-14
Score
7.9Gemiddelde score over alle benchmarktests.…
7.9Gemiddelde score over alle benchmarktests.…
Rang
#59
#61
Betrouwbaarheid
10.0Succescore bij de eerste poging: 10.0 betekent geen herhaalbare doel-API- of snelheidslimietfouten vóór succesvolle calls; geregistreerde fouten verlagen de score.…
10.0Succescore bij de eerste poging: 10.0 betekent geen herhaalbare doel-API- of snelheidslimietfouten vóór succesvolle calls; geregistreerde fouten verlagen de score.…
Consistentie
8.6Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 4Geen antwoord: 2Instructies niet gevolgd: 1Responstijd (gem.)39.11sResponstijd (max)376.04sResponstijd (totaal)860.51sEen test is alleen volledig geslaagd als alle runs slagen.…
Slaagpercentage per poging
69.7%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
68.2%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
Instabiele tests
4Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Totaal runs
66Totaal runs…
66Totaal runs…
Kosten per resultaat
4.564Toont de gemiddelde kosten per correct benchmark-antwoord in centen (lager is beter).…
n.v.t.Toont de gemiddelde kosten per correct benchmark-antwoord in centen (lager is beter).…
Totale kosten
$0.594Totale kosten (huidige prijs)…
n.v.t.Totale kosten (huidige prijs)…
Invoerprijs
$1.750 / 1MInvoerprijs…
n.v.t.Invoerprijs…
Uitvoerprijs
$14.000 / 1MUitvoerprijs…
n.v.t.Uitvoerprijs…
Totaal aantal invoer-tokens
101,104Totaal aantal invoer-tokens…
99,705Totaal aantal invoer-tokens…
Uitvoer-tokens
29,742Uitvoer-tokens…
1,545Uitvoer-tokens…
Redeneer-tokens
0Redeneer-tokens…
167,784Redeneer-tokens…
Responstijd (gem.)
7.73sResponstijd (gem.)…
39.11sResponstijd (gem.)…
Responstijd (max)
38.52sResponstijd (max)…
376.04sResponstijd (max)…
Responstijd (totaal)
162.40sResponstijd (totaal)…
860.51sResponstijd (totaal)…
Parameters
~400B totaal (~17B actief)
27.3B
Beschikbaarheid
Gesloten broncode
Gewichten beschikbaar
Model generatie-showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#59 GPT-5.2 Chat
none
Kosten
$0.010
Tijd
15.3s
Tokens
797 tok
#61 Qwen3.8 27B
lowDe antwoorden van het kandidaatmodel zijn op lokale hardware gemaakt. OpenRouter is alleen voor de beoordeling gebruikt.
7.9Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
91.7%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
1Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 1Responstijd (gem.)3.40sResponstijd (max)4.78sResponstijd (totaal)13.59sEen test is alleen volledig geslaagd als alle runs slagen.…
3.40sResponstijd (gem.)…
606Totaal aantal invoer-tokens…
1,807Uitvoer-tokens…
0Redeneer-tokens…
Qwen3.8 27BDe antwoorden van het kandidaatmodel zijn op lokale hardware gemaakt. OpenRouter is alleen voor de beoordeling gebruikt.
10.0Gemiddelde score over alle benchmarktests.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)3.02sResponstijd (max)5.68sResponstijd (totaal)12.07sEen test is alleen volledig geslaagd als alle runs slagen.…
7.8Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
88.9%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
1Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 1Responstijd (gem.)9.82sResponstijd (max)13.35sResponstijd (totaal)29.45sEen test is alleen volledig geslaagd als alle runs slagen.…
9.82sResponstijd (gem.)…
7,305Totaal aantal invoer-tokens…
6,731Uitvoer-tokens…
0Redeneer-tokens…
Qwen3.8 27BDe antwoorden van het kandidaatmodel zijn op lokale hardware gemaakt. OpenRouter is alleen voor de beoordeling gebruikt.
7.7Gemiddelde score over alle benchmarktests.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
66.7%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen antwoord: 1Responstijd (gem.)140.92sResponstijd (max)376.04sResponstijd (totaal)422.75sEen test is alleen volledig geslaagd als alle runs slagen.…
5.8Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
83.3%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
1Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen antwoord: 1Responstijd (gem.)13.91sResponstijd (max)18.70sResponstijd (totaal)27.82sEen test is alleen volledig geslaagd als alle runs slagen.…
13.91sResponstijd (gem.)…
78,055Totaal aantal invoer-tokens…
7,923Uitvoer-tokens…
0Redeneer-tokens…
Qwen3.8 27BDe antwoorden van het kandidaatmodel zijn op lokale hardware gemaakt. OpenRouter is alleen voor de beoordeling gebruikt.
10.0Gemiddelde score over alle benchmarktests.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)90.63sResponstijd (max)143.71sResponstijd (totaal)181.27sEen test is alleen volledig geslaagd als alle runs slagen.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)3.05sResponstijd (max)3.33sResponstijd (totaal)6.10sEen test is alleen volledig geslaagd als alle runs slagen.…
3.05sResponstijd (gem.)…
7,140Totaal aantal invoer-tokens…
980Uitvoer-tokens…
0Redeneer-tokens…
Qwen3.8 27BDe antwoorden van het kandidaatmodel zijn op lokale hardware gemaakt. OpenRouter is alleen voor de beoordeling gebruikt.
10.0Gemiddelde score over alle benchmarktests.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)8.03sResponstijd (max)9.09sResponstijd (totaal)16.06sEen test is alleen volledig geslaagd als alle runs slagen.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
0.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 2API-fout: 1Responstijd (gem.)23.67sResponstijd (max)38.52sResponstijd (totaal)47.34sEen test is alleen volledig geslaagd als alle runs slagen.…
23.67sResponstijd (gem.)…
579Totaal aantal invoer-tokens…
7,128Uitvoer-tokens…
0Redeneer-tokens…
Qwen3.8 27BDe antwoorden van het kandidaatmodel zijn op lokale hardware gemaakt. OpenRouter is alleen voor de beoordeling gebruikt.
5.3Gemiddelde score over alle benchmarktests.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
33.3%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 2Responstijd (gem.)60.78sResponstijd (max)120.94sResponstijd (totaal)182.34sEen test is alleen volledig geslaagd als alle runs slagen.…
3.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
33.3%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
1Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Instructies niet gevolgd: 1Responstijd (gem.)3.20sResponstijd (max)3.20sResponstijd (totaal)3.20sEen test is alleen volledig geslaagd als alle runs slagen.…
3.20sResponstijd (gem.)…
477Totaal aantal invoer-tokens…
335Uitvoer-tokens…
0Redeneer-tokens…
Qwen3.8 27BDe antwoorden van het kandidaatmodel zijn op lokale hardware gemaakt. OpenRouter is alleen voor de beoordeling gebruikt.
5.0Gemiddelde score over alle benchmarktests.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
0.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Instructies niet gevolgd: 1Responstijd (gem.)5.37sResponstijd (max)5.37sResponstijd (totaal)5.37sEen test is alleen volledig geslaagd als alle runs slagen.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)5.51sResponstijd (max)6.55sResponstijd (totaal)11.02sEen test is alleen volledig geslaagd als alle runs slagen.…
5.51sResponstijd (gem.)…
660Totaal aantal invoer-tokens…
1,441Uitvoer-tokens…
0Redeneer-tokens…
Qwen3.8 27BDe antwoorden van het kandidaatmodel zijn op lokale hardware gemaakt. OpenRouter is alleen voor de beoordeling gebruikt.
10.0Gemiddelde score over alle benchmarktests.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)2.43sResponstijd (max)2.87sResponstijd (totaal)4.86sEen test is alleen volledig geslaagd als alle runs slagen.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
66.7%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 1Responstijd (gem.)4.10sResponstijd (max)5.04sResponstijd (totaal)12.31sEen test is alleen volledig geslaagd als alle runs slagen.…
4.10sResponstijd (gem.)…
642Totaal aantal invoer-tokens…
1,603Uitvoer-tokens…
0Redeneer-tokens…
Qwen3.8 27BDe antwoorden van het kandidaatmodel zijn op lokale hardware gemaakt. OpenRouter is alleen voor de beoordeling gebruikt.
7.7Gemiddelde score over alle benchmarktests.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
66.7%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 1Responstijd (gem.)4.91sResponstijd (max)8.81sResponstijd (totaal)14.74sEen test is alleen volledig geslaagd als alle runs slagen.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)4.68sResponstijd (max)4.68sResponstijd (totaal)4.68sEen test is alleen volledig geslaagd als alle runs slagen.…
4.68sResponstijd (gem.)…
5,445Totaal aantal invoer-tokens…
555Uitvoer-tokens…
0Redeneer-tokens…
Qwen3.8 27BDe antwoorden van het kandidaatmodel zijn op lokale hardware gemaakt. OpenRouter is alleen voor de beoordeling gebruikt.
3.0Gemiddelde score over alle benchmarktests.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
0.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 1Responstijd (gem.)8.42sResponstijd (max)8.42sResponstijd (totaal)8.42sEen test is alleen volledig geslaagd als alle runs slagen.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
0.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 1Responstijd (gem.)6.89sResponstijd (max)6.89sResponstijd (totaal)6.89sEen test is alleen volledig geslaagd als alle runs slagen.…
6.89sResponstijd (gem.)…
195Totaal aantal invoer-tokens…
1,239Uitvoer-tokens…
0Redeneer-tokens…
Qwen3.8 27BDe antwoorden van het kandidaatmodel zijn op lokale hardware gemaakt. OpenRouter is alleen voor de beoordeling gebruikt.
3.0Gemiddelde score over alle benchmarktests.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
0.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen antwoord: 1Responstijd (gem.)12.64sResponstijd (max)12.64sResponstijd (totaal)12.64sEen test is alleen volledig geslaagd als alle runs slagen.…