Gemini 3.5 Flash (high) leidt in gemiddelde score met 9.5 vs 4.7. Hunter Alpha (medium) heeft lagere benchmarkkosten met $0.000 vs $1.976. Hunter Alpha (medium) is sneller met 10.33s vs 15.07s, met slagingspercentages van 93.9% vs 53.0%.
Benchmarks gegenereerd uit AI BENCHY-testsuites op:
2026-07-25
⋮⋮
Rang
#4
Totaal aantal uitvoer-tokens
201,677
Responstijd (gem.)
15.07s
Totale kosten
$1.976
⋮⋮
Rang
#199
Totaal aantal uitvoer-tokens
22,651
Responstijd (gem.)
10.33s
Totale kosten
$0.000
Aanbevolen modelGemini 3.5 Flash (high)
Het heeft de sterkste score in deze vergelijking (9.5) en de beste balans tussen kosten en responstijd over alle 2 modellen.
Hunter AlphaHunter AlphamediumGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests.Releasedatum: 2026-03-11
Score
9.5Gemiddelde score over alle benchmarktests.…
4.7Gemiddelde score over alle benchmarktests.…
Rang
#4
#199
Betrouwbaarheid
10.0Succescore bij de eerste poging: 10.0 betekent geen herhaalbare doel-API- of snelheidslimietfouten vóór succesvolle calls; geregistreerde fouten verlagen de score.…
n.v.t.Succescore bij de eerste poging: 10.0 betekent geen herhaalbare doel-API- of snelheidslimietfouten vóór succesvolle calls; geregistreerde fouten verlagen de score.…
Consistentie
9.3Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
6.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
Correcte tests
Een test is alleen volledig geslaagd als alle runs slagen.Ongeldige toolaanroep: 1Verkeerd antwoord: 1Responstijd (gem.)15.07sResponstijd (max)145.92sResponstijd (totaal)331.48sEen test is alleen volledig geslaagd als alle runs slagen.…
93.9%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
53.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
Instabiele tests
2Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
6Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Totaal runs
66Totaal runs…
52Totaal runs…
Kosten per resultaat
9.879Toont de gemiddelde kosten per correct benchmark-antwoord in centen (lager is beter).…
0.000Toont de gemiddelde kosten per correct benchmark-antwoord in centen (lager is beter).…
Totale kosten
$1.976Totale kosten (huidige prijs)…
$0.000Totale kosten (huidige prijs)…
Invoerprijs
$1.500 / 1MInvoerprijs…
$0.000 / 1MInvoerprijs…
Uitvoerprijs
$9.000 / 1MUitvoerprijs…
$0.000 / 1MUitvoerprijs…
Totaal aantal invoer-tokens
107,137Totaal aantal invoer-tokens…
28,927Totaal aantal invoer-tokens…
Uitvoer-tokens
8,777Uitvoer-tokens…
4,682Uitvoer-tokens…
Redeneer-tokens
192,900Redeneer-tokens…
17,969Redeneer-tokens…
Responstijd (gem.)
15.07sResponstijd (gem.)…
10.33sResponstijd (gem.)…
Responstijd (max)
145.92sResponstijd (max)…
30.53sResponstijd (max)…
Responstijd (totaal)
331.48sResponstijd (totaal)…
175.58sResponstijd (totaal)…
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#4 Gemini 3.5 Flash
high
Kosten
$0.208
Tijd
118.2s
Tokens
23,158 tok
#199 Hunter Alpha
medium
Hunter Alpha was a stealth model revealed on March 18th as an early testing version of MiMo-V2-Pro. Find it here: https://openrouter.ai/xiaomi/mimo-v2-pro
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)2.57sResponstijd (max)3.60sResponstijd (totaal)10.27sEen test is alleen volledig geslaagd als alle runs slagen.…
2.57sResponstijd (gem.)…
492Totaal aantal invoer-tokens…
174Uitvoer-tokens…
4,997Redeneer-tokens…
Hunter AlphaGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests.
7.3Gemiddelde score over alle benchmarktests.…
5.8Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
83.3%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
2Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 2Responstijd (gem.)4.75sResponstijd (max)7.62sResponstijd (totaal)19.00sEen test is alleen volledig geslaagd als alle runs slagen.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)22.96sResponstijd (max)34.82sResponstijd (totaal)68.88sEen test is alleen volledig geslaagd als alle runs slagen.…
22.96sResponstijd (gem.)…
8,118Totaal aantal invoer-tokens…
456Uitvoer-tokens…
47,129Redeneer-tokens…
Hunter AlphaGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests.
9.8Gemiddelde score over alle benchmarktests.…
3.3Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
0.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.API-fout: 1Responstijd (gem.)0msResponstijd (max)0msResponstijd (totaal)0msEen test is alleen volledig geslaagd als alle runs slagen.…
6.9Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
66.7%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
1Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Ongeldige toolaanroep: 1Responstijd (gem.)84.14sResponstijd (max)145.92sResponstijd (totaal)168.28sEen test is alleen volledig geslaagd als alle runs slagen.…
84.14sResponstijd (gem.)…
82,416Totaal aantal invoer-tokens…
7,153Uitvoer-tokens…
93,585Redeneer-tokens…
Hunter AlphaGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests.
2.3Gemiddelde score over alle benchmarktests.…
8.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
33.3%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
1Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Time-out: 1Responstijd (gem.)30.53sResponstijd (max)30.53sResponstijd (totaal)30.53sEen test is alleen volledig geslaagd als alle runs slagen.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)6.43sResponstijd (max)8.51sResponstijd (totaal)12.87sEen test is alleen volledig geslaagd als alle runs slagen.…
6.43sResponstijd (gem.)…
7,548Totaal aantal invoer-tokens…
279Uitvoer-tokens…
8,466Redeneer-tokens…
Hunter AlphaGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests.
10.0Gemiddelde score over alle benchmarktests.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)23.16sResponstijd (max)26.55sResponstijd (totaal)46.33sEen test is alleen volledig geslaagd als alle runs slagen.…
7.2Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
77.8%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
1Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 1Responstijd (gem.)14.09sResponstijd (max)22.00sResponstijd (totaal)42.27sEen test is alleen volledig geslaagd als alle runs slagen.…
14.09sResponstijd (gem.)…
633Totaal aantal invoer-tokens…
12Uitvoer-tokens…
24,721Redeneer-tokens…
Hunter AlphaGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests.
3.0Gemiddelde score over alle benchmarktests.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
0.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Extra opmaak: 1Time-out: 1Verkeerd antwoord: 1Responstijd (gem.)10.52sResponstijd (max)18.68sResponstijd (totaal)31.56sEen test is alleen volledig geslaagd als alle runs slagen.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)3.63sResponstijd (max)3.63sResponstijd (totaal)3.63sEen test is alleen volledig geslaagd als alle runs slagen.…
3.63sResponstijd (gem.)…
486Totaal aantal invoer-tokens…
115Uitvoer-tokens…
1,650Redeneer-tokens…
Hunter AlphaGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests.
7.0Gemiddelde score over alle benchmarktests.…
3.7Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
66.7%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
1Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Instructies niet gevolgd: 1Responstijd (gem.)6.44sResponstijd (max)6.44sResponstijd (totaal)6.44sEen test is alleen volledig geslaagd als alle runs slagen.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)3.35sResponstijd (max)3.42sResponstijd (totaal)6.69sEen test is alleen volledig geslaagd als alle runs slagen.…
3.35sResponstijd (gem.)…
615Totaal aantal invoer-tokens…
70Uitvoer-tokens…
3,799Redeneer-tokens…
Hunter AlphaGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests.
9.9Gemiddelde score over alle benchmarktests.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)4.18sResponstijd (max)4.46sResponstijd (totaal)8.36sEen test is alleen volledig geslaagd als alle runs slagen.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)3.23sResponstijd (max)3.68sResponstijd (totaal)9.69sEen test is alleen volledig geslaagd als alle runs slagen.…
3.23sResponstijd (gem.)…
558Totaal aantal invoer-tokens…
241Uitvoer-tokens…
4,940Redeneer-tokens…
Hunter AlphaGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests.
6.1Gemiddelde score over alle benchmarktests.…
4.7Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
66.7%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
2Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Instructies niet gevolgd: 1Verkeerd antwoord: 1Responstijd (gem.)5.35sResponstijd (max)6.20sResponstijd (totaal)16.06sEen test is alleen volledig geslaagd als alle runs slagen.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)4.96sResponstijd (max)4.96sResponstijd (totaal)4.96sEen test is alleen volledig geslaagd als alle runs slagen.…
4.96sResponstijd (gem.)…
6,115Totaal aantal invoer-tokens…
265Uitvoer-tokens…
1,608Redeneer-tokens…
Hunter AlphaGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests.
10.0Gemiddelde score over alle benchmarktests.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)17.33sResponstijd (max)17.33sResponstijd (totaal)17.33sEen test is alleen volledig geslaagd als alle runs slagen.…
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)3.94sResponstijd (max)3.94sResponstijd (totaal)3.94sEen test is alleen volledig geslaagd als alle runs slagen.…
3.94sResponstijd (gem.)…
156Totaal aantal invoer-tokens…
12Uitvoer-tokens…
2,005Redeneer-tokens…
Hunter AlphaGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests.
0.0Gemiddelde score over alle benchmarktests.…
0.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).…
0.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.…
0Instabiele tests hadden gemengde uitkomsten over runs (minstens één geslaagd en één gefaald).…
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)0msResponstijd (max)0msResponstijd (totaal)0msEen test is alleen volledig geslaagd als alle runs slagen.…