Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 8Instructies niet gevolgd: 1Responstijd (gem.)1.46sResponstijd (max)2.89sResponstijd (totaal)21.86sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Instructies niet gevolgd: 2Verkeerd antwoord: 2Geen antwoord: 1Time-out: 1Responstijd (gem.)27.61sResponstijd (max)121.79sResponstijd (totaal)220.87sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
Consistentie
8.9Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
7.8Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
Kosten per resultaat
1.496Toont de gemiddelde kosten per correct benchmark-antwoord in centen (lager is beter).โฆ
0.541Toont de gemiddelde kosten per correct benchmark-antwoord in centen (lager is beter).โฆ
Totale kosten
$0.090Totale kostenโฆ
$0.049Totale kostenโฆ
Slaagpercentage per poging
44.4%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
71.1%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
Instabiele tests
2Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
4Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
common.totalRuns
45 (15 x 3)common.totalRunsโฆ
45 (15 x 3)common.totalRunsโฆ
Uitvoer-tokens
1,635Uitvoer-tokensโฆ
1,056Uitvoer-tokensโฆ
Redeneer-tokens
0Redeneer-tokensโฆ
80,419Redeneer-tokensโฆ
Responstijd (gem.)
1.46sResponstijd (gem.)โฆ
27.61sResponstijd (gem.)โฆ
Responstijd (max)
2.89sResponstijd (max)โฆ
121.79sResponstijd (max)โฆ
Responstijd (totaal)
21.86sResponstijd (totaal)โฆ
220.87sResponstijd (totaal)โฆ
Topmodellen op score
Score vs totale kosten
Responstijd (gem.)
Gem. score vs Responstijd (gem.)
Categorie-uitsplitsing
Anti-AI-trucs
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
OpenAI: GPT-5.4
10.0Gemiddelde score over alle benchmarktests.โฆ
7.3Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
11.1%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
1Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 3Responstijd (gem.)1.41sResponstijd (max)2.58sResponstijd (totaal)4.23sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
1.41sResponstijd (gem.)โฆ
388Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
xAI: Grok 4.1 Fast
10.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)5.65sResponstijd (max)5.65sResponstijd (totaal)5.65sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
5.65sResponstijd (gem.)โฆ
102Uitvoer-tokensโฆ
4,021Redeneer-tokensโฆ
Gecombineerd
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
OpenAI: GPT-5.4
10.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
0.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 1Responstijd (gem.)2.89sResponstijd (max)2.89sResponstijd (totaal)2.89sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
2.89sResponstijd (gem.)โฆ
291Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
xAI: Grok 4.1 Fast
10.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)37.64sResponstijd (max)37.64sResponstijd (totaal)37.64sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
37.64sResponstijd (gem.)โฆ
261Uitvoer-tokensโฆ
12,272Redeneer-tokensโฆ
Gegevensparsering en extractie
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
OpenAI: GPT-5.4
9.9Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)1.04sResponstijd (max)1.06sResponstijd (totaal)2.08sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
1.04sResponstijd (gem.)โฆ
222Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
xAI: Grok 4.1 Fast
9.9Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)6.63sResponstijd (max)6.63sResponstijd (totaal)6.63sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
6.63sResponstijd (gem.)โฆ
180Uitvoer-tokensโฆ
5,409Redeneer-tokensโฆ
Domeinspecifiek
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
OpenAI: GPT-5.4
4.0Gemiddelde score over alle benchmarktests.โฆ
7.2Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
44.4%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
1Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 2Responstijd (gem.)1.07sResponstijd (max)1.54sResponstijd (totaal)3.22sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
1.07sResponstijd (gem.)โฆ
50Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
xAI: Grok 4.1 Fast
4.0Gemiddelde score over alle benchmarktests.โฆ
4.4Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
66.7%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
2Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Time-out: 1Verkeerd antwoord: 1Responstijd (gem.)121.79sResponstijd (max)121.79sResponstijd (totaal)121.79sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
121.79sResponstijd (gem.)โฆ
11Uitvoer-tokensโฆ
37,657Redeneer-tokensโฆ
Instructies opvolgen
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
OpenAI: GPT-5.4
5.5Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
50.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 1Responstijd (gem.)1.07sResponstijd (max)1.17sResponstijd (totaal)2.15sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
1.07sResponstijd (gem.)โฆ
81Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
xAI: Grok 4.1 Fast
5.5Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
50.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Instructies niet gevolgd: 1Responstijd (gem.)5.30sResponstijd (max)5.30sResponstijd (totaal)5.30sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
5.30sResponstijd (gem.)โฆ
55Uitvoer-tokensโฆ
3,489Redeneer-tokensโฆ
Puzzle Solving
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
OpenAI: GPT-5.4
4.0Gemiddelde score over alle benchmarktests.โฆ
9.8Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
33.3%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Instructies niet gevolgd: 1Verkeerd antwoord: 1Responstijd (gem.)1.52sResponstijd (max)1.82sResponstijd (totaal)4.56sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
1.52sResponstijd (gem.)โฆ
357Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
xAI: Grok 4.1 Fast
4.0Gemiddelde score over alle benchmarktests.โฆ
7.2Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
44.4%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
1Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Instructies niet gevolgd: 1Verkeerd antwoord: 1Responstijd (gem.)8.08sResponstijd (max)8.38sResponstijd (totaal)16.17sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
8.08sResponstijd (gem.)โฆ
187Uitvoer-tokensโฆ
6,086Redeneer-tokensโฆ
Toolaanroepen
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
OpenAI: GPT-5.4
10.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)2.75sResponstijd (max)2.75sResponstijd (totaal)2.75sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
2.75sResponstijd (gem.)โฆ
246Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
xAI: Grok 4.1 Fast
10.0Gemiddelde score over alle benchmarktests.โฆ
1.6Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
33.3%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
1Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen antwoord: 1Responstijd (gem.)27.71sResponstijd (max)27.71sResponstijd (totaal)27.71sEen test is alleen volledig geslaagd als alle runs slagen.โฆ