8.5Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
9.1Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
Kosten per resultaat
3.163Toont de gemiddelde kosten per correct benchmark-antwoord in centen (lager is beter).โฆ
3.585Toont de gemiddelde kosten per correct benchmark-antwoord in centen (lager is beter).โฆ
Totale kosten
$0.317Totale kostenโฆ
$0.431Totale kostenโฆ
Correcte tests
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 4Instructies niet gevolgd: 2Responstijd (gem.)5.96sResponstijd (max)18.33sResponstijd (totaal)95.30sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Instructies niet gevolgd: 2Time-out: 1Verkeerd antwoord: 1Responstijd (gem.)52.13sResponstijd (max)163.96sResponstijd (totaal)834.16sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
Slaagpercentage per poging
70.8%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
81.3%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
Instabiele tests
3Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
2Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Totaal runs
48 (16 x 3)Totaal runsโฆ
48 (16 x 3)Totaal runsโฆ
Uitvoer-tokens
19,272Uitvoer-tokensโฆ
1,658Uitvoer-tokensโฆ
Redeneer-tokens
0Redeneer-tokensโฆ
200,786Redeneer-tokensโฆ
Responstijd (gem.)
5.96sResponstijd (gem.)โฆ
52.13sResponstijd (gem.)โฆ
Responstijd (max)
18.33sResponstijd (max)โฆ
163.96sResponstijd (max)โฆ
Responstijd (totaal)
95.30sResponstijd (totaal)โฆ
834.16sResponstijd (totaal)โฆ
Topmodellen op score
Score vs totale kosten
Responstijd (gem.)
Gem. score vs Responstijd (gem.)
Categorie-uitsplitsing
Anti-AI-trucs
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
OpenAI: GPT-5.3 Chat
7.3Gemiddelde score over alle benchmarktests.โฆ
7.5Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
77.8%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
1Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Instructies niet gevolgd: 1Responstijd (gem.)4.72sResponstijd (max)7.35sResponstijd (totaal)14.17sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
4.72sResponstijd (gem.)โฆ
3,091Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
Qwen: Qwen3.5-27B
10.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)9.69sResponstijd (max)10.84sResponstijd (totaal)29.06sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
9.69sResponstijd (gem.)โฆ
102Uitvoer-tokensโฆ
8,956Redeneer-tokensโฆ
Gecombineerd
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
OpenAI: GPT-5.3 Chat
10.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)11.96sResponstijd (max)11.96sResponstijd (totaal)11.96sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
11.96sResponstijd (gem.)โฆ
2,614Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
Qwen: Qwen3.5-27B
10.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)163.96sResponstijd (max)163.96sResponstijd (totaal)163.96sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
163.96sResponstijd (gem.)โฆ
483Uitvoer-tokensโฆ
9,991Redeneer-tokensโฆ
Gegevensparsering en extractie
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
OpenAI: GPT-5.3 Chat
9.9Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)2.21sResponstijd (max)2.52sResponstijd (totaal)4.42sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
2.21sResponstijd (gem.)โฆ
942Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
Qwen: Qwen3.5-27B
9.9Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)30.26sResponstijd (max)32.03sResponstijd (totaal)60.52sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
30.26sResponstijd (gem.)โฆ
270Uitvoer-tokensโฆ
16,150Redeneer-tokensโฆ
Domeinspecifiek
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
OpenAI: GPT-5.3 Chat
10.0Gemiddelde score over alle benchmarktests.โฆ
4.4Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
33.3%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
2Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 3Responstijd (gem.)13.01sResponstijd (max)18.33sResponstijd (totaal)39.04sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
13.01sResponstijd (gem.)โฆ
8,264Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
Qwen: Qwen3.5-27B
4.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
33.3%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Time-out: 1Verkeerd antwoord: 1Responstijd (gem.)79.53sResponstijd (max)95.52sResponstijd (totaal)238.59sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
79.53sResponstijd (gem.)โฆ
43Uitvoer-tokensโฆ
52,368Redeneer-tokensโฆ
Algemene intelligentie
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
OpenAI: GPT-5.3 Chat
4.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
0.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Instructies niet gevolgd: 1Responstijd (gem.)1.99sResponstijd (max)1.99sResponstijd (totaal)1.99sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
1.99sResponstijd (gem.)โฆ
319Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
Qwen: Qwen3.5-27B
5.0Gemiddelde score over alle benchmarktests.โฆ
3.1Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
66.7%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
1Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Instructies niet gevolgd: 1Responstijd (gem.)101.41sResponstijd (max)101.41sResponstijd (totaal)101.41sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
101.41sResponstijd (gem.)โฆ
70Uitvoer-tokensโฆ
23,147Redeneer-tokensโฆ
Instructies opvolgen
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
OpenAI: GPT-5.3 Chat
9.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
50.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 1Responstijd (gem.)3.29sResponstijd (max)4.18sResponstijd (totaal)6.59sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
3.29sResponstijd (gem.)โฆ
1,455Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
Qwen: Qwen3.5-27B
10.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)19.66sResponstijd (max)32.25sResponstijd (totaal)39.32sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
19.66sResponstijd (gem.)โฆ
97Uitvoer-tokensโฆ
11,638Redeneer-tokensโฆ
Puzzle Solving
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
OpenAI: GPT-5.3 Chat
10.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)2.93sResponstijd (max)3.05sResponstijd (totaal)8.78sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
2.93sResponstijd (gem.)โฆ
1,726Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
Qwen: Qwen3.5-27B
8.3Gemiddelde score over alle benchmarktests.โฆ
7.7Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
77.8%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
1Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Instructies niet gevolgd: 1Responstijd (gem.)64.61sResponstijd (max)123.57sResponstijd (totaal)193.84sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
64.61sResponstijd (gem.)โฆ
245Uitvoer-tokensโฆ
77,213Redeneer-tokensโฆ
Toolaanroepen
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
OpenAI: GPT-5.3 Chat
10.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)8.36sResponstijd (max)8.36sResponstijd (totaal)8.36sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
8.36sResponstijd (gem.)โฆ
861Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
Qwen: Qwen3.5-27B
10.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)7.45sResponstijd (max)7.45sResponstijd (totaal)7.45sEen test is alleen volledig geslaagd als alle runs slagen.โฆ