9.6Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
6.4Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
Kosten per resultaat
0.000Toont de gemiddelde kosten per correct benchmark-antwoord in centen (lager is beter).โฆ
1.040Toont de gemiddelde kosten per correct benchmark-antwoord in centen (lager is beter).โฆ
Totale kosten
$0.000Totale kostenโฆ
$0.042Totale kostenโฆ
Correcte tests
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 9Instructies niet gevolgd: 2Responstijd (gem.)3.15sResponstijd (max)8.91sResponstijd (totaal)50.46sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 7Instructies niet gevolgd: 2Geen antwoord: 2invalid tool call: 1Responstijd (gem.)36.84sResponstijd (max)174.55sResponstijd (totaal)331.58sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
Slaagpercentage per poging
33.3%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
41.7%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
Instabiele tests
1Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
7Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Totaal runs
48Totaal runsโฆ
48Totaal runsโฆ
Uitvoer-tokens
1,837Uitvoer-tokensโฆ
38,682Uitvoer-tokensโฆ
Redeneer-tokens
0Redeneer-tokensโฆ
64,952Redeneer-tokensโฆ
Responstijd (gem.)
3.15sResponstijd (gem.)โฆ
36.84sResponstijd (gem.)โฆ
Responstijd (max)
8.91sResponstijd (max)โฆ
174.55sResponstijd (max)โฆ
Responstijd (totaal)
50.46sResponstijd (totaal)โฆ
331.58sResponstijd (totaal)โฆ
Topmodellen op score
Score vs totale kosten
Responstijd (gem.)
Gem. score vs Responstijd (gem.)
Categorie-uitsplitsing
Anti-AI-trucs
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
Trinity Large Preview
10.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
0.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 3Responstijd (gem.)3.59sResponstijd (max)8.17sResponstijd (totaal)10.78sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
3.59sResponstijd (gem.)โฆ
587Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
Z.ai: GLM 4.7 Flash
4.0Gemiddelde score over alle benchmarktests.โฆ
4.5Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
55.6%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
2Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Instructies niet gevolgd: 1Verkeerd antwoord: 1Responstijd (gem.)27.09sResponstijd (max)27.09sResponstijd (totaal)27.09sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
27.09sResponstijd (gem.)โฆ
1,085Uitvoer-tokensโฆ
5,597Redeneer-tokensโฆ
Gecombineerd
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
Trinity Large Preview
10.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
0.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 1Responstijd (gem.)8.91sResponstijd (max)8.91sResponstijd (totaal)8.91sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
8.91sResponstijd (gem.)โฆ
294Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
Z.ai: GLM 4.7 Flash
10.0Gemiddelde score over alle benchmarktests.โฆ
2.1Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
33.3%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
1Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.invalid tool call: 1Responstijd (gem.)65.57sResponstijd (max)65.57sResponstijd (totaal)65.57sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
65.57sResponstijd (gem.)โฆ
2,585Uitvoer-tokensโฆ
20,648Redeneer-tokensโฆ
Gegevensparsering en extractie
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
Trinity Large Preview
9.9Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)3.26sResponstijd (max)4.66sResponstijd (totaal)6.52sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
3.26sResponstijd (gem.)โฆ
186Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
Z.ai: GLM 4.7 Flash
5.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
50.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen antwoord: 1Responstijd (gem.)1.51sResponstijd (max)1.51sResponstijd (totaal)1.51sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
1.51sResponstijd (gem.)โฆ
584Uitvoer-tokensโฆ
2,755Redeneer-tokensโฆ
Domeinspecifiek
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
Trinity Large Preview
4.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
33.3%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 2Responstijd (gem.)877msResponstijd (max)894msResponstijd (totaal)2.63sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
877msResponstijd (gem.)โฆ
25Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
Z.ai: GLM 4.7 Flash
10.0Gemiddelde score over alle benchmarktests.โฆ
4.4Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
33.3%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
2Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 2Geen antwoord: 1Responstijd (gem.)174.55sResponstijd (max)174.55sResponstijd (totaal)174.55sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
174.55sResponstijd (gem.)โฆ
33,000Uitvoer-tokensโฆ
25,394Redeneer-tokensโฆ
Algemene intelligentie
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
Trinity Large Preview
3.0Gemiddelde score over alle benchmarktests.โฆ
9.9Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
0.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Instructies niet gevolgd: 1Responstijd (gem.)2.86sResponstijd (max)2.86sResponstijd (totaal)2.86sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
2.86sResponstijd (gem.)โฆ
124Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
Z.ai: GLM 4.7 Flash
10.0Gemiddelde score over alle benchmarktests.โฆ
9.7Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
0.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 1Responstijd (gem.)18.14sResponstijd (max)18.14sResponstijd (totaal)18.14sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
18.14sResponstijd (gem.)โฆ
18Uitvoer-tokensโฆ
2,138Redeneer-tokensโฆ
Instructies opvolgen
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
Trinity Large Preview
3.5Gemiddelde score over alle benchmarktests.โฆ
6.7Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
16.7%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
1Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Instructies niet gevolgd: 1Verkeerd antwoord: 1Responstijd (gem.)1.09sResponstijd (max)1.23sResponstijd (totaal)2.19sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
1.09sResponstijd (gem.)โฆ
63Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
Z.ai: GLM 4.7 Flash
5.0Gemiddelde score over alle benchmarktests.โฆ
5.8Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
66.7%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
1Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 1Responstijd (gem.)2.97sResponstijd (max)2.97sResponstijd (totaal)2.97sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
2.97sResponstijd (gem.)โฆ
388Uitvoer-tokensโฆ
2,181Redeneer-tokensโฆ
Puzzle Solving
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
Trinity Large Preview
4.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
33.3%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 2Responstijd (gem.)3.30sResponstijd (max)4.81sResponstijd (totaal)9.91sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
3.30sResponstijd (gem.)โฆ
291Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
Z.ai: GLM 4.7 Flash
10.0Gemiddelde score over alle benchmarktests.โฆ
7.2Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
11.1%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
1Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Verkeerd antwoord: 2Instructies niet gevolgd: 1Responstijd (gem.)12.90sResponstijd (max)22.33sResponstijd (totaal)25.80sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
12.90sResponstijd (gem.)โฆ
798Uitvoer-tokensโฆ
5,225Redeneer-tokensโฆ
Toolaanroepen
Score
Consistentie
Slaagpercentage per poging
Instabiele tests
Correcte tests
Responstijd (gem.)
Uitvoer-tokens
Redeneer-tokens
Trinity Large Preview
10.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)6.67sResponstijd (max)6.67sResponstijd (totaal)6.67sEen test is alleen volledig geslaagd als alle runs slagen.โฆ
6.67sResponstijd (gem.)โฆ
267Uitvoer-tokensโฆ
0Redeneer-tokensโฆ
Z.ai: GLM 4.7 Flash
10.0Gemiddelde score over alle benchmarktests.โฆ
10.0Consistentie geeft stabiliteit tussen runs weer (10 = zeer consistent, zelfs als consequent fout).โฆ
100.0%Slaagpercentage per poging = geslaagde pogingen / totale pogingen over alle runs.โฆ
0Instabiele tests hadden gemengde uitkomsten over runs (minstens รฉรฉn geslaagd en รฉรฉn gefaald).โฆ
Een test is alleen volledig geslaagd als alle runs slagen.Geen mislukte antwoorden.Responstijd (gem.)15.95sResponstijd (max)15.95sResponstijd (totaal)15.95sEen test is alleen volledig geslaagd als alle runs slagen.โฆ