Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 3Răspuns greșit: 3Timp expirat: 1Timp de răspuns (medie)25.92sTimp de răspuns (maxim)88.15sTimp de răspuns (total)388.79sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 8Nu a urmat instrucțiunile: 2invalid tool call: 1Timp de răspuns (medie)3.16sTimp de răspuns (maxim)7.05sTimp de răspuns (total)25.31sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Consistență
8.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
8.3Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Cost per rezultat
1.401Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
0.064Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.113Cost total…
$0.003Cost total…
Rată de trecere pe încercare
62.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
37.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
3Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
common.totalAttempts
45 (15 x 3)common.totalAttempts…
45 (15 x 3)common.totalAttempts…
Tokenuri de ieșire
5,477Tokenuri de ieșire…
1,721Tokenuri de ieșire…
Tokenuri de raționament
46,912Tokenuri de raționament…
0Tokenuri de raționament…
Timp de răspuns (medie)
25.92sTimp de răspuns (medie)…
3.16sTimp de răspuns (medie)…
Timp de răspuns (maxim)
88.15sTimp de răspuns (maxim)…
7.05sTimp de răspuns (maxim)…
Timp de răspuns (total)
388.79sTimp de răspuns (total)…
25.31sTimp de răspuns (total)…
Top modele după scor
Timp de răspuns (medie)
Scor vs cost total
Scor mediu vs Timp de răspuns (medie)
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5 Mini
7.0Scor mediu pe toate testele de benchmark.…
9.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)16.45sTimp de răspuns (maxim)26.00sTimp de răspuns (total)49.36sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
16.45sTimp de răspuns (medie)…
1,645Tokenuri de ieșire…
5,824Tokenuri de raționament…
Z.ai: GLM 4.7 Flash
10.0Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (medie)6.59sTimp de răspuns (maxim)6.59sTimp de răspuns (total)6.59sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
6.59sTimp de răspuns (medie)…
430Tokenuri de ieșire…
0Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5 Mini
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)88.15sTimp de răspuns (maxim)88.15sTimp de răspuns (total)88.15sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
88.15sTimp de răspuns (medie)…
754Tokenuri de ieșire…
11,520Tokenuri de raționament…
Z.ai: GLM 4.7 Flash
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.invalid tool call: 1Timp de răspuns (medie)3.22sTimp de răspuns (maxim)3.22sTimp de răspuns (total)3.22sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.22sTimp de răspuns (medie)…
704Tokenuri de ieșire…
0Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5 Mini
9.9Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)12.58sTimp de răspuns (maxim)13.87sTimp de răspuns (total)25.16sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
12.58sTimp de răspuns (medie)…
453Tokenuri de ieșire…
3,200Tokenuri de raționament…
Z.ai: GLM 4.7 Flash
5.4Scor mediu pe toate testele de benchmark.…
5.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)4.82sTimp de răspuns (maxim)4.82sTimp de răspuns (total)4.82sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.82sTimp de răspuns (medie)…
196Tokenuri de ieșire…
0Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5 Mini
10.0Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp expirat: 1Timp de răspuns (medie)44.63sTimp de răspuns (maxim)82.55sTimp de răspuns (total)133.89sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
44.63sTimp de răspuns (medie)…
293Tokenuri de ieșire…
14,016Tokenuri de raționament…
Z.ai: GLM 4.7 Flash
7.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)744msTimp de răspuns (maxim)744msTimp de răspuns (total)744msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
744msTimp de răspuns (medie)…
19Tokenuri de ieșire…
0Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5 Mini
7.5Scor mediu pe toate testele de benchmark.…
6.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)15.66sTimp de răspuns (maxim)21.80sTimp de răspuns (total)31.32sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
15.66sTimp de răspuns (medie)…
318Tokenuri de ieșire…
4,992Tokenuri de raționament…
Z.ai: GLM 4.7 Flash
5.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)888msTimp de răspuns (maxim)888msTimp de răspuns (total)888msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
888msTimp de răspuns (medie)…
62Tokenuri de ieșire…
0Tokenuri de raționament…
Puzzle Solving
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5 Mini
4.3Scor mediu pe toate testele de benchmark.…
9.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (medie)14.09sTimp de răspuns (maxim)16.81sTimp de răspuns (total)42.28sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
14.09sTimp de răspuns (medie)…
1,527Tokenuri de ieșire…
5,760Tokenuri de raționament…
Z.ai: GLM 4.7 Flash
3.7Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 2Răspuns greșit: 1Timp de răspuns (medie)1.00sTimp de răspuns (maxim)1.12sTimp de răspuns (total)2.00sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.00sTimp de răspuns (medie)…
98Tokenuri de ieșire…
0Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5 Mini
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)18.64sTimp de răspuns (maxim)18.64sTimp de răspuns (total)18.64sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
18.64sTimp de răspuns (medie)…
487Tokenuri de ieșire…
1,600Tokenuri de raționament…
Z.ai: GLM 4.7 Flash
10.0Scor mediu pe toate testele de benchmark.…
1.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)7.05sTimp de răspuns (maxim)7.05sTimp de răspuns (total)7.05sUn test este considerat trecut complet doar dacă toate rulările lui trec.…