89Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Cost per rezultat
1.401Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
0.226Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.113Cost total…
$0.007Cost total…
Timp de răspuns (medie)
25.92sTimp de răspuns (medie)…
12.82sTimp de răspuns (medie)…
Timp de răspuns (maxim)
88.15sTimp de răspuns (maxim)…
45.14sTimp de răspuns (maxim)…
Timp de răspuns (total)
388.79sTimp de răspuns (total)…
115.42sTimp de răspuns (total)…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 3Răspuns greșit: 3Timp expirat: 1Timp de răspuns (medie)25.92sTimp de răspuns (maxim)88.15sTimp de răspuns (total)388.79sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 10Formatare suplimentară: 1Nu a urmat instrucțiunile: 1Timp de răspuns (medie)12.82sTimp de răspuns (maxim)45.14sTimp de răspuns (total)115.42sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
62.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
20.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Tokenuri de ieșire
5,477Tokenuri de ieșire…
2,874Tokenuri de ieșire…
Tokenuri de raționament
46,912Tokenuri de raționament…
0Tokenuri de raționament…
Top modele după scor
Timp de răspuns (medie)
Scor vs cost total
Scor mediu vs Timp de răspuns (medie)
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5 Mini
70Scor mediu pe toate testele de benchmark.…
96Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)16.45sTimp de răspuns (maxim)26.00sTimp de răspuns (total)49.36sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
16.45sTimp de răspuns (medie)…
1,645Tokenuri de ieșire…
5,824Tokenuri de raționament…
Qwen: Qwen3 Coder Next
23Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Formatare suplimentară: 1Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (medie)4.39sTimp de răspuns (maxim)4.39sTimp de răspuns (total)4.39sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.39sTimp de răspuns (medie)…
1,315Tokenuri de ieșire…
0Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5 Mini
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)88.15sTimp de răspuns (maxim)88.15sTimp de răspuns (total)88.15sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
88.15sTimp de răspuns (medie)…
754Tokenuri de ieșire…
11,520Tokenuri de raționament…
Qwen: Qwen3 Coder Next
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)45.14sTimp de răspuns (maxim)45.14sTimp de răspuns (total)45.14sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
45.14sTimp de răspuns (medie)…
317Tokenuri de ieșire…
0Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5 Mini
99Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)12.58sTimp de răspuns (maxim)13.87sTimp de răspuns (total)25.16sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
12.58sTimp de răspuns (medie)…
453Tokenuri de ieșire…
3,200Tokenuri de raționament…
Qwen: Qwen3 Coder Next
54Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)1.32sTimp de răspuns (maxim)1.32sTimp de răspuns (total)1.32sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.32sTimp de răspuns (medie)…
246Tokenuri de ieșire…
0Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5 Mini
100Scor mediu pe toate testele de benchmark.…
72Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp expirat: 1Timp de răspuns (medie)44.63sTimp de răspuns (maxim)82.55sTimp de răspuns (total)133.89sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
44.63sTimp de răspuns (medie)…
293Tokenuri de ieșire…
14,016Tokenuri de raționament…
Qwen: Qwen3 Coder Next
40Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (medie)962msTimp de răspuns (maxim)962msTimp de răspuns (total)962msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
962msTimp de răspuns (medie)…
26Tokenuri de ieșire…
0Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5 Mini
75Scor mediu pe toate testele de benchmark.…
66Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)15.66sTimp de răspuns (maxim)21.80sTimp de răspuns (total)31.32sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
15.66sTimp de răspuns (medie)…
318Tokenuri de ieșire…
4,992Tokenuri de raționament…
Qwen: Qwen3 Coder Next
45Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (medie)7.71sTimp de răspuns (maxim)14.65sTimp de răspuns (total)15.42sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.71sTimp de răspuns (medie)…
63Tokenuri de ieșire…
0Tokenuri de raționament…
Puzzle Solving
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5 Mini
43Scor mediu pe toate testele de benchmark.…
98Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (medie)14.09sTimp de răspuns (maxim)16.81sTimp de răspuns (total)42.28sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
14.09sTimp de răspuns (medie)…
1,527Tokenuri de ieșire…
5,760Tokenuri de raționament…
Qwen: Qwen3 Coder Next
13Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (medie)22.86sTimp de răspuns (maxim)42.58sTimp de răspuns (total)45.73sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
22.86sTimp de răspuns (medie)…
652Tokenuri de ieșire…
0Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5 Mini
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)18.64sTimp de răspuns (maxim)18.64sTimp de răspuns (total)18.64sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
18.64sTimp de răspuns (medie)…
487Tokenuri de ieșire…
1,600Tokenuri de raționament…
Qwen: Qwen3 Coder Next
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)2.47sTimp de răspuns (maxim)2.47sTimp de răspuns (total)2.47sUn test este considerat trecut complet doar dacă toate rulările lui trec.…