Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)21.06sTimp de răspuns (maxim)100.41sTimp de răspuns (total)315.95sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)29.45sTimp de răspuns (maxim)119.29sTimp de răspuns (total)441.71sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Consistență
8.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
9.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Cost per rezultat
6.533Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
3.962Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.784Cost total…
$0.476Cost total…
Rată de trecere pe încercare
86.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
82.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
common.totalRuns
45 (15 x 3)common.totalRuns…
45 (15 x 3)common.totalRuns…
Tokenuri de ieșire
1,611Tokenuri de ieșire…
17,226Tokenuri de ieșire…
Tokenuri de raționament
46,321Tokenuri de raționament…
138,033Tokenuri de raționament…
Timp de răspuns (mediu)
21.06sTimp de răspuns (mediu)…
29.45sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
100.41sTimp de răspuns (maxim)…
119.29sTimp de răspuns (maxim)…
Timp de răspuns (total)
315.95sTimp de răspuns (total)…
441.71sTimp de răspuns (total)…
Top modele după scor
Scor vs cost total
Timp de răspuns (mediu)
Scor mediu vs Timp de răspuns (mediu)
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.4
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.02sTimp de răspuns (maxim)6.42sTimp de răspuns (total)15.06sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.02sTimp de răspuns (mediu)…
216Tokenuri de ieșire…
1,466Tokenuri de raționament…
Qwen: Qwen3.5-122B-A10B
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)6.99sTimp de răspuns (maxim)11.62sTimp de răspuns (total)20.98sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
6.99sTimp de răspuns (mediu)…
248Tokenuri de ieșire…
10,486Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.4
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)20.57sTimp de răspuns (maxim)20.57sTimp de răspuns (total)20.57sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
20.57sTimp de răspuns (mediu)…
301Tokenuri de ieșire…
3,543Tokenuri de raționament…
Qwen: Qwen3.5-122B-A10B
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)107.79sTimp de răspuns (maxim)107.79sTimp de răspuns (total)107.79sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
107.79sTimp de răspuns (mediu)…
483Tokenuri de ieșire…
11,337Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.4
9.9Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.32sTimp de răspuns (maxim)5.40sTimp de răspuns (total)10.64sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.32sTimp de răspuns (mediu)…
234Tokenuri de ieșire…
804Tokenuri de raționament…
Qwen: Qwen3.5-122B-A10B
9.9Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)23.41sTimp de răspuns (maxim)29.79sTimp de răspuns (total)46.83sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
23.41sTimp de răspuns (mediu)…
270Tokenuri de ieșire…
16,558Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.4
4.0Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)74.27sTimp de răspuns (maxim)100.41sTimp de răspuns (total)222.80sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
74.27sTimp de răspuns (mediu)…
61Tokenuri de ieșire…
34,748Tokenuri de raționament…
Qwen: Qwen3.5-122B-A10B
10.0Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
11.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)63.40sTimp de răspuns (maxim)119.29sTimp de răspuns (total)190.20sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
63.40sTimp de răspuns (mediu)…
15,537Tokenuri de ieșire…
64,889Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.4
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.11sTimp de răspuns (maxim)3.68sTimp de răspuns (total)6.22sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.11sTimp de răspuns (mediu)…
93Tokenuri de ieșire…
897Tokenuri de raționament…
Qwen: Qwen3.5-122B-A10B
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)9.88sTimp de răspuns (maxim)15.44sTimp de răspuns (total)19.76sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.88sTimp de răspuns (mediu)…
77Tokenuri de ieșire…
7,372Tokenuri de raționament…
Puzzle Solving
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.4
7.0Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
88.9%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)9.13sTimp de răspuns (maxim)18.14sTimp de răspuns (total)27.39sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.13sTimp de răspuns (mediu)…
442Tokenuri de ieșire…
3,832Tokenuri de raționament…
Qwen: Qwen3.5-122B-A10B
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)17.18sTimp de răspuns (maxim)31.99sTimp de răspuns (total)51.55sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
17.18sTimp de răspuns (mediu)…
289Tokenuri de ieșire…
26,165Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.4
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)13.28sTimp de răspuns (maxim)13.28sTimp de răspuns (total)13.28sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
13.28sTimp de răspuns (mediu)…
264Tokenuri de ieșire…
1,031Tokenuri de raționament…
Qwen: Qwen3.5-122B-A10B
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.60sTimp de răspuns (maxim)4.60sTimp de răspuns (total)4.60sUn test este considerat trecut complet doar dacă toate rulările lui trec.…