9.45Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
8.26Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Cost per rezultat
2.261Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
2.835Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
0.151Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.227Cost total…
$0.256Cost total…
$0.016Cost total…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Nu a urmat instrucțiunile: 1Timp de răspuns (medie)7.16sTimp de răspuns (maxim)38.52sTimp de răspuns (total)100.19sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Nu a urmat instrucțiunile: 2Timp de răspuns (medie)5.81sTimp de răspuns (maxim)18.33sTimp de răspuns (total)81.36sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Nu a urmat instrucțiunile: 1Timp de răspuns (medie)2.88sTimp de răspuns (maxim)9.54sTimp de răspuns (total)40.39sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
73.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
73.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
71.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
3Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Tokenuri de ieșire
14,267Tokenuri de ieșire…
16,339Tokenuri de ieșire…
1,317Tokenuri de ieșire…
Tokenuri de raționament
0Tokenuri de raționament…
0Tokenuri de raționament…
6,126Tokenuri de raționament…
Top modele după scor
Scor vs cost total
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.2 Chat
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)3.97sTimp de răspuns (maxim)4.78sTimp de răspuns (total)11.90sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1,651Tokenuri de ieșire…
0Tokenuri de raționament…
OpenAI: GPT-5.3 Chat
7.33Scor mediu pe toate testele de benchmark.…
7.49Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
77.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)4.72sTimp de răspuns (maxim)7.35sTimp de răspuns (total)14.17sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3,091Tokenuri de ieșire…
0Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
7.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)2.18sTimp de răspuns (maxim)3.18sTimp de răspuns (total)6.53sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
456Tokenuri de ieșire…
1,224Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.2 Chat
9.88Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)3.05sTimp de răspuns (maxim)3.33sTimp de răspuns (total)6.10sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
980Tokenuri de ieșire…
0Tokenuri de raționament…
OpenAI: GPT-5.3 Chat
9.88Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)2.21sTimp de răspuns (maxim)2.52sTimp de răspuns (total)4.42sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
942Tokenuri de ieșire…
0Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
9.88Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)3.00sTimp de răspuns (maxim)3.74sTimp de răspuns (total)5.99sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
291Tokenuri de ieșire…
696Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.2 Chat
4.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (medie)17.78sTimp de răspuns (maxim)38.52sTimp de răspuns (total)53.33sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7,810Tokenuri de ieșire…
0Tokenuri de raționament…
OpenAI: GPT-5.3 Chat
1.00Scor mediu pe toate testele de benchmark.…
4.41Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (medie)13.01sTimp de răspuns (maxim)18.33sTimp de răspuns (total)39.04sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
8,264Tokenuri de ieșire…
0Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
4.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (medie)2.36sTimp de răspuns (maxim)3.51sTimp de răspuns (total)7.07sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
18Tokenuri de ieșire…
1,212Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.2 Chat
5.50Scor mediu pe toate testele de benchmark.…
6.13Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)5.46sTimp de răspuns (maxim)6.45sTimp de răspuns (total)10.92sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1,528Tokenuri de ieșire…
0Tokenuri de raționament…
OpenAI: GPT-5.3 Chat
8.50Scor mediu pe toate testele de benchmark.…
9.99Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)3.29sTimp de răspuns (maxim)4.18sTimp de răspuns (total)6.59sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1,455Tokenuri de ieșire…
0Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
8.50Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)1.49sTimp de răspuns (maxim)1.66sTimp de răspuns (total)2.99sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
72Tokenuri de ieșire…
753Tokenuri de raționament…
Puzzle Solving
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.2 Chat
7.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)4.42sTimp de răspuns (maxim)5.04sTimp de răspuns (total)13.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1,743Tokenuri de ieșire…
0Tokenuri de raționament…
OpenAI: GPT-5.3 Chat
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)2.93sTimp de răspuns (maxim)3.05sTimp de răspuns (total)8.78sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1,726Tokenuri de ieșire…
0Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)2.76sTimp de răspuns (maxim)5.08sTimp de răspuns (total)8.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
243Tokenuri de ieșire…
1,248Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.2 Chat
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)4.68sTimp de răspuns (maxim)4.68sTimp de răspuns (total)4.68sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
555Tokenuri de ieșire…
0Tokenuri de raționament…
OpenAI: GPT-5.3 Chat
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)8.36sTimp de răspuns (maxim)8.36sTimp de răspuns (total)8.36sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
861Tokenuri de ieșire…
0Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)9.54sTimp de răspuns (maxim)9.54sTimp de răspuns (total)9.54sUn test este considerat trecut complet doar dacă toate rulările lui trec.…