Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 8Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)1.46sTimp de răspuns (maxim)2.89sTimp de răspuns (total)21.86sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 2Răspuns greșit: 2Fără răspuns: 1Timp expirat: 1Timp de răspuns (mediu)27.61sTimp de răspuns (maxim)121.79sTimp de răspuns (total)220.87sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Consistență
8.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
7.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Cost per rezultat
1.496Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
0.541Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.090Cost total…
$0.049Cost total…
Rată de trecere pe încercare
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
71.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
4Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
common.totalRuns
45 (15 x 3)common.totalRuns…
45 (15 x 3)common.totalRuns…
Tokenuri de ieșire
1,635Tokenuri de ieșire…
1,056Tokenuri de ieșire…
Tokenuri de raționament
0Tokenuri de raționament…
80,419Tokenuri de raționament…
Timp de răspuns (mediu)
1.46sTimp de răspuns (mediu)…
27.61sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
2.89sTimp de răspuns (maxim)…
121.79sTimp de răspuns (maxim)…
Timp de răspuns (total)
21.86sTimp de răspuns (total)…
220.87sTimp de răspuns (total)…
Top modele după scor
Scor vs cost total
Timp de răspuns (mediu)
Scor mediu vs Timp de răspuns (mediu)
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.4
10.0Scor mediu pe toate testele de benchmark.…
7.3Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
11.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)1.41sTimp de răspuns (maxim)2.58sTimp de răspuns (total)4.23sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.41sTimp de răspuns (mediu)…
388Tokenuri de ieșire…
0Tokenuri de raționament…
xAI: Grok 4.1 Fast
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.65sTimp de răspuns (maxim)5.65sTimp de răspuns (total)5.65sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.65sTimp de răspuns (mediu)…
102Tokenuri de ieșire…
4,021Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.4
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)2.89sTimp de răspuns (maxim)2.89sTimp de răspuns (total)2.89sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.89sTimp de răspuns (mediu)…
291Tokenuri de ieșire…
0Tokenuri de raționament…
xAI: Grok 4.1 Fast
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)37.64sTimp de răspuns (maxim)37.64sTimp de răspuns (total)37.64sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
37.64sTimp de răspuns (mediu)…
261Tokenuri de ieșire…
12,272Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.4
9.9Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)1.04sTimp de răspuns (maxim)1.06sTimp de răspuns (total)2.08sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.04sTimp de răspuns (mediu)…
222Tokenuri de ieșire…
0Tokenuri de raționament…
xAI: Grok 4.1 Fast
9.9Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)6.63sTimp de răspuns (maxim)6.63sTimp de răspuns (total)6.63sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
6.63sTimp de răspuns (mediu)…
180Tokenuri de ieșire…
5,409Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.4
4.0Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)1.07sTimp de răspuns (maxim)1.54sTimp de răspuns (total)3.22sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.07sTimp de răspuns (mediu)…
50Tokenuri de ieșire…
0Tokenuri de raționament…
xAI: Grok 4.1 Fast
4.0Scor mediu pe toate testele de benchmark.…
4.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 1Răspuns greșit: 1Timp de răspuns (mediu)121.79sTimp de răspuns (maxim)121.79sTimp de răspuns (total)121.79sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
121.79sTimp de răspuns (mediu)…
11Tokenuri de ieșire…
37,657Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.4
5.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)1.07sTimp de răspuns (maxim)1.17sTimp de răspuns (total)2.15sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.07sTimp de răspuns (mediu)…
81Tokenuri de ieșire…
0Tokenuri de raționament…
xAI: Grok 4.1 Fast
5.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)5.30sTimp de răspuns (maxim)5.30sTimp de răspuns (total)5.30sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.30sTimp de răspuns (mediu)…
55Tokenuri de ieșire…
3,489Tokenuri de raționament…
Puzzle Solving
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.4
4.0Scor mediu pe toate testele de benchmark.…
9.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)1.52sTimp de răspuns (maxim)1.82sTimp de răspuns (total)4.56sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.52sTimp de răspuns (mediu)…
357Tokenuri de ieșire…
0Tokenuri de raționament…
xAI: Grok 4.1 Fast
4.0Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)8.08sTimp de răspuns (maxim)8.38sTimp de răspuns (total)16.17sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
8.08sTimp de răspuns (mediu)…
187Tokenuri de ieșire…
6,086Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
OpenAI: GPT-5.4
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.75sTimp de răspuns (maxim)2.75sTimp de răspuns (total)2.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.75sTimp de răspuns (mediu)…
246Tokenuri de ieșire…
0Tokenuri de raționament…
xAI: Grok 4.1 Fast
10.0Scor mediu pe toate testele de benchmark.…
1.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)27.71sTimp de răspuns (maxim)27.71sTimp de răspuns (total)27.71sUn test este considerat trecut complet doar dacă toate rulările lui trec.…