89Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
72Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Cost per rezultat
0.147Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
0.133Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.006Cost total…
$0.010Cost total…
Timp de răspuns (medie)
594msTimp de răspuns (medie)…
17.75sTimp de răspuns (medie)…
Timp de răspuns (maxim)
1.27sTimp de răspuns (maxim)…
50.92sTimp de răspuns (maxim)…
Timp de răspuns (total)
8.91sTimp de răspuns (total)…
141.98sTimp de răspuns (total)…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 11Timp de răspuns (medie)594msTimp de răspuns (maxim)1.27sTimp de răspuns (total)8.91sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 5Nu a urmat instrucțiunile: 3Timp de răspuns (medie)17.75sTimp de răspuns (maxim)50.92sTimp de răspuns (total)141.98sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
57.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
5Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Tokenuri de ieșire
1,144Tokenuri de ieșire…
13,103Tokenuri de ieșire…
Tokenuri de raționament
0Tokenuri de raționament…
33,843Tokenuri de raționament…
Top modele după scor
Timp de răspuns (medie)
Scor vs cost total
Scor mediu vs Timp de răspuns (medie)
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (medie)466msTimp de răspuns (maxim)716msTimp de răspuns (total)1.40sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
466msTimp de răspuns (medie)…
274Tokenuri de ieșire…
0Tokenuri de raționament…
OpenAI: gpt-oss-120b
70Scor mediu pe toate testele de benchmark.…
98Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)19.76sTimp de răspuns (maxim)19.76sTimp de răspuns (total)19.76sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
19.76sTimp de răspuns (medie)…
3,463Tokenuri de ieșire…
2,077Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)606msTimp de răspuns (maxim)606msTimp de răspuns (total)606msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
606msTimp de răspuns (medie)…
131Tokenuri de ieșire…
0Tokenuri de raționament…
OpenAI: gpt-oss-120b
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)31.18sTimp de răspuns (maxim)31.18sTimp de răspuns (total)31.18sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
31.18sTimp de răspuns (medie)…
694Tokenuri de ieșire…
5,072Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
55Scor mediu pe toate testele de benchmark.…
59Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)667msTimp de răspuns (maxim)819msTimp de răspuns (total)1.33sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
667msTimp de răspuns (medie)…
180Tokenuri de ieșire…
0Tokenuri de raționament…
OpenAI: gpt-oss-120b
55Scor mediu pe toate testele de benchmark.…
59Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)1.98sTimp de răspuns (maxim)1.98sTimp de răspuns (total)1.98sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.98sTimp de răspuns (medie)…
241Tokenuri de ieșire…
1,114Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
40Scor mediu pe toate testele de benchmark.…
72Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (medie)534msTimp de răspuns (maxim)733msTimp de răspuns (total)1.60sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
534msTimp de răspuns (medie)…
46Tokenuri de ieșire…
0Tokenuri de raționament…
OpenAI: gpt-oss-120b
100Scor mediu pe toate testele de benchmark.…
44Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (medie)50.92sTimp de răspuns (maxim)50.92sTimp de răspuns (total)50.92sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
50.92sTimp de răspuns (medie)…
6,784Tokenuri de ieșire…
20,606Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
55Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)551msTimp de răspuns (maxim)622msTimp de răspuns (total)1.10sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
551msTimp de răspuns (medie)…
82Tokenuri de ieșire…
0Tokenuri de raționament…
OpenAI: gpt-oss-120b
95Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)7.63sTimp de răspuns (maxim)7.63sTimp de răspuns (total)7.63sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.63sTimp de răspuns (medie)…
126Tokenuri de ieșire…
1,799Tokenuri de raționament…
Puzzle Solving
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (medie)533msTimp de răspuns (maxim)637msTimp de răspuns (total)1.60sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
533msTimp de răspuns (medie)…
234Tokenuri de ieșire…
0Tokenuri de raționament…
OpenAI: gpt-oss-120b
17Scor mediu pe toate testele de benchmark.…
47Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 2Răspuns greșit: 1Timp de răspuns (medie)11.80sTimp de răspuns (maxim)12.60sTimp de răspuns (total)23.61sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
11.80sTimp de răspuns (medie)…
1,508Tokenuri de ieșire…
2,092Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)1.27sTimp de răspuns (maxim)1.27sTimp de răspuns (total)1.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.27sTimp de răspuns (medie)…
197Tokenuri de ieșire…
0Tokenuri de raționament…
OpenAI: gpt-oss-120b
90Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)6.91sTimp de răspuns (maxim)6.91sTimp de răspuns (total)6.91sUn test este considerat trecut complet doar dacă toate rulările lui trec.…