Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 5Nu a urmat instrucțiunile: 3Timp de răspuns (medie)2.47sTimp de răspuns (maxim)14.63sTimp de răspuns (total)34.56sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 11Nu a urmat instrucțiunile: 1Timp de răspuns (medie)2.01sTimp de răspuns (maxim)5.51sTimp de răspuns (total)16.06sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Consistență
8.3Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
8.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Cost per rezultat
0.622Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
0.239Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.044Cost total…
$0.008Cost total…
Rată de trecere pe încercare
57.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
26.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
3Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
common.totalAttempts
45 (15 x 3)common.totalAttempts…
45 (15 x 3)common.totalAttempts…
Tokenuri de ieșire
3,571Tokenuri de ieșire…
1,036Tokenuri de ieșire…
Tokenuri de raționament
45,379Tokenuri de raționament…
0Tokenuri de raționament…
Timp de răspuns (medie)
2.47sTimp de răspuns (medie)…
2.01sTimp de răspuns (medie)…
Timp de răspuns (maxim)
14.63sTimp de răspuns (maxim)…
5.51sTimp de răspuns (maxim)…
Timp de răspuns (total)
34.56sTimp de răspuns (total)…
16.06sTimp de răspuns (total)…
Top modele după scor
Timp de răspuns (medie)
Scor vs cost total
Scor mediu vs Timp de răspuns (medie)
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
7.3Scor mediu pe toate testele de benchmark.…
9.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)1.30sTimp de răspuns (maxim)2.46sTimp de răspuns (total)3.89sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.30sTimp de răspuns (medie)…
2,531Tokenuri de ieșire…
2,410Tokenuri de raționament…
xAI: Grok 4.1 Fast
1.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Nu a urmat instrucțiunile: 1Timp de răspuns (medie)1.73sTimp de răspuns (maxim)1.73sTimp de răspuns (total)1.73sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.73sTimp de răspuns (medie)…
229Tokenuri de ieșire…
0Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)3.28sTimp de răspuns (maxim)3.28sTimp de răspuns (total)3.28sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.28sTimp de răspuns (medie)…
268Tokenuri de ieșire…
4,887Tokenuri de raționament…
xAI: Grok 4.1 Fast
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)3.33sTimp de răspuns (maxim)3.33sTimp de răspuns (total)3.33sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.33sTimp de răspuns (medie)…
105Tokenuri de ieșire…
0Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
5.5Scor mediu pe toate testele de benchmark.…
5.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)1.11sTimp de răspuns (maxim)1.47sTimp de răspuns (total)2.21sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.11sTimp de răspuns (medie)…
183Tokenuri de ieșire…
1,656Tokenuri de raționament…
xAI: Grok 4.1 Fast
9.9Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)943msTimp de răspuns (maxim)943msTimp de răspuns (total)943msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
943msTimp de răspuns (medie)…
180Tokenuri de ieșire…
0Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
10.0Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
11.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (medie)6.48sTimp de răspuns (maxim)14.63sTimp de răspuns (total)19.43sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
6.48sTimp de răspuns (medie)…
41Tokenuri de ieșire…
30,754Tokenuri de raționament…
xAI: Grok 4.1 Fast
4.0Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
55.6%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (medie)1.06sTimp de răspuns (maxim)1.06sTimp de răspuns (total)1.06sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.06sTimp de răspuns (medie)…
15Tokenuri de ieșire…
0Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)1.07sTimp de răspuns (maxim)1.07sTimp de răspuns (total)1.07sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.07sTimp de răspuns (medie)…
14Tokenuri de ieșire…
958Tokenuri de raționament…
xAI: Grok 4.1 Fast
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (medie)923msTimp de răspuns (maxim)923msTimp de răspuns (total)923msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
923msTimp de răspuns (medie)…
56Tokenuri de ieșire…
0Tokenuri de raționament…
Puzzle Solving
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
1.7Scor mediu pe toate testele de benchmark.…
7.5Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 2Răspuns greșit: 1Timp de răspuns (medie)934msTimp de răspuns (maxim)1.18sTimp de răspuns (total)2.80sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
934msTimp de răspuns (medie)…
354Tokenuri de ieșire…
2,758Tokenuri de raționament…
xAI: Grok 4.1 Fast
1.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (medie)1.28sTimp de răspuns (maxim)1.36sTimp de răspuns (total)2.56sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.28sTimp de răspuns (medie)…
243Tokenuri de ieșire…
0Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)1.89sTimp de răspuns (maxim)1.89sTimp de răspuns (total)1.89sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.89sTimp de răspuns (medie)…
180Tokenuri de ieșire…
1,956Tokenuri de raționament…
xAI: Grok 4.1 Fast
10.0Scor mediu pe toate testele de benchmark.…
1.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)5.51sTimp de răspuns (maxim)5.51sTimp de răspuns (total)5.51sUn test este considerat trecut complet doar dacă toate rulările lui trec.…