Un test este considerat trecut complet doar dacă toate rulările lui trec.Formatare suplimentară: 4Răspuns greșit: 2Timp de răspuns (mediu)25.08sTimp de răspuns (maxim)83.40sTimp de răspuns (total)200.67sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 4Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)1.37sTimp de răspuns (maxim)3.39sTimp de răspuns (total)20.53sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Consistență
8.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
9.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Cost per rezultat
14.411Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
0.142Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$1.297Cost total…
$0.015Cost total…
Rată de trecere pe încercare
64.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
71.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
common.totalRuns
45 (15 x 3)common.totalRuns…
45 (15 x 3)common.totalRuns…
Tokenuri de ieșire
26,066Tokenuri de ieșire…
4,646Tokenuri de ieșire…
Tokenuri de raționament
17,071Tokenuri de raționament…
0Tokenuri de raționament…
Timp de răspuns (mediu)
25.08sTimp de răspuns (mediu)…
1.37sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
83.40sTimp de răspuns (maxim)…
3.39sTimp de răspuns (maxim)…
Timp de răspuns (total)
200.67sTimp de răspuns (total)…
20.53sTimp de răspuns (total)…
Top modele după scor
Scor vs cost total
Timp de răspuns (mediu)
Scor mediu vs Timp de răspuns (mediu)
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Anthropic: Claude Opus 4.6
4.0Scor mediu pe toate testele de benchmark.…
4.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
55.6%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Formatare suplimentară: 2Timp de răspuns (mediu)11.88sTimp de răspuns (maxim)11.88sTimp de răspuns (total)11.88sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
11.88sTimp de răspuns (mediu)…
897Tokenuri de ieșire…
1,000Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
6.0Scor mediu pe toate testele de benchmark.…
7.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
55.6%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)1.16sTimp de răspuns (maxim)1.47sTimp de răspuns (total)3.49sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.16sTimp de răspuns (mediu)…
1,086Tokenuri de ieșire…
0Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Anthropic: Claude Opus 4.6
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)76.66sTimp de răspuns (maxim)76.66sTimp de răspuns (total)76.66sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
76.66sTimp de răspuns (mediu)…
8,178Tokenuri de ieșire…
5,194Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)3.20sTimp de răspuns (maxim)3.20sTimp de răspuns (total)3.20sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.20sTimp de răspuns (mediu)…
339Tokenuri de ieșire…
0Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Anthropic: Claude Opus 4.6
9.9Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)7.37sTimp de răspuns (maxim)7.37sTimp de răspuns (total)7.37sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.37sTimp de răspuns (mediu)…
691Tokenuri de ieșire…
757Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
9.9Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)1.22sTimp de răspuns (maxim)1.33sTimp de răspuns (total)2.44sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.22sTimp de răspuns (mediu)…
399Tokenuri de ieșire…
0Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Anthropic: Claude Opus 4.6
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Formatare suplimentară: 2Răspuns greșit: 1Timp de răspuns (mediu)83.40sTimp de răspuns (maxim)83.40sTimp de răspuns (total)83.40sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
83.40sTimp de răspuns (mediu)…
14,642Tokenuri de ieșire…
8,687Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
4.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)942msTimp de răspuns (maxim)1.12sTimp de răspuns (total)2.83sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
942msTimp de răspuns (mediu)…
568Tokenuri de ieșire…
0Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Anthropic: Claude Opus 4.6
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.43sTimp de răspuns (maxim)2.43sTimp de răspuns (total)2.43sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.43sTimp de răspuns (mediu)…
266Tokenuri de ieșire…
467Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)1.13sTimp de răspuns (maxim)1.14sTimp de răspuns (total)2.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.13sTimp de răspuns (mediu)…
574Tokenuri de ieșire…
0Tokenuri de raționament…
Puzzle Solving
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Anthropic: Claude Opus 4.6
7.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)4.60sTimp de răspuns (maxim)4.66sTimp de răspuns (total)9.20sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.60sTimp de răspuns (mediu)…
531Tokenuri de ieșire…
637Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)972msTimp de răspuns (maxim)1.13sTimp de răspuns (total)2.92sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
972msTimp de răspuns (mediu)…
898Tokenuri de ieșire…
0Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Anthropic: Claude Opus 4.6
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)9.73sTimp de răspuns (maxim)9.73sTimp de răspuns (total)9.73sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.73sTimp de răspuns (mediu)…
861Tokenuri de ieșire…
329Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.39sTimp de răspuns (maxim)3.39sTimp de răspuns (total)3.39sUn test este considerat trecut complet doar dacă toate rulările lui trec.…