10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
9.99Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
9.44Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Cost per rezultat
0.162Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
0.403Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
17.455Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
0.624Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.017Cost total…
$0.037Cost total…
$1.920Cost total…
$0.069Cost total…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 4Nu a urmat instrucțiunile: 1Timp de răspuns (medie)2.89sTimp de răspuns (maxim)9.54sTimp de răspuns (total)43.35sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 4Nu a urmat instrucțiunile: 2Timp de răspuns (medie)3.74sTimp de răspuns (maxim)12.98sTimp de răspuns (total)56.15sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Nu a urmat instrucțiunile: 1Timp de răspuns (medie)69.85sTimp de răspuns (maxim)232.25sTimp de răspuns (total)1047.79sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Nu a urmat instrucțiunile: 1Timp de răspuns (medie)6.32sTimp de răspuns (maxim)14.72sTimp de răspuns (total)94.86sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
60.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
73.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
75.6%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Tokenuri de ieșire
1,392Tokenuri de ieșire…
1,417Tokenuri de ieșire…
943Tokenuri de ieșire…
1,274Tokenuri de ieșire…
Tokenuri de raționament
6,379Tokenuri de raționament…
19,435Tokenuri de raționament…
1,275,768Tokenuri de raționament…
18,372Tokenuri de raționament…
Top modele după scor
Scor vs cost total
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Tokenuri de ieșire
Tokenuri de raționament
Google: Gemini 3.1 Flash Lite Preview
7.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)2.18sTimp de răspuns (maxim)3.18sTimp de răspuns (total)6.53sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
456Tokenuri de ieșire…
1,224Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
9.00Scor mediu pe toate testele de benchmark.…
9.99Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)2.53sTimp de răspuns (maxim)3.89sTimp de răspuns (total)7.58sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
564Tokenuri de ieșire…
3,780Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)43.87sTimp de răspuns (maxim)121.88sTimp de răspuns (total)131.62sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
144Tokenuri de ieșire…
193,077Tokenuri de raționament…
Google: Gemini 3 Flash Preview
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)3.50sTimp de răspuns (maxim)4.31sTimp de răspuns (total)10.49sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
275Tokenuri de ieșire…
2,476Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Tokenuri de ieșire
Tokenuri de raționament
Google: Gemini 3.1 Flash Lite Preview
1.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)2.96sTimp de răspuns (maxim)2.96sTimp de răspuns (total)2.96sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
75Tokenuri de ieșire…
253Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)12.98sTimp de răspuns (maxim)12.98sTimp de răspuns (total)12.98sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
109Tokenuri de ieșire…
2,449Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)232.25sTimp de răspuns (maxim)232.25sTimp de răspuns (total)232.25sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
112Tokenuri de ieșire…
126,813Tokenuri de raționament…
Google: Gemini 3 Flash Preview
1.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)2.96sTimp de răspuns (maxim)2.96sTimp de răspuns (total)2.96sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
104Tokenuri de ieșire…
0Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Tokenuri de ieșire
Tokenuri de raționament
Google: Gemini 3.1 Flash Lite Preview
9.88Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)3.00sTimp de răspuns (maxim)3.74sTimp de răspuns (total)5.99sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
291Tokenuri de ieșire…
696Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
9.88Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)2.29sTimp de răspuns (maxim)2.31sTimp de răspuns (total)4.59sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
279Tokenuri de ieșire…
2,952Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
9.88Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)7.16sTimp de răspuns (maxim)8.54sTimp de răspuns (total)14.31sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
279Tokenuri de ieșire…
6,186Tokenuri de raționament…
Google: Gemini 3 Flash Preview
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)9.46sTimp de răspuns (maxim)14.72sTimp de răspuns (total)18.92sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
305Tokenuri de ieșire…
3,004Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Tokenuri de ieșire
Tokenuri de raționament
Google: Gemini 3.1 Flash Lite Preview
4.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (medie)2.36sTimp de răspuns (maxim)3.51sTimp de răspuns (total)7.07sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
18Tokenuri de ieșire…
1,212Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
1.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (medie)4.21sTimp de răspuns (maxim)5.86sTimp de răspuns (total)12.62sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
18Tokenuri de ieșire…
5,325Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
4.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (medie)127.58sTimp de răspuns (maxim)133.93sTimp de răspuns (total)382.74sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
18Tokenuri de ieșire…
566,202Tokenuri de raționament…
Google: Gemini 3 Flash Preview
4.00Scor mediu pe toate testele de benchmark.…
7.21Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (medie)8.05sTimp de răspuns (maxim)14.40sTimp de răspuns (total)24.15sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
12Tokenuri de ieșire…
6,410Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Tokenuri de ieșire
Tokenuri de raționament
Google: Gemini 3.1 Flash Lite Preview
8.50Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)1.49sTimp de răspuns (maxim)1.66sTimp de răspuns (total)2.99sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
72Tokenuri de ieșire…
753Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
8.00Scor mediu pe toate testele de benchmark.…
9.99Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)1.91sTimp de răspuns (maxim)1.93sTimp de răspuns (total)3.82sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
72Tokenuri de ieșire…
2,121Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
8.00Scor mediu pe toate testele de benchmark.…
9.96Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)70.07sTimp de răspuns (maxim)136.53sTimp de răspuns (total)140.14sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
69Tokenuri de ieșire…
190,053Tokenuri de raționament…
Google: Gemini 3 Flash Preview
7.50Scor mediu pe toate testele de benchmark.…
9.99Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)7.02sTimp de răspuns (maxim)7.35sTimp de răspuns (total)14.03sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
71Tokenuri de ieșire…
2,752Tokenuri de raționament…
Puzzle Solving
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Tokenuri de ieșire
Tokenuri de raționament
Google: Gemini 3.1 Flash Lite Preview
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)2.76sTimp de răspuns (maxim)5.08sTimp de răspuns (total)8.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
243Tokenuri de ieșire…
1,248Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
7.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)3.58sTimp de răspuns (maxim)4.41sTimp de răspuns (total)10.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
141Tokenuri de ieșire…
1,896Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
7.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)46.33sTimp de răspuns (maxim)134.22sTimp de răspuns (total)139.00sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
87Tokenuri de ieșire…
190,953Tokenuri de raționament…
Google: Gemini 3 Flash Preview
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)6.44sTimp de răspuns (maxim)10.27sTimp de răspuns (total)19.32sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
273Tokenuri de ieșire…
3,315Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Tokenuri de ieșire
Tokenuri de raționament
Google: Gemini 3.1 Flash Lite Preview
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)9.54sTimp de răspuns (maxim)9.54sTimp de răspuns (total)9.54sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
237Tokenuri de ieșire…
993Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)3.80sTimp de răspuns (maxim)3.80sTimp de răspuns (total)3.80sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
234Tokenuri de ieșire…
912Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)7.73sTimp de răspuns (maxim)7.73sTimp de răspuns (total)7.73sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
234Tokenuri de ieșire…
2,484Tokenuri de raționament…
Google: Gemini 3 Flash Preview
10.00Scor mediu pe toate testele de benchmark.…
10.00Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)4.99sTimp de răspuns (maxim)4.99sTimp de răspuns (total)4.99sUn test este considerat trecut complet doar dacă toate rulările lui trec.…