Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 4Timp de răspuns (mediu)3.49sTimp de răspuns (maxim)11.91sTimp de răspuns (total)52.29sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 3Eroare API: 1Răspuns greșit: 1Timp de răspuns (mediu)72.86sTimp de răspuns (maxim)234.29sTimp de răspuns (total)1092.84sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Consistență
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
7.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Cost per rezultat
0.170Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
0.565Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.019Cost total…
$0.057Cost total…
Rată de trecere pe încercare
73.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
82.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
4Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
common.totalRuns
45 (15 x 3)common.totalRuns…
45 (15 x 3)common.totalRuns…
Tokenuri de ieșire
1,542Tokenuri de ieșire…
1,708Tokenuri de ieșire…
Tokenuri de raționament
6,888Tokenuri de raționament…
131,466Tokenuri de raționament…
Timp de răspuns (mediu)
3.49sTimp de răspuns (mediu)…
72.86sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
11.91sTimp de răspuns (maxim)…
234.29sTimp de răspuns (maxim)…
Timp de răspuns (total)
52.29sTimp de răspuns (total)…
1092.84sTimp de răspuns (total)…
Top modele după scor
Scor vs cost total
Timp de răspuns (mediu)
Scor mediu vs Timp de răspuns (mediu)
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Google: Gemini 3.1 Flash Lite Preview
7.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)2.18sTimp de răspuns (maxim)3.18sTimp de răspuns (total)6.53sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.18sTimp de răspuns (mediu)…
456Tokenuri de ieșire…
1,224Tokenuri de raționament…
Qwen: Qwen3.5-Flash
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)71.35sTimp de răspuns (maxim)168.31sTimp de răspuns (total)214.06sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
71.35sTimp de răspuns (mediu)…
363Tokenuri de ieșire…
23,645Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Google: Gemini 3.1 Flash Lite Preview
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)11.91sTimp de răspuns (maxim)11.91sTimp de răspuns (total)11.91sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
11.91sTimp de răspuns (mediu)…
225Tokenuri de ieșire…
762Tokenuri de raționament…
Qwen: Qwen3.5-Flash
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)17.78sTimp de răspuns (maxim)17.78sTimp de răspuns (total)17.78sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
17.78sTimp de răspuns (mediu)…
483Tokenuri de ieșire…
8,270Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Google: Gemini 3.1 Flash Lite Preview
9.9Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.00sTimp de răspuns (maxim)3.74sTimp de răspuns (total)5.99sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.00sTimp de răspuns (mediu)…
291Tokenuri de ieșire…
696Tokenuri de raționament…
Qwen: Qwen3.5-Flash
5.5Scor mediu pe toate testele de benchmark.…
5.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)56.99sTimp de răspuns (maxim)80.14sTimp de răspuns (total)113.98sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
56.99sTimp de răspuns (mediu)…
235Tokenuri de ieșire…
16,237Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Google: Gemini 3.1 Flash Lite Preview
4.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)2.36sTimp de răspuns (maxim)3.51sTimp de răspuns (total)7.07sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.36sTimp de răspuns (mediu)…
18Tokenuri de ieșire…
1,212Tokenuri de raționament…
Qwen: Qwen3.5-Flash
4.0Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 1Răspuns greșit: 1Timp de răspuns (mediu)146.50sTimp de răspuns (maxim)234.29sTimp de răspuns (total)439.49sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
146.50sTimp de răspuns (mediu)…
58Tokenuri de ieșire…
43,615Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Google: Gemini 3.1 Flash Lite Preview
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)1.49sTimp de răspuns (maxim)1.66sTimp de răspuns (total)2.99sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.49sTimp de răspuns (mediu)…
72Tokenuri de ieșire…
753Tokenuri de raționament…
Qwen: Qwen3.5-Flash
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)63.49sTimp de răspuns (maxim)111.61sTimp de răspuns (total)126.98sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
63.49sTimp de răspuns (mediu)…
98Tokenuri de ieșire…
14,139Tokenuri de raționament…
Puzzle Solving
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Google: Gemini 3.1 Flash Lite Preview
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.76sTimp de răspuns (maxim)5.08sTimp de răspuns (total)8.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.76sTimp de răspuns (mediu)…
243Tokenuri de ieșire…
1,248Tokenuri de raționament…
Qwen: Qwen3.5-Flash
4.0Scor mediu pe toate testele de benchmark.…
4.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
77.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 2Timp de răspuns (mediu)56.74sTimp de răspuns (maxim)115.01sTimp de răspuns (total)170.23sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
56.74sTimp de răspuns (mediu)…
162Tokenuri de ieșire…
24,276Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Google: Gemini 3.1 Flash Lite Preview
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)9.54sTimp de răspuns (maxim)9.54sTimp de răspuns (total)9.54sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.54sTimp de răspuns (mediu)…
237Tokenuri de ieșire…
993Tokenuri de raționament…
Qwen: Qwen3.5-Flash
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)10.33sTimp de răspuns (maxim)10.33sTimp de răspuns (total)10.33sUn test este considerat trecut complet doar dacă toate rulările lui trec.…