9.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
8.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Cost per rezultat
0.000Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
0.237Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.000Cost total…
$0.015Cost total…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 9Nu a urmat instrucțiunile: 2Timp de răspuns (mediu)3.15sTimp de răspuns (maxim)8.91sTimp de răspuns (total)50.46sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 8Nu a urmat instrucțiunile: 2Timp de răspuns (mediu)4.10sTimp de răspuns (maxim)47.43sTimp de răspuns (total)65.62sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
3Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
48 (16 x 3)Rulări totale…
48 (16 x 3)Rulări totale…
Tokenuri de ieșire
1,837Tokenuri de ieșire…
3,756Tokenuri de ieșire…
Tokenuri de raționament
0Tokenuri de raționament…
0Tokenuri de raționament…
Timp de răspuns (mediu)
3.15sTimp de răspuns (mediu)…
4.10sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
8.91sTimp de răspuns (maxim)…
47.43sTimp de răspuns (maxim)…
Timp de răspuns (total)
50.46sTimp de răspuns (total)…
65.62sTimp de răspuns (total)…
Top modele după scor
Scor vs cost total
Timp de răspuns (mediu)
Scor mediu vs Timp de răspuns (mediu)
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Trinity Large Preview
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)3.59sTimp de răspuns (maxim)8.17sTimp de răspuns (total)10.78sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.59sTimp de răspuns (mediu)…
587Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen: Qwen3.5-35B-A3B
10.0Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)1.76sTimp de răspuns (maxim)4.39sTimp de răspuns (total)5.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.76sTimp de răspuns (mediu)…
569Tokenuri de ieșire…
0Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Trinity Large Preview
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)8.91sTimp de răspuns (maxim)8.91sTimp de răspuns (total)8.91sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
8.91sTimp de răspuns (mediu)…
294Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen: Qwen3.5-35B-A3B
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)47.43sTimp de răspuns (maxim)47.43sTimp de răspuns (total)47.43sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
47.43sTimp de răspuns (mediu)…
1,833Tokenuri de ieșire…
0Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Trinity Large Preview
9.9Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.26sTimp de răspuns (maxim)4.66sTimp de răspuns (total)6.52sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.26sTimp de răspuns (mediu)…
186Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen: Qwen3.5-35B-A3B
9.9Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)1.16sTimp de răspuns (maxim)1.42sTimp de răspuns (total)2.33sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.16sTimp de răspuns (mediu)…
243Tokenuri de ieșire…
0Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Trinity Large Preview
4.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)877msTimp de răspuns (maxim)894msTimp de răspuns (total)2.63sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
877msTimp de răspuns (mediu)…
25Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen: Qwen3.5-35B-A3B
7.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)485msTimp de răspuns (maxim)549msTimp de răspuns (total)1.45sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
485msTimp de răspuns (mediu)…
15Tokenuri de ieșire…
0Tokenuri de raționament…
Inteligență generală
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Trinity Large Preview
3.0Scor mediu pe toate testele de benchmark.…
9.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)2.86sTimp de răspuns (maxim)2.86sTimp de răspuns (total)2.86sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.86sTimp de răspuns (mediu)…
124Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen: Qwen3.5-35B-A3B
6.0Scor mediu pe toate testele de benchmark.…
3.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)1.19sTimp de răspuns (maxim)1.19sTimp de răspuns (total)1.19sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.19sTimp de răspuns (mediu)…
114Tokenuri de ieșire…
0Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Trinity Large Preview
3.5Scor mediu pe toate testele de benchmark.…
6.7Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
16.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)1.09sTimp de răspuns (maxim)1.23sTimp de răspuns (total)2.19sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.09sTimp de răspuns (mediu)…
63Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen: Qwen3.5-35B-A3B
5.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)809msTimp de răspuns (maxim)983msTimp de răspuns (total)1.62sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
809msTimp de răspuns (mediu)…
63Tokenuri de ieșire…
0Tokenuri de raționament…
Puzzle Solving
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Trinity Large Preview
4.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)3.30sTimp de răspuns (maxim)4.81sTimp de răspuns (total)9.91sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.30sTimp de răspuns (mediu)…
291Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen: Qwen3.5-35B-A3B
1.7Scor mediu pe toate testele de benchmark.…
7.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)1.34sTimp de răspuns (maxim)2.25sTimp de răspuns (total)4.03sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.34sTimp de răspuns (mediu)…
655Tokenuri de ieșire…
0Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Trinity Large Preview
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)6.67sTimp de răspuns (maxim)6.67sTimp de răspuns (total)6.67sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
6.67sTimp de răspuns (mediu)…
267Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen: Qwen3.5-35B-A3B
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.30sTimp de răspuns (maxim)2.30sTimp de răspuns (total)2.30sUn test este considerat trecut complet doar dacă toate rulările lui trec.…