89Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
67Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Cost per rezultat
0.147Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
4.189Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.006Cost total…
$0.336Cost total…
Timp de răspuns (medie)
594msTimp de răspuns (medie)…
44.84sTimp de răspuns (medie)…
Timp de răspuns (maxim)
1.27sTimp de răspuns (maxim)…
106.00sTimp de răspuns (maxim)…
Timp de răspuns (total)
8.91sTimp de răspuns (total)…
672.55sTimp de răspuns (total)…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 11Timp de răspuns (medie)594msTimp de răspuns (maxim)1.27sTimp de răspuns (total)8.91sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 3Răspuns greșit: 2Eroare API: 1Fără răspuns: 1Timp de răspuns (medie)44.84sTimp de răspuns (maxim)106.00sTimp de răspuns (total)672.55sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
80.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
6Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Tokenuri de ieșire
1,144Tokenuri de ieșire…
5,475Tokenuri de ieșire…
Tokenuri de raționament
0Tokenuri de raționament…
165,513Tokenuri de raționament…
Top modele după scor
Timp de răspuns (medie)
Scor vs cost total
Scor mediu vs Timp de răspuns (medie)
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (medie)466msTimp de răspuns (maxim)716msTimp de răspuns (total)1.40sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
466msTimp de răspuns (medie)…
274Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen: Qwen3.5-35B-A3B
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)21.75sTimp de răspuns (maxim)34.96sTimp de răspuns (total)65.26sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
21.75sTimp de răspuns (medie)…
429Tokenuri de ieșire…
36,235Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)606msTimp de răspuns (maxim)606msTimp de răspuns (total)606msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
606msTimp de răspuns (medie)…
131Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen: Qwen3.5-35B-A3B
100Scor mediu pe toate testele de benchmark.…
16Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (medie)75.34sTimp de răspuns (maxim)75.34sTimp de răspuns (total)75.34sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
75.34sTimp de răspuns (medie)…
775Tokenuri de ieșire…
12,485Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
55Scor mediu pe toate testele de benchmark.…
59Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)667msTimp de răspuns (maxim)819msTimp de răspuns (total)1.33sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
667msTimp de răspuns (medie)…
180Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen: Qwen3.5-35B-A3B
55Scor mediu pe toate testele de benchmark.…
59Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (medie)59.33sTimp de răspuns (maxim)97.12sTimp de răspuns (total)118.65sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
59.33sTimp de răspuns (medie)…
235Tokenuri de ieșire…
19,493Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
40Scor mediu pe toate testele de benchmark.…
72Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (medie)534msTimp de răspuns (maxim)733msTimp de răspuns (total)1.60sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
534msTimp de răspuns (medie)…
46Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen: Qwen3.5-35B-A3B
100Scor mediu pe toate testele de benchmark.…
44Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.5%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 2Răspuns greșit: 1Timp de răspuns (medie)88.34sTimp de răspuns (maxim)106.00sTimp de răspuns (total)265.01sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
88.34sTimp de răspuns (medie)…
41Tokenuri de ieșire…
46,368Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
55Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)551msTimp de răspuns (maxim)622msTimp de răspuns (total)1.10sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
551msTimp de răspuns (medie)…
82Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen: Qwen3.5-35B-A3B
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)24.45sTimp de răspuns (maxim)43.36sTimp de răspuns (total)48.89sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
24.45sTimp de răspuns (medie)…
97Tokenuri de ieșire…
17,361Tokenuri de raționament…
Puzzle Solving
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (medie)533msTimp de răspuns (maxim)637msTimp de răspuns (total)1.60sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
533msTimp de răspuns (medie)…
234Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen: Qwen3.5-35B-A3B
40Scor mediu pe toate testele de benchmark.…
44Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
77.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 1Răspuns greșit: 1Timp de răspuns (medie)31.58sTimp de răspuns (maxim)60.18sTimp de răspuns (total)94.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
31.58sTimp de răspuns (medie)…
3,589Tokenuri de ieșire…
32,206Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
Inception: Mercury 2
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)1.27sTimp de răspuns (maxim)1.27sTimp de răspuns (total)1.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.27sTimp de răspuns (medie)…
197Tokenuri de ieșire…
0Tokenuri de raționament…
Qwen: Qwen3.5-35B-A3B
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)4.65sTimp de răspuns (maxim)4.65sTimp de răspuns (total)4.65sUn test este considerat trecut complet doar dacă toate rulările lui trec.…