9.1Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
9.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Cost per rezultat
0.280Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
19.243Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.028Cost total…
$2.310Cost total…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 4Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)65.09sTimp de răspuns (maxim)262.83sTimp de răspuns (total)846.14sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)68.83sTimp de răspuns (maxim)280.52sTimp de răspuns (total)1101.32sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
68.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
77.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
common.totalRuns
48 (16 x 3)common.totalRuns…
48 (16 x 3)common.totalRuns…
Tokenuri de ieșire
1,965Tokenuri de ieșire…
1,283Tokenuri de ieșire…
Tokenuri de raționament
58,456Tokenuri de raționament…
1,533,310Tokenuri de raționament…
Timp de răspuns (mediu)
65.09sTimp de răspuns (mediu)…
68.83sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
262.83sTimp de răspuns (maxim)…
280.52sTimp de răspuns (maxim)…
Timp de răspuns (total)
846.14sTimp de răspuns (total)…
1101.32sTimp de răspuns (total)…
Top modele după scor
Scor vs cost total
Timp de răspuns (mediu)
Scor mediu vs Timp de răspuns (mediu)
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
ByteDance Seed: Seed-2.0-Mini
7.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 1Timp de răspuns (mediu)98.99sTimp de răspuns (maxim)182.10sTimp de răspuns (total)296.96sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
98.99sTimp de răspuns (mediu)…
354Tokenuri de ieșire…
9,352Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)43.87sTimp de răspuns (maxim)121.88sTimp de răspuns (total)131.62sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
43.87sTimp de răspuns (mediu)…
144Tokenuri de ieșire…
193,077Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
ByteDance Seed: Seed-2.0-Mini
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)262.83sTimp de răspuns (maxim)262.83sTimp de răspuns (total)262.83sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
262.83sTimp de răspuns (mediu)…
404Tokenuri de ieșire…
29,806Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)280.52sTimp de răspuns (maxim)280.52sTimp de răspuns (total)280.52sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
280.52sTimp de răspuns (mediu)…
335Tokenuri de ieșire…
380,440Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
ByteDance Seed: Seed-2.0-Mini
9.9Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)24.27sTimp de răspuns (maxim)27.52sTimp de răspuns (total)48.54sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
24.27sTimp de răspuns (mediu)…
246Tokenuri de ieșire…
2,743Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
9.9Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)7.16sTimp de răspuns (maxim)8.54sTimp de răspuns (total)14.31sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.16sTimp de răspuns (mediu)…
279Tokenuri de ieșire…
6,186Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
ByteDance Seed: Seed-2.0-Mini
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 3Timp de răspuns (mediu)0msTimp de răspuns (maxim)0msTimp de răspuns (total)0msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
0msTimp de răspuns (mediu)…
0Tokenuri de ieșire…
0Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
4.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)127.58sTimp de răspuns (maxim)133.93sTimp de răspuns (total)382.74sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
127.58sTimp de răspuns (mediu)…
18Tokenuri de ieșire…
566,202Tokenuri de raționament…
Inteligență generală
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
ByteDance Seed: Seed-2.0-Mini
6.0Scor mediu pe toate testele de benchmark.…
3.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)36.65sTimp de răspuns (maxim)36.65sTimp de răspuns (total)36.65sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
36.65sTimp de răspuns (mediu)…
213Tokenuri de ieșire…
4,210Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.25sTimp de răspuns (maxim)5.25sTimp de răspuns (total)5.25sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.25sTimp de răspuns (mediu)…
117Tokenuri de ieșire…
3,915Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
ByteDance Seed: Seed-2.0-Mini
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)17.47sTimp de răspuns (maxim)19.46sTimp de răspuns (total)34.93sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
17.47sTimp de răspuns (mediu)…
69Tokenuri de ieșire…
2,050Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
9.0Scor mediu pe toate testele de benchmark.…
6.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)70.07sTimp de răspuns (maxim)136.53sTimp de răspuns (total)140.14sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
70.07sTimp de răspuns (mediu)…
69Tokenuri de ieșire…
190,053Tokenuri de raționament…
Puzzle Solving
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
ByteDance Seed: Seed-2.0-Mini
7.0Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
88.9%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)25.85sTimp de răspuns (maxim)32.95sTimp de răspuns (total)77.55sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
25.85sTimp de răspuns (mediu)…
457Tokenuri de ieșire…
5,060Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
7.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)46.33sTimp de răspuns (maxim)134.22sTimp de răspuns (total)139.00sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
46.33sTimp de răspuns (mediu)…
87Tokenuri de ieșire…
190,953Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
ByteDance Seed: Seed-2.0-Mini
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)88.68sTimp de răspuns (maxim)88.68sTimp de răspuns (total)88.68sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
88.68sTimp de răspuns (mediu)…
222Tokenuri de ieșire…
5,235Tokenuri de raționament…
Google: Gemini 3.1 Flash Lite Preview
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)7.73sTimp de răspuns (maxim)7.73sTimp de răspuns (total)7.73sUn test este considerat trecut complet doar dacă toate rulările lui trec.…