58Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
89Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Cost per rezultat
4.937Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
1.496Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.247Cost total…
$0.090Cost total…
Timp de răspuns (medie)
47.58sTimp de răspuns (medie)…
1.46sTimp de răspuns (medie)…
Timp de răspuns (maxim)
237.27sTimp de răspuns (maxim)…
2.89sTimp de răspuns (maxim)…
Timp de răspuns (total)
380.62sTimp de răspuns (total)…
21.86sTimp de răspuns (total)…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 5Nu a urmat instrucțiunile: 2Timp expirat: 2invalid tool call: 1Timp de răspuns (medie)47.58sTimp de răspuns (maxim)237.27sTimp de răspuns (total)380.62sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 8Nu a urmat instrucțiunile: 1Timp de răspuns (medie)1.46sTimp de răspuns (maxim)2.89sTimp de răspuns (total)21.86sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
62.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
8Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Tokenuri de ieșire
107,019Tokenuri de ieșire…
1,635Tokenuri de ieșire…
Tokenuri de raționament
204,504Tokenuri de raționament…
0Tokenuri de raționament…
Top modele după scor
Timp de răspuns (medie)
Scor vs cost total
Scor mediu vs Timp de răspuns (medie)
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
MiniMax: MiniMax M2.5
93Scor mediu pe toate testele de benchmark.…
79Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
88.9%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)32.42sTimp de răspuns (maxim)32.42sTimp de răspuns (total)32.42sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
32.42sTimp de răspuns (medie)…
286Tokenuri de ieșire…
45,112Tokenuri de raționament…
OpenAI: GPT-5.4
100Scor mediu pe toate testele de benchmark.…
73Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
11.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (medie)1.41sTimp de răspuns (maxim)2.58sTimp de răspuns (total)4.23sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.41sTimp de răspuns (medie)…
388Tokenuri de ieșire…
0Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
MiniMax: MiniMax M2.5
100Scor mediu pe toate testele de benchmark.…
21Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.invalid tool call: 1Timp de răspuns (medie)60.39sTimp de răspuns (maxim)60.39sTimp de răspuns (total)60.39sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
60.39sTimp de răspuns (medie)…
740Tokenuri de ieșire…
9,713Tokenuri de raționament…
OpenAI: GPT-5.4
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)2.89sTimp de răspuns (maxim)2.89sTimp de răspuns (total)2.89sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.89sTimp de răspuns (medie)…
291Tokenuri de ieșire…
0Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
MiniMax: MiniMax M2.5
100Scor mediu pe toate testele de benchmark.…
17Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (medie)7.48sTimp de răspuns (maxim)7.48sTimp de răspuns (total)7.48sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.48sTimp de răspuns (medie)…
266Tokenuri de ieșire…
3,835Tokenuri de raționament…
OpenAI: GPT-5.4
99Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)1.04sTimp de răspuns (maxim)1.06sTimp de răspuns (total)2.08sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.04sTimp de răspuns (medie)…
222Tokenuri de ieșire…
0Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
MiniMax: MiniMax M2.5
100Scor mediu pe toate testele de benchmark.…
44Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp expirat: 1Timp de răspuns (medie)237.27sTimp de răspuns (maxim)237.27sTimp de răspuns (total)237.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
237.27sTimp de răspuns (medie)…
105,047Tokenuri de ieșire…
133,487Tokenuri de raționament…
OpenAI: GPT-5.4
40Scor mediu pe toate testele de benchmark.…
72Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (medie)1.07sTimp de răspuns (maxim)1.54sTimp de răspuns (total)3.22sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.07sTimp de răspuns (medie)…
50Tokenuri de ieșire…
0Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
MiniMax: MiniMax M2.5
80Scor mediu pe toate testele de benchmark.…
68Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (medie)4.64sTimp de răspuns (maxim)4.64sTimp de răspuns (total)4.64sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.64sTimp de răspuns (medie)…
252Tokenuri de ieșire…
1,873Tokenuri de raționament…
OpenAI: GPT-5.4
55Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (medie)1.07sTimp de răspuns (maxim)1.17sTimp de răspuns (total)2.15sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.07sTimp de răspuns (medie)…
81Tokenuri de ieșire…
0Tokenuri de raționament…
Puzzle Solving
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
MiniMax: MiniMax M2.5
40Scor mediu pe toate testele de benchmark.…
72Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 1Răspuns greșit: 1Timp de răspuns (medie)11.54sTimp de răspuns (maxim)17.37sTimp de răspuns (total)23.08sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
11.54sTimp de răspuns (medie)…
159Tokenuri de ieșire…
9,547Tokenuri de raționament…
OpenAI: GPT-5.4
40Scor mediu pe toate testele de benchmark.…
98Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (medie)1.52sTimp de răspuns (maxim)1.82sTimp de răspuns (total)4.56sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.52sTimp de răspuns (medie)…
357Tokenuri de ieșire…
0Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (medie)
Tokenuri de ieșire
Tokenuri de raționament
MiniMax: MiniMax M2.5
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)15.35sTimp de răspuns (maxim)15.35sTimp de răspuns (total)15.35sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
15.35sTimp de răspuns (medie)…
269Tokenuri de ieșire…
937Tokenuri de raționament…
OpenAI: GPT-5.4
100Scor mediu pe toate testele de benchmark.…
100Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (medie)2.75sTimp de răspuns (maxim)2.75sTimp de răspuns (total)2.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…