Comparație benchmark Gemma 4 31B vs Gemini 3 PRO Preview vs GLM 5 TurboGLM 5 Turbo conduce la Scor cu 8.4. Gemma 4 31B conduce la Fiabilitate cu 10.0. Gemma 4 31B are cel mai mic Cost total, $0.033. Gemini 3 PRO Preview are cel mai rapid timp de răspuns, 9.05s.
Model recomandat: GLM 5 Turbo - Are cel mai puternic scor din această comparație (8.4) și cel mai bun echilibru între cost și timp de răspuns dintre toate cele 3 modele.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-07-02
GLM 5 TurboGLM 5 TurbomediumModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.Lansare: 2026-03-15
Scor
6.3Scor mediu pe toate testele de benchmark.…
6.2Scor mediu pe toate testele de benchmark.…
8.4Scor mediu pe toate testele de benchmark.…
Rang
#91
#94
#21
Fiabilitate
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
N/DScorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
9.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
8.5Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 2Timp expirat: 2Răspuns greșit: 2Fără răspuns: 1Timp de răspuns (mediu)56.55sTimp de răspuns (maxim)437.40sTimp de răspuns (total)1074.41sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 4Răspuns greșit: 3Timp de răspuns (mediu)9.05sTimp de răspuns (maxim)26.24sTimp de răspuns (total)90.53sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 4Nu a urmat instrucțiunile: 1Fără răspuns: 1Timp expirat: 1Timp de răspuns (mediu)23.00sTimp de răspuns (maxim)194.23sTimp de răspuns (total)482.97sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
69.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
74.6%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
4Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
63Rulări totale…
63Rulări totale…
63Rulări totale…
Cost per rezultat
0.257Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
1.406Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
2.011Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.033Cost total (preț curent)…
$0.385Cost total (preț curent)…
$0.323Cost total (preț curent)…
Preț de intrare
$0.120 / 1MPreț de intrare…
$9.506 / 1MPreț de intrare…
$1.200 / 1MPreț de intrare…
Preț de ieșire
$0.350 / 1MPreț de ieșire…
$9.506 / 1MPreț de ieșire…
$4.000 / 1MPreț de ieșire…
Total tokenuri de intrare
17,957Total tokenuri de intrare…
28,848Total tokenuri de intrare…
35,593Total tokenuri de intrare…
Tokenuri de ieșire
22,356Tokenuri de ieșire…
1,490Tokenuri de ieșire…
12,245Tokenuri de ieșire…
Tokenuri de raționament
65,726Tokenuri de raționament…
10,102Tokenuri de raționament…
62,277Tokenuri de raționament…
Timp de răspuns (mediu)
56.55sTimp de răspuns (mediu)…
9.05sTimp de răspuns (mediu)…
23.00sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
437.40sTimp de răspuns (maxim)…
26.24sTimp de răspuns (maxim)…
194.23sTimp de răspuns (maxim)…
Timp de răspuns (total)
1074.41sTimp de răspuns (total)…
90.53sTimp de răspuns (total)…
482.97sTimp de răspuns (total)…
Prezentare generare
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#91 Gemma 4 31B
medium
Cost
$0.002
Timp
45.7s
Tokenuri
2,696 tok
#94 Gemini 3 PRO Preview
medium
No endpoints found for google/gemini-3-pro-preview.
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)12.89sTimp de răspuns (maxim)26.66sTimp de răspuns (total)51.55sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
12.89sTimp de răspuns (mediu)…
816Total tokenuri de intrare…
962Tokenuri de ieșire…
2,046Tokenuri de raționament…
Gemini 3 PRO PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)14.99sTimp de răspuns (maxim)26.24sTimp de răspuns (total)29.99sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
14.99sTimp de răspuns (mediu)…
500Total tokenuri de intrare…
149Tokenuri de ieșire…
1,485Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.82sTimp de răspuns (maxim)7.69sTimp de răspuns (total)19.26sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 2Fără răspuns: 1Timp de răspuns (mediu)219.76sTimp de răspuns (maxim)437.40sTimp de răspuns (total)659.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
219.76sTimp de răspuns (mediu)…
5,568Total tokenuri de intrare…
11,098Tokenuri de ieșire…
33,212Tokenuri de raționament…
Gemini 3 PRO PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 3Timp de răspuns (mediu)0msTimp de răspuns (maxim)0msTimp de răspuns (total)0msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
0msTimp de răspuns (mediu)…
0Total tokenuri de intrare…
0Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
8.2Scor mediu pe toate testele de benchmark.…
9.3Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)45.90sTimp de răspuns (maxim)95.57sTimp de răspuns (total)137.71sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)0msTimp de răspuns (maxim)0msTimp de răspuns (total)0msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
0msTimp de răspuns (mediu)…
0Total tokenuri de intrare…
0Tokenuri de ieșire…
0Tokenuri de raționament…
Gemini 3 PRO PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)10.37sTimp de răspuns (maxim)10.37sTimp de răspuns (total)10.37sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.37sTimp de răspuns (mediu)…
13,211Total tokenuri de intrare…
351Tokenuri de ieșire…
952Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)13.88sTimp de răspuns (maxim)13.88sTimp de răspuns (total)13.88sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)21.11sTimp de răspuns (maxim)21.94sTimp de răspuns (total)42.21sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
21.11sTimp de răspuns (mediu)…
8,334Total tokenuri de intrare…
1,822Tokenuri de ieșire…
2,951Tokenuri de raționament…
Gemini 3 PRO PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)10.84sTimp de răspuns (maxim)10.84sTimp de răspuns (total)10.84sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.84sTimp de răspuns (mediu)…
7,259Total tokenuri de intrare…
279Tokenuri de ieșire…
3,156Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)6.19sTimp de răspuns (maxim)6.42sTimp de răspuns (total)12.38sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)38.48sTimp de răspuns (maxim)68.92sTimp de răspuns (total)115.43sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
38.48sTimp de răspuns (mediu)…
876Total tokenuri de intrare…
4,349Tokenuri de ieșire…
8,985Tokenuri de raționament…
Gemini 3 PRO PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
5.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)7.01sTimp de răspuns (maxim)7.01sTimp de răspuns (total)7.01sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.01sTimp de răspuns (mediu)…
643Total tokenuri de intrare…
15Tokenuri de ieșire…
1,195Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
2.9Scor mediu pe toate testele de benchmark.…
4.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp expirat: 1Timp de răspuns (mediu)71.07sTimp de răspuns (maxim)194.23sTimp de răspuns (total)213.22sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)9.57sTimp de răspuns (maxim)9.57sTimp de răspuns (total)9.57sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.57sTimp de răspuns (mediu)…
567Total tokenuri de intrare…
105Tokenuri de ieșire…
888Tokenuri de raționament…
Gemini 3 PRO PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)9.34sTimp de răspuns (maxim)9.34sTimp de răspuns (total)9.34sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.34sTimp de răspuns (mediu)…
486Total tokenuri de intrare…
78Tokenuri de ieșire…
374Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
6.1Scor mediu pe toate testele de benchmark.…
3.1Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)10.05sTimp de răspuns (maxim)10.05sTimp de răspuns (total)10.05sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)12.76sTimp de răspuns (maxim)17.53sTimp de răspuns (total)25.52sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
12.76sTimp de răspuns (mediu)…
777Total tokenuri de intrare…
533Tokenuri de ieșire…
2,035Tokenuri de raționament…
Gemini 3 PRO PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
9.8Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.26sTimp de răspuns (maxim)3.26sTimp de răspuns (total)3.26sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.26sTimp de răspuns (mediu)…
623Total tokenuri de intrare…
69Tokenuri de ieșire…
754Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.38sTimp de răspuns (maxim)5.70sTimp de răspuns (total)10.77sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)26.91sTimp de răspuns (maxim)61.08sTimp de răspuns (total)80.72sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
26.91sTimp de răspuns (mediu)…
801Total tokenuri de intrare…
1,795Tokenuri de ieșire…
5,595Tokenuri de raționament…
Gemini 3 PRO PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.88sTimp de răspuns (maxim)4.23sTimp de răspuns (total)7.77sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.88sTimp de răspuns (mediu)…
570Total tokenuri de intrare…
225Tokenuri de ieșire…
1,215Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
8.7Scor mediu pe toate testele de benchmark.…
7.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
77.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)5.23sTimp de răspuns (maxim)7.26sTimp de răspuns (total)15.69sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)0msTimp de răspuns (maxim)0msTimp de răspuns (total)0msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
0msTimp de răspuns (mediu)…
0Total tokenuri de intrare…
0Tokenuri de ieșire…
0Tokenuri de raționament…
Gemini 3 PRO PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)11.96sTimp de răspuns (maxim)11.96sTimp de răspuns (total)11.96sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
11.96sTimp de răspuns (mediu)…
5,556Total tokenuri de intrare…
324Tokenuri de ieșire…
971Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)9.84sTimp de răspuns (maxim)9.84sTimp de răspuns (total)9.84sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)90.14sTimp de răspuns (maxim)90.14sTimp de răspuns (total)90.14sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
90.14sTimp de răspuns (mediu)…
218Total tokenuri de intrare…
1,692Tokenuri de ieșire…
10,014Tokenuri de raționament…
Gemini 3 PRO PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)0msTimp de răspuns (maxim)0msTimp de răspuns (total)0msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
0msTimp de răspuns (mediu)…
0Total tokenuri de intrare…
0Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)40.17sTimp de răspuns (maxim)40.17sTimp de răspuns (total)40.17sUn test este considerat trecut complet doar dacă toate rulările lui trec.…