Google: Gemini 3.1 Flash Lite vs Z.ai: GLM 5V Turbo
Rezumat
Comparație benchmark Gemini 3.1 Flash Lite vs GLM 5V Turbo: GLM 5V Turbo conduce la scorul mediu cu 7.3 vs 6.4. Gemini 3.1 Flash Lite are costul de benchmark mai mic, $0.028 vs $0.457. Gemini 3.1 Flash Lite este mai rapid cu 1.89s vs 23.08s, cu rate de reușită de 61.9% vs 68.3%.
Model recomandat: Gemini 3.1 Flash Lite - Oferă cel mai bun compromis per total: scor competitiv (6.4), cost mai mic decât GLM 5V Turbo și timp de răspuns echilibrat.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-18
GLM 5V TurboGLM 5V TurbomediumModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.Lansare: 2026-04-01
Scor
6.4Scor mediu pe toate testele de benchmark.…
7.3Scor mediu pe toate testele de benchmark.…
Rang
#85
#56
Fiabilitate
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
9.3Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
7.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 9Timp de răspuns (mediu)1.89sTimp de răspuns (maxim)5.66sTimp de răspuns (total)39.62sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 7Apel de instrument invalid: 2Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)23.08sTimp de răspuns (maxim)95.88sTimp de răspuns (total)484.63sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
61.9%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
68.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
6Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
63Rulări totale…
63Rulări totale…
Cost per rezultat
0.227Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
4.151Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.028Cost total (preț curent)…
$0.457Cost total (preț curent)…
Preț de intrare
$0.250 / 1MPreț de intrare…
$1.200 / 1MPreț de intrare…
Preț de ieșire
$1.500 / 1MPreț de ieșire…
$4.000 / 1MPreț de ieșire…
Total tokenuri de intrare
36,892Total tokenuri de intrare…
44,615Total tokenuri de intrare…
Tokenuri de ieșire
2,732Tokenuri de ieșire…
2,347Tokenuri de ieșire…
Tokenuri de raționament
9,260Tokenuri de raționament…
98,415Tokenuri de raționament…
Timp de răspuns (mediu)
1.89sTimp de răspuns (mediu)…
23.08sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
5.66sTimp de răspuns (maxim)…
95.88sTimp de răspuns (maxim)…
Timp de răspuns (total)
39.62sTimp de răspuns (total)…
484.63sTimp de răspuns (total)…
Prezentare generare
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
6.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
75.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)1.84sTimp de răspuns (maxim)3.08sTimp de răspuns (total)7.37sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.84sTimp de răspuns (mediu)…
500Total tokenuri de intrare…
1,013Tokenuri de ieșire…
1,548Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
7.2Scor mediu pe toate testele de benchmark.…
6.1Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
75.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)10.76sTimp de răspuns (maxim)14.40sTimp de răspuns (total)43.02sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)1.53sTimp de răspuns (maxim)1.97sTimp de răspuns (total)4.58sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.53sTimp de răspuns (mediu)…
8,132Total tokenuri de intrare…
471Tokenuri de ieșire…
1,072Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
6.0Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
55.6%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)63.38sTimp de răspuns (maxim)95.88sTimp de răspuns (total)190.15sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)4.48sTimp de răspuns (maxim)4.48sTimp de răspuns (total)4.48sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.48sTimp de răspuns (mediu)…
12,870Total tokenuri de intrare…
348Tokenuri de ieșire…
975Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
6.9Scor mediu pe toate testele de benchmark.…
3.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Apel de instrument invalid: 1Timp de răspuns (mediu)15.06sTimp de răspuns (maxim)15.06sTimp de răspuns (total)15.06sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)1.44sTimp de răspuns (maxim)1.51sTimp de răspuns (total)2.89sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.44sTimp de răspuns (mediu)…
7,453Total tokenuri de intrare…
291Tokenuri de ieșire…
697Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)9.60sTimp de răspuns (maxim)9.92sTimp de răspuns (total)19.19sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)1.52sTimp de răspuns (maxim)1.63sTimp de răspuns (total)4.57sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.52sTimp de răspuns (mediu)…
639Total tokenuri de intrare…
15Tokenuri de ieșire…
1,214Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
5.3Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)38.15sTimp de răspuns (maxim)67.08sTimp de răspuns (total)114.45sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)1.37sTimp de răspuns (maxim)1.37sTimp de răspuns (total)1.37sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.37sTimp de răspuns (mediu)…
492Total tokenuri de intrare…
69Tokenuri de ieșire…
438Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)11.09sTimp de răspuns (maxim)11.09sTimp de răspuns (total)11.09sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)1.52sTimp de răspuns (maxim)1.68sTimp de răspuns (total)3.04sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.52sTimp de răspuns (mediu)…
619Total tokenuri de intrare…
72Tokenuri de ieșire…
760Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
9.9Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.74sTimp de răspuns (maxim)5.23sTimp de răspuns (total)7.47sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)1.40sTimp de răspuns (maxim)1.41sTimp de răspuns (total)4.20sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.40sTimp de răspuns (mediu)…
570Total tokenuri de intrare…
210Tokenuri de ieșire…
1,191Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
7.7Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)10.24sTimp de răspuns (maxim)16.95sTimp de răspuns (total)30.72sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.66sTimp de răspuns (maxim)5.66sTimp de răspuns (total)5.66sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.66sTimp de răspuns (mediu)…
5,457Total tokenuri de intrare…
234Tokenuri de ieșire…
945Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
7.0Scor mediu pe toate testele de benchmark.…
3.7Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Apel de instrument invalid: 1Timp de răspuns (mediu)12.53sTimp de răspuns (maxim)12.53sTimp de răspuns (total)12.53sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)1.46sTimp de răspuns (maxim)1.46sTimp de răspuns (total)1.46sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.46sTimp de răspuns (mediu)…
160Total tokenuri de intrare…
9Tokenuri de ieșire…
420Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)40.96sTimp de răspuns (maxim)40.96sTimp de răspuns (total)40.96sUn test este considerat trecut complet doar dacă toate rulările lui trec.…