Comparație benchmark Gemini 2.5 Flash vs GLM 5V Turbo: Gemini 2.5 Flash conduce la scorul mediu cu 6.2 vs 5.9. Gemini 2.5 Flash are costul de benchmark mai mic, $0.016 vs $0.052. Gemini 2.5 Flash este mai rapid cu 875ms vs 2.99s, cu rate de reușită de 46.0% vs 38.1%.
Model recomandat: Gemini 2.5 Flash - Are cel mai bun scor aici (6.2) și costă de aproximativ 3.4x mai puțin decât GLM 5V Turbo.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-18
GLM 5V TurboGLM 5V TurbononeModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.Lansare: 2026-04-01
Scor
6.2Scor mediu pe toate testele de benchmark.…
5.9Scor mediu pe toate testele de benchmark.…
Rang
#93
#105
Fiabilitate
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
9.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 12Timp de răspuns (mediu)875msTimp de răspuns (maxim)4.39sTimp de răspuns (total)18.37sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 11Nu a urmat instrucțiunile: 2Timp de răspuns (mediu)2.99sTimp de răspuns (maxim)6.51sTimp de răspuns (total)62.74sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
46.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
38.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
63Rulări totale…
63Rulări totale…
Cost per rezultat
0.169Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
0.645Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.016Cost total (preț curent)…
$0.052Cost total (preț curent)…
Preț de intrare
$0.300 / 1MPreț de intrare…
$1.200 / 1MPreț de intrare…
Preț de ieșire
$2.500 / 1MPreț de ieșire…
$4.000 / 1MPreț de ieșire…
Total tokenuri de intrare
35,926Total tokenuri de intrare…
37,100Total tokenuri de intrare…
Tokenuri de ieșire
1,770Tokenuri de ieșire…
1,766Tokenuri de ieșire…
Tokenuri de raționament
0Tokenuri de raționament…
0Tokenuri de raționament…
Timp de răspuns (mediu)
875msTimp de răspuns (mediu)…
2.99sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
4.39sTimp de răspuns (maxim)…
6.51sTimp de răspuns (maxim)…
Timp de răspuns (total)
18.37sTimp de răspuns (total)…
62.74sTimp de răspuns (total)…
Prezentare generare
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 4Timp de răspuns (mediu)582msTimp de răspuns (maxim)844msTimp de răspuns (total)2.33sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
582msTimp de răspuns (mediu)…
492Total tokenuri de intrare…
102Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
4.8Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
25.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)3.13sTimp de răspuns (maxim)5.90sTimp de răspuns (total)12.50sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)736msTimp de răspuns (maxim)1.16sTimp de răspuns (total)2.21sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
736msTimp de răspuns (mediu)…
8,122Total tokenuri de intrare…
483Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
5.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)3.13sTimp de răspuns (maxim)5.30sTimp de răspuns (total)9.40sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)4.39sTimp de răspuns (maxim)4.39sTimp de răspuns (total)4.39sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.39sTimp de răspuns (mediu)…
12,519Total tokenuri de intrare…
366Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)6.51sTimp de răspuns (maxim)6.51sTimp de răspuns (total)6.51sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)652msTimp de răspuns (maxim)660msTimp de răspuns (total)1.30sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
652msTimp de răspuns (mediu)…
7,257Total tokenuri de intrare…
279Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.81sTimp de răspuns (maxim)5.69sTimp de răspuns (total)7.62sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
55.6%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)495msTimp de răspuns (maxim)642msTimp de răspuns (total)1.49sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
495msTimp de răspuns (mediu)…
633Total tokenuri de intrare…
12Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
5.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)2.09sTimp de răspuns (maxim)2.39sTimp de răspuns (total)6.26sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)615msTimp de răspuns (maxim)615msTimp de răspuns (total)615msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
615msTimp de răspuns (mediu)…
486Total tokenuri de intrare…
78Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
4.6Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)2.22sTimp de răspuns (maxim)2.22sTimp de răspuns (total)2.22sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)590msTimp de răspuns (maxim)622msTimp de răspuns (total)1.18sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
590msTimp de răspuns (mediu)…
615Total tokenuri de intrare…
72Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
6.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)1.97sTimp de răspuns (maxim)2.43sTimp de răspuns (total)3.93sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)604msTimp de răspuns (maxim)700msTimp de răspuns (total)1.81sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
604msTimp de răspuns (mediu)…
558Total tokenuri de intrare…
132Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
5.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)2.40sTimp de răspuns (maxim)3.81sTimp de răspuns (total)7.21sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)1.91sTimp de răspuns (maxim)1.91sTimp de răspuns (total)1.91sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.91sTimp de răspuns (mediu)…
5,088Total tokenuri de intrare…
234Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.86sTimp de răspuns (maxim)4.86sTimp de răspuns (total)4.86sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)1.15sTimp de răspuns (maxim)1.15sTimp de răspuns (total)1.15sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.15sTimp de răspuns (mediu)…
156Total tokenuri de intrare…
12Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5V TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)2.23sTimp de răspuns (maxim)2.23sTimp de răspuns (total)2.23sUn test este considerat trecut complet doar dacă toate rulările lui trec.…