Gemini 3.5 Flash (minimal) vs GLM 5 Turbo (medium)
GLM 5 Turbo (medium) conduce la scorul mediu cu 7.6 vs 6.8. Gemini 3.5 Flash (minimal) are costul de benchmark mai mic, $0.300 vs $0.323. Gemini 3.5 Flash (minimal) este mai rapid cu 2.65s vs 23.00s, cu rate de reușită de 65.2% vs 71.2%.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la:
2026-07-25
⋮⋮
Rang
#96
Total tokenuri de ieșire
16,454
Timp de răspuns (mediu)
2.65s
Cost total
$0.300
⋮⋮
Rang
#56
Total tokenuri de ieșire
74,522
Timp de răspuns (mediu)
23.00s
Cost total
$0.323
Model recomandatGemini 3.5 Flash (minimal)
Scorul rămâne aproape de cel mai bun scor de aici (6.8 vs 7.6) și răspunde de aproximativ 8.7x mai rapid decât GLM 5 Turbo (medium).
GLM 5 TurboGLM 5 TurbomediumModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.Lansare: 2026-03-15
Scor
6.8Scor mediu pe toate testele de benchmark.…
7.6Scor mediu pe toate testele de benchmark.…
Rang
#96
#56
Fiabilitate
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
9.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
8.1Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 5Apel de instrument invalid: 2Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)2.65sTimp de răspuns (maxim)25.26sTimp de răspuns (total)58.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 4Nu a urmat instrucțiunile: 1Fără răspuns: 1Timp expirat: 1Timp de răspuns (mediu)23.00sTimp de răspuns (maxim)194.23sTimp de răspuns (total)482.97sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
65.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
71.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
4Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
66Rulări totale…
63Rulări totale…
Cost per rezultat
2.138Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
2.011Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.300Cost total (preț curent)…
$0.323Cost total (preț curent)…
Preț de intrare
$1.500 / 1MPreț de intrare…
$1.200 / 1MPreț de intrare…
Preț de ieșire
$9.000 / 1MPreț de ieșire…
$4.000 / 1MPreț de ieșire…
Total tokenuri de intrare
100,753Total tokenuri de intrare…
35,593Total tokenuri de intrare…
Tokenuri de ieșire
16,454Tokenuri de ieșire…
12,245Tokenuri de ieșire…
Tokenuri de raționament
0Tokenuri de raționament…
62,277Tokenuri de raționament…
Timp de răspuns (mediu)
2.65sTimp de răspuns (mediu)…
23.00sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
25.26sTimp de răspuns (maxim)…
194.23sTimp de răspuns (maxim)…
Timp de răspuns (total)
58.27sTimp de răspuns (total)…
482.97sTimp de răspuns (total)…
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)892msTimp de răspuns (maxim)1.38sTimp de răspuns (total)3.57sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
892msTimp de răspuns (mediu)…
492Total tokenuri de intrare…
405Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.82sTimp de răspuns (maxim)7.69sTimp de răspuns (total)19.26sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)2.75sTimp de răspuns (maxim)5.51sTimp de răspuns (total)8.26sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.75sTimp de răspuns (mediu)…
8,122Total tokenuri de intrare…
3,456Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
8.2Scor mediu pe toate testele de benchmark.…
9.3Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)45.90sTimp de răspuns (maxim)95.57sTimp de răspuns (total)137.71sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Apel de instrument invalid: 2Timp de răspuns (mediu)14.41sTimp de răspuns (maxim)25.26sTimp de răspuns (total)28.81sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
14.41sTimp de răspuns (mediu)…
76,686Total tokenuri de intrare…
11,581Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
5.0Scor mediu pe toate testele de benchmark.…
5.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
50.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)13.88sTimp de răspuns (maxim)13.88sTimp de răspuns (total)13.88sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)1.66sTimp de răspuns (maxim)2.11sTimp de răspuns (total)3.32sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.66sTimp de răspuns (mediu)…
7,548Total tokenuri de intrare…
279Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)6.19sTimp de răspuns (maxim)6.42sTimp de răspuns (total)12.38sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)899msTimp de răspuns (maxim)1.04sTimp de răspuns (total)2.70sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
899msTimp de răspuns (mediu)…
633Total tokenuri de intrare…
12Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
2.9Scor mediu pe toate testele de benchmark.…
4.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp expirat: 1Timp de răspuns (mediu)71.07sTimp de răspuns (maxim)194.23sTimp de răspuns (total)213.22sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)922msTimp de răspuns (maxim)922msTimp de răspuns (total)922msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
922msTimp de răspuns (mediu)…
486Total tokenuri de intrare…
117Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
6.1Scor mediu pe toate testele de benchmark.…
3.1Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)10.05sTimp de răspuns (maxim)10.05sTimp de răspuns (total)10.05sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)893msTimp de răspuns (maxim)964msTimp de răspuns (total)1.79sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
893msTimp de răspuns (mediu)…
615Total tokenuri de intrare…
76Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.38sTimp de răspuns (maxim)5.70sTimp de răspuns (total)10.77sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)1.45sTimp de răspuns (maxim)2.30sTimp de răspuns (total)4.36sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.45sTimp de răspuns (mediu)…
558Total tokenuri de intrare…
282Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
8.7Scor mediu pe toate testele de benchmark.…
7.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
77.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)5.23sTimp de răspuns (maxim)7.26sTimp de răspuns (total)15.69sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.79sTimp de răspuns (maxim)2.79sTimp de răspuns (total)2.79sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
2.79sTimp de răspuns (mediu)…
5,457Total tokenuri de intrare…
234Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)9.84sTimp de răspuns (maxim)9.84sTimp de răspuns (total)9.84sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)1.76sTimp de răspuns (maxim)1.76sTimp de răspuns (total)1.76sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
1.76sTimp de răspuns (mediu)…
156Total tokenuri de intrare…
12Tokenuri de ieșire…
0Tokenuri de raționament…
GLM 5 TurboModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)40.17sTimp de răspuns (maxim)40.17sTimp de răspuns (total)40.17sUn test este considerat trecut complet doar dacă toate rulările lui trec.…