Navigare
AI BENCHY
Your ad here

AI BENCHY Compare

StepFun: Step 3.5 Flash vs Z.ai: GLM 5.1

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-04-29

Metrică Step 3.5 Flash Step 3.5 Flash medium Lansare: 2026-02-01 GLM 5.1 GLM 5.1 medium Lansare: 2026-04-07
Scor 7.9 7.8
Rang #40 #44
Fiabilitate N/D N/D
Consistență 9.1 8.6
Teste corecte
Rată de trecere pe încercare 70.6% 75.9%
Teste instabile 2 3
Rulări totale 49 54
Cost per rezultat 0.000 1.674
Cost total $0.000 $0.201
Preț de intrare $0.100 / 1M $1.050 / 1M
Preț de ieșire $0.300 / 1M $3.500 / 1M
Tokenuri de ieșire 71,904 8,005
Tokenuri de raționament 155,607 49,090
Timp de răspuns (mediu) 26.78s 24.13s
Timp de răspuns (maxim) 170.45s 118.52s
Timp de răspuns (total) 294.58s 410.25s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Step 3.5 Flash 10.0 10.0 100.0% 0 13.56s 14,376 17,668
GLM 5.1 10.0 10.0 100.0% 0 8.31s 401 5,122
Combinat Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Step 3.5 Flash 10.0 10.0 100.0% 0 29.57s 1,176 12,984
GLM 5.1 9.5 10.0 100.0% 0 43.11s 327 4,206
Parsare și extragere de date Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Step 3.5 Flash 10.0 10.0 100.0% 0 15.01s 600 13,886
GLM 5.1 10.0 10.0 100.0% 0 9.33s 991 4,552
Specific domeniului Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Step 3.5 Flash 5.3 7.2 44.4% 1 170.45s 45,350 90,436
GLM 5.1 5.3 10.0 33.3% 0 29.77s 969 11,314
Inteligență generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Step 3.5 Flash 5.5 10.0 0.0% 0 6.54s 2,214 2,584
GLM 5.1 10.0 10.0 100.0% 0 20.95s 2,875 2,875
Respectarea instrucțiunilor Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Step 3.5 Flash 8.5 6.8 83.3% 1 4.98s 2,284 3,412
GLM 5.1 6.4 5.8 66.7% 1 7.47s 204 1,617
Rezolvare de puzzle-uri Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Step 3.5 Flash 5.3 10.0 33.3% 0 7.72s 5,629 10,835
GLM 5.1 8.2 7.2 88.9% 1 23.85s 899 5,627
Apelare instrumente Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Step 3.5 Flash 10.0 10.0 100.0% 0 11.91s 275 3,802
GLM 5.1 3.0 10.0 0.0% 0 0ms 0 0
Programare Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Step 3.5 Flash - - - - - - - -
GLM 5.1 4.7 1.6 66.7% 1 118.52s 1,339 13,777

Comparație rapidă

Schimbă perechea de comparație