Navigation
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Verglichene Modelle

Benchmark-Vergleich GLM 5.3 Flash (max) vs DeepSeek V4 Flash 0731 (high) vs Qwen3.8 27B (high) vs GLM 5.3 (high): GLM 5.3 Flash (max) führt bei Punktzahl mit 8.7. GLM 5.3 Flash (max) führt bei Zuverlässigkeit mit 10.0. DeepSeek V4 Flash 0731 (high) hat den niedrigsten Gesamtkosten mit $0.058. GLM 5.3 (high) ist mit 27.82s am schnellsten.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-08-26

Rang
#29
Gesamte Ausgabe-Token
204,340
Antwortzeit (Durchschnitt)
52.10s
Gesamtkosten
$0.059
Rang
#55
Gesamte Ausgabe-Token
513,307
Antwortzeit (Durchschnitt)
114.94s
Gesamtkosten
$0.058
Rang
#43
Gesamte Ausgabe-Token
656,635
Antwortzeit (Durchschnitt)
167.89s
Gesamtkosten
~$0.287
Rang
#100
Gesamte Ausgabe-Token
63,667
Antwortzeit (Durchschnitt)
27.82s
Gesamtkosten
$0.403
Empfohlenes Modell GLM 5.3 Flash (max)

Es hat hier die beste Punktzahl (8.7) und kostet etwa 4.3x weniger als die anderen Modelle in diesem Vergleich.

Detaillierter Vergleich

Metrik GLM 5.3 Flash GLM 5.3 Flash max Veröffentlichung: 2026-08-26 DeepSeek V4 Flash 0731 DeepSeek V4 Flash 0731 high Veröffentlichung: 2026-08-01 Qwen3.8 27B Qwen3.8 27B high Veröffentlichung: 2026-08-14 GLM 5.3 GLM 5.3 high Veröffentlichung: 2026-08-20
Punktzahl 8.7 8.0 8.4 7.3
Rang #29 #55 #43 #100
Zuverlässigkeit 10.0 10.0 9.6 10.0
Konsistenz 8.9 8.0 9.2 7.5
Versuche 66/66 66/66 66/66 66/66
Korrekte Tests
Erfolgsquote pro Versuch 81.8% 75.8% 77.3% 74.2%
Instabile Tests 3 5 2 7
Gesamtläufe 66 66 66 66
Kosten pro Ergebnis 0.365 0.956 ~1.792 3.099
Gesamtkosten $0.059 $0.058 ~$0.287 $0.403
Eingabepreis $0.075 / 1M $0.060 / 1M k. A. $1.400 / 1M
Ausgabepreis $0.250 / 1M $0.120 / 1M k. A. $4.400 / 1M
Gesamte Eingabe-Token 96,873 96,702 100,179 87,601
Ausgabe-Token 7,637 16,966 904 6,006
Denk-Token 196,703 496,341 655,731 57,661
Antwortzeit (Durchschnitt) 52.10s 114.94s 167.89s 27.82s
Antwortzeit (Maximum) 333.47s 600.61s 640.85s 159.91s
Antwortzeit (Gesamt) 1146.24s 2528.65s 3693.54s 612.06s
Parameter 320B insgesamt (18B aktiv) 284B insgesamt (13B aktiv) 27.3B 744B insgesamt (40B aktiv)
Verfügbarkeit Open Source Geschlossen Gewichte verfügbar Geschlossen

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#29 GLM 5.3 Flash

max
Kosten
$0.005
Zeit
296.5s
Token
16,250 tok

#55 DeepSeek V4 Flash 0731

high
Ungültiges SVG
Kosten
$0.000
Zeit
187.3s
Token
19,048 tok

#43 Qwen3.8 27B

high
Kosten
~$0.008
Zeit
270.1s
Token
18,963 tok

#100 GLM 5.3

high
Kosten
$0.085
Zeit
362.5s
Token
19,310 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
GLM 5.3 Flash 10.0 10.0 100.0% 0 43.37s 7,317 381 23,692
DeepSeek V4 Flash 0731 6.3 6.3 55.6% 1 252.67s 7,044 2,160 191,210
Qwen3.8 27B 8.1 7.0 88.9% 1 248.62s 8,235 346 143,335
GLM 5.3 6.6 5.0 66.7% 2 18.89s 7,317 473 8,190

Schnellvergleich

Vergleichspaar wechseln