Navigation
Advertise here

DeepSeek V4 Flash 0731 (low) vs GLM 5.3 FlashX (high)

Der Durchschnittsscore ist mit 7.4 vs 7.4 praktisch gleichauf. GLM 5.3 FlashX (high) hat die niedrigeren Benchmark-Kosten mit $0.210 vs $0.307. GLM 5.3 FlashX (high) ist schneller mit 14.94s vs 88.15s, mit Erfolgsraten von 71.0% vs 69.6%.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-10-01

Verglichene Modelle

Rang
#124
Gesamte Ausgabe-Token
414,035
Antwortzeit (Durchschnitt)
88.15s
Gesamtkosten
$0.307
Rang
#126
Gesamte Ausgabe-Token
97,728
Antwortzeit (Durchschnitt)
14.94s
Gesamtkosten
$0.210
Empfohlenes Modell GLM 5.3 FlashX (high)

Es hat hier die beste Punktzahl (7.4) und antwortet etwa 5.9x schneller als DeepSeek V4 Flash 0731 (low).

Detaillierter Vergleich

Metrik DeepSeek V4 Flash 0731 DeepSeek V4 Flash 0731 low Veröffentlichung: 2026-08-01 GLM 5.3 FlashX GLM 5.3 FlashX high Veröffentlichung: 2026-09-21
Punktzahl 7.4 7.4
Rang #124 #126
Zuverlässigkeit 10.0 10.0
Konsistenz 8.0 8.2
Versuche 69/69 69/69
Korrekte Tests
Erfolgsquote pro Versuch 71.0% 69.6%
Instabile Tests 6 5
Gesamtläufe 69 69
Kosten pro Ergebnis 0.840 1.612
Gesamtkosten $0.307 $0.210
Eingabepreis $0.010 / 1M $0.370 / 1M
Ausgabepreis $1.280 / 1M $1.250 / 1M
Gesamte Eingabe-Token 231,356 235,914
Ausgabe-Token 43,054 8,147
Denk-Token 370,981 89,581
Antwortzeit (Durchschnitt) 88.15s 14.94s
Antwortzeit (Maximum) 438.65s 91.16s
Antwortzeit (Gesamt) 2027.36s 343.65s
Parameter 284B insgesamt (13B aktiv) 320B insgesamt (18B aktiv)
Verfügbarkeit Geschlossen Geschlossen

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#124 DeepSeek V4 Flash 0731

low
No output was saved. The original provider response or failure reason is unavailable.
Kosten
$0.000
Zeit
78.1s
Token
8,090 tok

#126 GLM 5.3 FlashX

high
Kosten
$0.030
Zeit
169.4s
Token
23,950 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
DeepSeek V4 Flash 0731 7.3 5.1 77.8% 2 163.31s 5,953 782 86,028
GLM 5.3 FlashX 8.2 7.2 88.9% 1 8.06s 7,317 374 9,267

Schnellvergleich

Vergleichspaar wechseln