Navigation
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Verglichene Modelle

Benchmark-Vergleich GLM 5 (medium) vs GLM 5.1 (medium) vs Kimi K2.5 (medium) vs Qwen3.6 Plus Preview (medium): GLM 5 (medium) führt bei Punktzahl mit 7.7. GLM 5 (medium) führt bei Zuverlässigkeit mit 10.0. Qwen3.6 Plus Preview (medium) hat den niedrigsten Gesamtkosten mit $0.000. Qwen3.6 Plus Preview (medium) ist mit 15.25s am schnellsten.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-09-10

Verglichene Modelle

Rang
#92
Gesamte Ausgabe-Token
124,566
Antwortzeit (Durchschnitt)
33.54s
Gesamtkosten
$0.228
Rang
#142
Gesamte Ausgabe-Token
215,889
Antwortzeit (Durchschnitt)
58.80s
Gesamtkosten
$0.727
Rang
#147
Gesamte Ausgabe-Token
220,942
Antwortzeit (Durchschnitt)
98.19s
Gesamtkosten
$0.479
Rang
#280
Gesamte Ausgabe-Token
63,350
Antwortzeit (Durchschnitt)
15.25s
Gesamtkosten
$0.000
Empfohlenes Modell GLM 5 (medium)

Es hat hier die beste Punktzahl (7.7) und kostet etwa 2.7x weniger als die anderen Modelle in diesem Vergleich.

Detaillierter Vergleich

Metrik GLM 5 GLM 5 medium Veröffentlichung: 2026-02-12 GLM 5.1 GLM 5.1 medium Veröffentlichung: 2026-04-07 Kimi K2.5 Kimi K2.5 medium Veröffentlichung: 2026-01-27 Qwen3.6 Plus Preview Qwen3.6 Plus Preview medium Veröffentlichung: 2026-04-20 Kostenlos verfügbar
Punktzahl 7.7 7.0 7.0 4.9
Rang #92 #142 #147 #280
Zuverlässigkeit 10.0 8.1 10.0 k. A.
Konsistenz 8.1 8.4 7.0 8.6
Versuche 63/66 66/66 66/66 57/66
Korrekte Tests
Erfolgsquote pro Versuch 78.8% 65.2% 63.6% 40.9%
Instabile Tests 4 4 8 0
Gesamtläufe 63 66 66 57
Kosten pro Ergebnis 1.668 6.923 4.849 0.000
Gesamtkosten $0.228 $0.727 $0.479 $0.000
Eingabepreis $0.600 / 1M $0.966 / 1M $0.450 / 1M $0.000 / 1M
Ausgabepreis $1.920 / 1M $3.036 / 1M $2.250 / 1M $0.000 / 1M
Gesamte Eingabe-Token 35,224 82,592 118,496 32,639
Ausgabe-Token 21,570 16,089 53,522 1,153
Denk-Token 102,996 199,800 167,420 62,197
Antwortzeit (Durchschnitt) 33.54s 58.80s 98.19s 15.25s
Antwortzeit (Maximum) 99.85s 308.75s 281.00s 43.55s
Antwortzeit (Gesamt) 435.99s 1234.72s 1571.05s 182.96s
Parameter 744B insgesamt (40B aktiv) 744B insgesamt (40B aktiv) 1T insgesamt (32B aktiv) ~397B insgesamt (~17B aktiv)
Verfügbarkeit Open Source Open Source Gewichte verfügbar Geschlossen

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#92 GLM 5

medium
Kosten
$0.005
Zeit
20.7s
Token
2,068 tok

#142 GLM 5.1

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Kosten
$0.000
Zeit
300.0s
Token
0 tok

#147 MoonshotAI: Kimi K2.5

medium
Kosten
$0.030
Zeit
58.6s
Token
8,683 tok

#280 Qwen3.6 Plus Preview

medium
Für dieses Modell wurde noch kein Showcase-Ergebnis generiert.
Kosten
k. A.
Zeit
-
Token
0 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
GLM 5 10.0 10.0 100.0% 0 74.30s 7,254 2,997 52,930
GLM 5.1 4.6 3.7 44.5% 2 109.63s 5,702 4,871 37,826
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
Qwen3.6 Plus Preview 9.8 3.3 0.0% 0 0ms 0 0 0

Schnellvergleich

Vergleichspaar wechseln