Navigation
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

GPT-5.4 (medium) vs Qwen3.8 27B (high)

GPT-5.4 (medium) führt beim Durchschnittsscore mit 8.8 vs 8.7. Qwen3.8 27B (high) hat die niedrigeren Benchmark-Kosten mit ~$0.298 vs $2.006. GPT-5.4 (medium) ist schneller mit 24.81s vs 166.34s, mit Erfolgsraten von 78.3% vs 78.3%.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-10-01

Verglichene Modelle

Rang
#50
Gesamte Ausgabe-Token
96,502
Antwortzeit (Durchschnitt)
24.81s
Gesamtkosten
$2.006
Rang
#55
Gesamte Ausgabe-Token
677,080
Antwortzeit (Durchschnitt)
166.34s
Gesamtkosten
~$0.298
Empfohlenes Modell Qwen3.8 27B (high)

Die Punktzahl bleibt nah an der besten hier (8.7 vs 8.8) und es kostet etwa 6.7x weniger als GPT-5.4 (medium).

Detaillierter Vergleich

Metrik GPT-5.4 GPT-5.4 medium Veröffentlichung: 2026-03-05 Qwen3.8 27B Qwen3.8 27B high Veröffentlichung: 2026-08-14 Kostenlos verfügbar
Punktzahl 8.8 8.7
Rang #50 #55
Zuverlässigkeit 10.0 9.7
Konsistenz 8.7 9.2
Versuche 69/69 69/69
Korrekte Tests
Erfolgsquote pro Versuch 78.3% 78.3%
Instabile Tests 4 2
Gesamtläufe 69 69
Kosten pro Ergebnis 12.535 ~1.751
Gesamtkosten $2.006 ~$0.298
Eingabepreis $2.500 / 1M k. A.
Ausgabepreis $15.000 / 1M k. A.
Gesamte Eingabe-Token 223,210 348,967
Ausgabe-Token 7,312 1,005
Denk-Token 89,190 676,075
Antwortzeit (Durchschnitt) 24.81s 166.34s
Antwortzeit (Maximum) 100.41s 640.85s
Antwortzeit (Gesamt) 570.60s 3825.81s
Parameter ~1.5T insgesamt (~100B aktiv) 27.3B
Verfügbarkeit Geschlossen Gewichte verfügbar

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#50 GPT-5.4

medium
Kosten
$0.214
Zeit
199.6s
Token
14,349 tok

#55 Qwen3.8 27B

high
Kosten
~$0.008
Zeit
270.1s
Token
18,963 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
Qwen3.8 27B 8.1 7.0 88.9% 1 248.62s 8,235 346 143,335

Schnellvergleich

Vergleichspaar wechseln

GPT-5.2mediumvsQwen3.8 27BhighKostenlos verfügbarQwen3.8 27BhighKostenlos verfügbarvsMiMo-V2.6-PromediumSeed 2.1 TurbomediumvsQwen3.8 27BhighKostenlos verfügbarGPT-6 SollowvsQwen3.8 27BhighKostenlos verfügbarGPT-5.4mediumvsQwen3.8 MAXlowDeepSeek V4.1 FlashhighvsGPT-5.4mediumDeepSeek V4.1 FlashmaxvsQwen3.8 27BhighKostenlos verfügbarMuse Spark 1.2lowvsQwen3.8 27BhighKostenlos verfügbarMuse Spark 1.2lowvsGPT-5.4mediumDeepSeek V4.1 FlashmediumvsQwen3.8 27BhighKostenlos verfügbarMuse Spark 1.1lowvsQwen3.8 27BhighKostenlos verfügbarClaude Sonnet 5.5xhighvsQwen3.8 27BhighKostenlos verfügbar