Navigatie
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Qwen3.8 27B (high) vs Grok 4.5 (medium)

Grok 4.5 (medium) leidt in gemiddelde score met 8.5 vs 8.4. Qwen3.8 27B (high) heeft lagere benchmarkkosten met ~$0.287 vs $2.042. Grok 4.5 (medium) is sneller met 68.59s vs 167.89s, met slagingspercentages van 77.3% vs 83.3%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-09-28

Vergeleken modellen

Rang
#65
Totaal aantal uitvoer-tokens
656,635
Responstijd (gem.)
167.89s
Totale kosten
~$0.287
Rang
#60
Totaal aantal uitvoer-tokens
299,460
Responstijd (gem.)
68.59s
Totale kosten
$2.042
Aanbevolen model Qwen3.8 27B (high)

De score blijft dicht bij de beste score hier (8.4 vs 8.5) en het kost ongeveer 7.1x minder dan Grok 4.5 (medium).

Gedetailleerde vergelijking

Metriek Qwen3.8 27B Qwen3.8 27B high Releasedatum: 2026-08-14 Grok 4.5 Grok 4.5 medium Releasedatum: 2026-07-08
Score 8.4 8.5
Rang #65 #60
Betrouwbaarheid 9.6 10.0
Consistentie 9.2 8.9
Pogingen 66/66 66/66
Correcte tests
Slaagpercentage per poging 77.3% 83.3%
Instabiele tests 2 3
Totaal runs 66 66
Kosten per resultaat ~1.792 12.007
Totale kosten ~$0.287 $2.042
Invoerprijs n.v.t. $2.000 / 1M
Uitvoerprijs n.v.t. $6.000 / 1M
Totaal aantal invoer-tokens 100,179 122,155
Uitvoer-tokens 904 5,514
Redeneer-tokens 655,731 293,946
Responstijd (gem.) 167.89s 68.59s
Responstijd (max) 640.85s 436.38s
Responstijd (totaal) 3693.54s 1508.91s
Parameters 27.3B ~1.7T totaal (~170B actief)
Beschikbaarheid Gewichten beschikbaar Gesloten broncode

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#65 Qwen3.8 27B

high
Kosten
~$0.008
Tijd
270.1s
Tokens
18,963 tok

#60 SpaceXAI: Grok 4.5

medium
Kosten
$0.044
Tijd
59.4s
Tokens
7,512 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Qwen3.8 27B 8.1 7.0 88.9% 1 248.62s 8,235 346 143,335
Grok 4.5 7.6 7.2 77.8% 1 155.69s 9,579 390 104,634

Snelle vergelijking

Vergelijkingspaar wisselen

GPT-5.2mediumvsQwen3.8 27BhighQwen3.8 27BhighvsMiMo-V2.6-PromediumSeed 2.1 TurbomediumvsQwen3.8 27BhighDeepSeek V4.1 FlashhighvsGrok 4.5mediumDeepSeek V4.1 FlashlowvsGrok 4.5mediumMuse Spark 1.2lowvsGrok 4.5mediumQwen3.8 27BhighvsGrok 4.5lowGPT-6 SollowvsQwen3.8 27BhighQwen3.8 27BhighvsGLM 5.3 FlashXmaxQwen3.8 27BhighvsGrok 4.6mediumDeepSeek V4.1 FlashmaxvsQwen3.8 27BhighMuse Spark 1.2lowvsQwen3.8 27Bhigh