Navigatie
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

OpenAI: GPT-5.4 vs Qwen: Qwen3.5 Plus 2026-04-20

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-05-22

Metriek GPT-5.4 GPT-5.4 medium Releasedatum: 2026-03-05 Qwen3.5 Plus 2026-04-20 Qwen3.5 Plus 2026-04-20 medium Releasedatum: 2026-04-20
Score 7.9 7.6
Rang #27 #42
Betrouwbaarheid 10.0 9.6
Consistentie 8.5 8.7
Correcte tests
Slaagpercentage per poging 75.0% 71.7%
Instabiele tests 4 3
Totaal runs 60 60
Kosten per resultaat 8.767 2.789
Totale kosten $1.140 $0.363
Invoerprijs $2.500 / 1M $0.300 / 1M
Uitvoerprijs $15.000 / 1M $1.800 / 1M
Uitvoer-tokens 2,222 2,245
Redeneer-tokens 68,503 150,235
Responstijd (gem.) 22.31s 43.63s
Responstijd (max) 100.41s 189.38s
Responstijd (totaal) 446.15s 872.61s

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Anti-AI-trucs Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
GPT-5.4 8.3 10.0 75.0% 0 4.11s 240 1,511
Qwen3.5 Plus 2026-04-20 10.0 10.0 100.0% 0 10.84s 215 7,748
Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
GPT-5.4 8.2 6.7 83.3% 1 54.98s 412 19,995
Qwen3.5 Plus 2026-04-20 5.4 6.0 66.7% 1 137.55s 287 42,318
Gecombineerd Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
GPT-5.4 10.0 10.0 100.0% 0 20.57s 301 3,543
Qwen3.5 Plus 2026-04-20 10.0 10.0 100.0% 0 92.41s 483 17,490
Gegevensparsering en extractie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
GPT-5.4 10.0 10.0 100.0% 0 5.32s 234 804
Qwen3.5 Plus 2026-04-20 10.0 10.0 100.0% 0 38.32s 270 14,668
Domeinspecifiek Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
GPT-5.4 5.3 7.2 44.4% 1 74.27s 61 34,748
Qwen3.5 Plus 2026-04-20 2.9 7.2 11.1% 1 53.10s 63 28,414
Algemene intelligentie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
GPT-5.4 4.7 3.1 33.3% 1 4.92s 145 321
Qwen3.5 Plus 2026-04-20 4.9 9.6 0.0% 0 25.30s 125 4,792
Instructies opvolgen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
GPT-5.4 10.0 10.0 100.0% 0 3.11s 93 897
Qwen3.5 Plus 2026-04-20 10.0 10.0 100.0% 0 20.25s 103 7,689
Puzzeloplossing Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
GPT-5.4 8.2 7.2 88.9% 1 9.13s 442 3,832
Qwen3.5 Plus 2026-04-20 8.2 7.2 88.9% 1 17.58s 324 9,786
Toolaanroepen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
GPT-5.4 10.0 10.0 100.0% 0 13.28s 264 1,031
Qwen3.5 Plus 2026-04-20 10.0 10.0 100.0% 0 14.72s 348 2,164
Algemene kennis Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
GPT-5.4 3.0 10.0 0.0% 0 13.95s 30 1,821
Qwen3.5 Plus 2026-04-20 3.0 10.0 0.0% 0 92.57s 27 15,166

Snelle vergelijking

Vergelijkingspaar wisselen