Navigatie
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

OpenAI: GPT-5.4 vs Qwen: Qwen3.7 Plus

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-06-04

Metriek GPT-5.4 GPT-5.4 medium Releasedatum: 2026-03-05 Qwen3.7 Plus Qwen3.7 Plus medium Releasedatum: 2026-06-03
Score 8.0 8.2
Rang #21 #18
Betrouwbaarheid 10.0 10.0
Consistentie 8.6 9.1
Correcte tests
Slaagpercentage per poging 76.2% 77.8%
Instabiele tests 4 2
Totaal runs 63 63
Kosten per resultaat 8.640 1.474
Totale kosten $1.210 $0.221
Invoerprijs $2.500 / 1M $0.400 / 1M
Uitvoerprijs $15.000 / 1M $1.600 / 1M
Totaal aantal invoer-tokens 34,108 40,939
Uitvoer-tokens 2,242 2,125
Redeneer-tokens 72,707 125,754
Responstijd (gem.) 22.35s 38.95s
Responstijd (max) 100.41s 178.04s
Responstijd (totaal) 469.29s 817.85s

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Anti-AI-trucs Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.4 8.3 10.0 75.0% 0 4.11s 606 240 1,511
Qwen3.7 Plus 10.0 10.0 100.0% 0 8.58s 672 195 5,065
Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
Qwen3.7 Plus 6.1 6.6 55.6% 1 108.60s 6,472 414 43,576
Gecombineerd Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.4 10.0 10.0 100.0% 0 20.57s 11,019 301 3,543
Qwen3.7 Plus 10.0 10.0 100.0% 0 65.24s 14,934 366 10,132
Gegevensparsering en extractie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.4 10.0 10.0 100.0% 0 5.32s 7,140 234 804
Qwen3.7 Plus 10.0 10.0 100.0% 0 21.75s 7,782 270 6,713
Domeinspecifiek Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.4 5.3 7.2 44.4% 1 74.27s 619 61 34,748
Qwen3.7 Plus 3.6 7.2 22.2% 1 45.35s 771 57 27,073
Algemene intelligentie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.4 4.7 3.1 33.3% 1 4.92s 477 145 321
Qwen3.7 Plus 10.0 10.0 100.0% 0 25.48s 516 123 3,998
Instructies opvolgen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.4 10.0 10.0 100.0% 0 3.11s 660 93 897
Qwen3.7 Plus 10.0 10.0 100.0% 0 16.13s 699 102 5,013
Puzzeloplossing Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.4 8.2 7.2 88.9% 1 9.14s 642 441 3,815
Qwen3.7 Plus 10.0 10.0 100.0% 0 16.38s 696 280 7,312
Toolaanroepen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.4 10.0 10.0 100.0% 0 13.28s 5,445 264 1,031
Qwen3.7 Plus 10.0 10.0 100.0% 0 15.02s 8,193 292 1,831
Algemene kennis Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.4 3.0 10.0 0.0% 0 13.95s 195 30 1,821
Qwen3.7 Plus 3.0 10.0 0.0% 0 91.07s 204 26 15,041

Snelle vergelijking

Vergelijkingspaar wisselen