Navigatie
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Claude Opus 4.8 (medium) vs Qwen3.8 Max (0902) (high)

Qwen3.8 Max (0902) (high) leidt in gemiddelde score met 8.9 vs 8.8. Claude Opus 4.8 (medium) heeft lagere benchmarkkosten met $1.983 vs $2.736. Claude Opus 4.8 (medium) is sneller met 12.97s vs 185.56s, met slagingspercentages van 83.3% vs 86.4%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-09-07

Rang
#39
Totaal aantal uitvoer-tokens
51,927
Responstijd (gem.)
12.97s
Totale kosten
$1.983
Rang
#31
Totaal aantal uitvoer-tokens
419,443
Responstijd (gem.)
185.56s
Totale kosten
$2.736
Aanbevolen model Claude Opus 4.8 (medium)

De score blijft dicht bij de beste score hier (8.8 vs 8.9) en het reageert ongeveer 14.3x sneller dan Qwen3.8 Max (0902) (high).

Gedetailleerde vergelijking

Metriek Claude Opus 4.8 Claude Opus 4.8 medium Releasedatum: 2026-05-28 Qwen3.8 Max (0902) Qwen3.8 Max (0902) high Releasedatum: 2026-09-07
Score 8.8 8.9
Rang #39 #31
Betrouwbaarheid 10.0 9.8
Consistentie 9.2 9.0
Pogingen 66/66 66/66
Correcte tests
Slaagpercentage per poging 83.3% 86.4%
Instabiele tests 2 3
Totaal runs 66 66
Kosten per resultaat 11.662 16.089
Totale kosten $1.983 $2.736
Invoerprijs $5.000 / 1M $2.000 / 1M
Uitvoerprijs $25.000 / 1M $6.000 / 1M
Totaal aantal invoer-tokens 138,448 109,226
Uitvoer-tokens 40,765 6,890
Redeneer-tokens 11,162 412,553
Responstijd (gem.) 12.97s 185.56s
Responstijd (max) 70.54s 912.78s
Responstijd (totaal) 285.29s 4082.41s
Parameters ~5T totaal (~500B actief) 2.4T totaal (~100B actief)
Beschikbaarheid Gesloten broncode Gesloten broncode

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#39 Claude Opus 4.8

medium
Kosten
$0.057
Tijd
23.1s
Tokens
2,412 tok

#31 Qwen3.8 Max (0902)

high
Reached the allocated time limit (600 seconds) without receiving showcase output.
Kosten
$0.000
Tijd
600.0s
Tokens
0 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Claude Opus 4.8 10.0 10.0 100.0% 0 15.33s 10,590 9,945 1,381
Qwen3.8 Max (0902) 10.0 10.0 100.0% 0 253.22s 8,235 418 91,734

Snelle vergelijking

Vergelijkingspaar wisselen