Navigatie
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Vergeleken modellen

Benchmarkvergelijking Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium): GPT-5.3-Codex (medium) leidt op Score met 9.1. Claude Opus 4.6 (medium) leidt op Betrouwbaarheid met 10.0. GPT-5.3-Codex (medium) heeft de laagste Totale kosten met $1.318. GPT-5.3-Codex (medium) is het snelst met 18.87s.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-10-06

Vergeleken modellen

Rang
#228
Totaal aantal uitvoer-tokens
96,722
Responstijd (gem.)
32.23s
Totale kosten
$2.961
Rang
#212
Totaal aantal uitvoer-tokens
120,427
Responstijd (gem.)
28.08s
Totale kosten
$2.126
Rang
#34
Totaal aantal uitvoer-tokens
66,287
Responstijd (gem.)
18.87s
Totale kosten
$1.318
Rang
#71
Totaal aantal uitvoer-tokens
102,691
Responstijd (gem.)
22.71s
Totale kosten
$1.585
Aanbevolen model GPT-5.3-Codex (medium)

Het heeft hier de beste score (9.1) en kost ongeveer 1.7x minder dan de andere modellen in deze vergelijking.

Gedetailleerde vergelijking

Metriek Claude Opus 4.6 Claude Opus 4.6 medium Releasedatum: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium Releasedatum: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium Releasedatum: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Releasedatum: 2026-02-19
Score 6.3 6.4 9.1 8.4
Rang #228 #212 #34 #71
Betrouwbaarheid 10.0 10.0 10.0 9.8
Consistentie 8.5 9.1 8.6 9.6
Pogingen 66/69 66/69 69/69 69/69
Correcte tests
Slaagpercentage per poging 60.9% 62.3% 84.1% 89.9%
Instabiele tests 3 1 4 1
Totaal runs 66 66 69 69
Kosten per resultaat 22.777 15.182 7.753 7.924
Totale kosten $2.961 $2.126 $1.318 $1.585
Invoerprijs $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
Uitvoerprijs $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
Prijs voor cachelezen $0.500 / 1M $0.300 / 1M $0.175 / 1M $0.200 / 1M
Prijs voor cacheschrijven $6.250 / 1M $3.750 / 1M n.v.t. $0.375 / 1M
Totaal aantal invoer-tokens 108,573 106,316 222,794 176,208
Uitvoer-tokens 69,994 79,338 7,357 6,093
Redeneer-tokens 26,728 41,089 58,930 96,598
Responstijd (gem.) 32.23s 28.08s 18.87s 22.71s
Responstijd (max) 151.51s 140.96s 100.93s 88.68s
Responstijd (totaal) 515.65s 421.15s 433.94s 386.11s
Parameters ~5T totaal (~500B actief) ~1T totaal (~100B actief) ~1.2T totaal (~80B actief) ~1.2T totaal (~20B actief)
Beschikbaarheid Gesloten broncode Gesloten broncode Gesloten broncode Gesloten broncode

Cacheprijzen gelden voor invoertokens. Lezen hergebruikt opgeslagen prompts; schrijven slaat ze op en kan extra kosten. Voor uitvoertokens geldt de uitvoerprijs.

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#228 Claude Opus 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Kosten
$0.000
Tijd
300.0s
Tokens
0 tok

#212 Claude Sonnet 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Kosten
$0.000
Tijd
300.0s
Tokens
0 tok

#34 GPT-5.3-Codex

medium
Kosten
$0.049
Tijd
54.9s
Tokens
3,580 tok

#71 Gemini 3.1 Pro Preview

medium
Kosten
$0.115
Tijd
87.2s
Tokens
9,629 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

Snelle vergelijking

Vergelijkingspaar wisselen